Zum Inhalt

Recherche-Tool

Das Recherche-Tool ist eine Anwendung für autonome, mehrstufige Recherche und Analyse mit LLM-Unterstützung. Eine Anfrage wird nicht in einem Schritt an ein Sprachmodell weitergegeben, sondern durchläuft eine agentische Pipeline aus Planung, Suche über mehrere Konnektoren, Extraktion, Lückenanalyse und Synthese. Neben offener Web-Recherche werden Modi für hochschulinterne Recherchen, Literaturarbeit und strukturierte Analysen bereitgestellt.

Auf einen Blick

  • Recherche-Berichte zu offenen Fragestellungen erstellen — von der Anfrage bis zum gegliederten Bericht mit eingebetteten Quellenlinks läuft alles automatisch.
  • Hochschulinterne Recherchen durchführen — Personen, Einrichtungen und Webinhalte der Universität werden gemeinsam ausgewertet und mit dem verifizierten Personenverzeichnis abgeglichen.
  • Literaturlisten prüfen — vorhandene Bibliographien werden eintragsweise gegen mehrere wissenschaftliche Datenbanken validiert, fehlende DOIs ergänzt, Abweichungen markiert.
  • Literatur zu einer Forschungsfrage finden — Treffer werden nach Zitationen gewichtet und auf Relevanz geprüft.
  • Strukturierte Analysen erstellen — Tiefenerklärung, virtuelles Peer Review, Entscheidungsanalyse, Forschungsdesign und Literature Review als eigenständige Modi.
  • Eigene Dokumente einbeziehen — hochgeladene PDFs, Word-, PowerPoint- und Excel-Dateien fließen als Kontext in die Recherche ein.
  • Berichte exportieren — Markdown direkt im Browser, Word-Dokument mit klickbaren Hyperlinks und Anhang.

Highlights

Im Unterschied zu einem direkten LLM-Prompt oder einer einfachen Suchmaschinen-Abfrage liefert das Recherche-Tool einen reproduzierbaren, mehrstufigen Lauf mit nachvollziehbaren Quellen. Die folgenden Eigenschaften unterscheiden die Anwendung von einfacheren Alternativen und beeinflussen direkt die Qualität der erzeugten Berichte:

  • Agentische Pipeline mit klar getrennten Phasen: Format-Agent, Recherche-Plan, iterative Such- und Fetch-Schleife, Faktenextraktion, Lückenanalyse und Synthese sind voneinander getrennt. Jede Phase nutzt ein eigenes Prompt-Schema, so dass Fehler in einer Stufe nicht in die nächste durchschlagen.
  • Dual-LLM-Architektur: Komplexe Aufgaben wie Plan und Synthese laufen auf einem Primary-Modell, parallelisierbare Fakten-Extraktion auf einem separat konfigurierbaren Harvest-Modell. Beide Modelle können unterschiedliche Endpunkte, Kontextgrößen und Parallelitäten haben.
  • Anbindung an zahlreiche Quellen: SearXNG-Metasuche, generischer Web-Scraper, GitHub, GitLab, Solr-Index, Elasticsearch-Index, hochschulinternes Personenverzeichnis (ZIS), WebDAV, lokale Dateien sowie wissenschaftliche Literatur-APIs (arXiv, CrossRef, OpenAlex, Semantic Scholar, DBLP, OpenLibrary).
  • Mehrsprachige Suche: Suchbegriffe werden pro Frage und Sprache getrennt erzeugt; die Pipeline erkennt themenspezifisch relevante Sprachen und vermeidet Duplikate über Sprachgrenzen hinweg.
  • Iterative Lückenanalyse: Nach jeder Recherche-Runde prüft ein eigenes LLM, welche Plan-Fragen noch nicht ausreichend beantwortet sind, und plant gezielte Folge-Anfragen oder zusätzliche URLs für die nächste Runde.
  • Hybride Personensuche mit Embedder und Reranker: Für Anfragen zum Personenverzeichnis kombiniert die Anwendung Volltextsuche, semantische Vektor-Ähnlichkeit und einen Cross-Encoder-Reranker, ergänzt um einen Namens-Hartfilter gegen Fuzzy-Match-Fehler.
  • ZIS-Gegenprüfung personenbezogener Aussagen: Treffer aus dem Web, die Personen einer Einrichtung der Universität zuordnen, werden gegen die verifizierten Verzeichnisdaten abgeglichen; Abweichungen werden im Bericht als nicht verifiziert markiert.
  • Widerspruchserkennung: Inkonsistente Aussagen zwischen den extrahierten Fakten werden erkannt und im Bericht ausgewiesen, damit sie nicht in einer geglätteten Synthese verschwinden.
  • Plan-Bestätigung vor der Recherche: Optional kann der erstellte Plan inklusive Suchstrategie eingesehen und freigegeben werden, bevor die kostenintensive Such- und Extraktionsphase startet.
  • Reproduzierbare Recherchen: Jeder Lauf wird mit Bericht, Quellen, Extrakten, Plan, Suchstrategie und Metadaten auf der Festplatte persistiert und kann später erneut aufgerufen werden.