Zum Inhalt

Funktionen

Das Recherche-Tool bietet zehn Modi für unterschiedliche Aufgabentypen — von offener Web-Recherche bis zu strukturierten Analysen. Über alle Modi hinweg werden Quellen aus mehreren Konnektoren ausgewertet, Fakten in einem mehrstufigen Verfahren extrahiert und in einen gegliederten Bericht überführt.

Anwendungsszenarien

  • Allgemeine Web-Recherche zu einer offenen Fragestellung: Ausgangslage ist eine Fragestellung ohne fest definierte Quellen. Die Anwendung erstellt einen Recherche-Plan, durchsucht das Web mit mehrsprachigen Suchbegriffen, extrahiert relevante Fakten und liefert einen gegliederten Bericht mit klickbaren Quellenangaben.
  • Hochschulinterne Recherche zu Personen und Einrichtungen: Eine Anfrage betrifft Mitarbeitende, Abteilungen oder Inhalte der Universität. Die Anwendung kombiniert das hochschulinterne Personenverzeichnis, den hochschulweiten Web-Index und Treffer von der externen Web-Suche und gleicht Aussagen mit verifizierten Verzeichnisdaten ab.
  • Prüfung einer Literaturliste vor der Einreichung: Eine bestehende Bibliographie soll auf formale Korrektheit und Auffindbarkeit geprüft werden. Die Anwendung parst die Einträge, fragt parallel mehrere wissenschaftliche Datenbanken ab, ergänzt fehlende DOIs, kennzeichnet Abweichungen feldweise und erstellt einen Korrektur-Bericht.
  • Literatursuche zum Themenüberblick: Eine Forschungsfrage soll mit aktueller Fachliteratur unterlegt werden. Die Anwendung sucht in mehreren Literatur-APIs, gewichtet Treffer nach Zitationen und prüft die Relevanz pro Treffer, ehe ein annotierter Vorschlag entsteht.
  • Strukturierte Entscheidungsanalyse: Mehrere Optionen sollen kriterienbasiert verglichen werden. Die Anwendung erzeugt einen Analyseplan aus Sub-Tasks, recherchiert je Kriterium und Option, prüft Konsistenz und liefert eine Vergleichstabelle samt erläuternder Diskussion.
  • Virtuelles Peer Review eines Manuskripts: Ein eingereichter Text soll begutachtet werden. Die Anwendung erstellt ein strukturiertes Gutachten mit isolierten Bewertungen pro Kriterium und gegliederten Anmerkungen.

Auf einen Blick

  • Zehn Modi: Web-Recherche, Hochschul-Recherche, Prüfung von Literaturlisten, Literatursuche, Tiefenerklärung, virtuelles Peer Review, Entscheidungsanalyse, Forschungsdesign, Drittmittelantrag, Literature Review.
  • Sechs Ausgabe-Vorlagen für Recherche-Modi: allgemeine Recherche, Zusammenfassung, strukturierte Übersicht, Vergleichsanalyse, Faktencheck, technische Dokumentation.
  • Mehrsprachige Suche mit pro Frage und Sprache getrennten Suchbegriffen, themenabhängiger Sprachauswahl und Sprachfilter für akademische Quellen.
  • Importformate: PDF, Word, PowerPoint, Excel, HTML, RTF, Markdown, Plain-Text und CSV als Kontextdokumente; freie Texte und URLs als Eingabe.
  • Exportformate: Markdown im Browser, Word-Export mit echten Hyperlinks und Anhang aus Quellen, Extrakten und Metadaten.
  • Qualitätssicherung: URL-Deduplizierung, Domain-Blockliste, Negativ-Extrakt-Filter, Lückenanalyse über Runden, Widerspruchserkennung, Personen-Gegenprüfung, Reliability-Stufung.
  • Persistenz pro Recherche-Lauf: Bericht, Quellen, Extrakte, Plan, Suchstrategie, Token-Verbrauch und Metadaten werden im Dateisystem abgelegt.

Konnektoren

Die Recherche stützt sich auf mehrere Konnektoren, die je Anfrage und Modus orchestriert werden. Externe Konnektoren sind unten ausführlicher beschrieben, hochschulinterne Konnektoren werden auf ihre Funktion reduziert.

Externe Konnektoren

  • SearXNG-Metasuche: Zentrale Suchschicht über eine selbst betriebene SearXNG-Instanz. Liefert Treffer aus mehreren Suchmaschinen und unterstützt Sprach-, Zeit- und Engine-Filter. Im Modus für Fachliteratur wird eine Whitelist akademischer Engines (Wikipedia, Wikidata, Google Scholar, Semantic Scholar, arXiv, PubMed) verwendet.
  • Web-Scraper: Generischer Fetcher für beliebige Webseiten. Nutzt httpx mit eigener User-Agent-Konfiguration und trafilatura für die Inhaltsextraktion. Ein Cache mit Time-to-Live, eine Per-Domain-Begrenzung der Anfragerate und ein optionaler Playwright-Fallback für stark JavaScript-basierte Seiten sind enthalten.
  • GitHub: Anbindung an die GitHub-REST-API für Repository-, Code- und Issue-Suche sowie für gezielten Abruf von README, Releases, Commits und Issues zu einem konkreten Projekt. Authentifizierung über Personal Access Token; Rate-Limit-Behandlung mit Backoff.
  • GitLab: Anbindung an die GitLab-REST-API einer konfigurierbaren Instanz, mit denselben Such- und Abrufmustern wie der GitHub-Konnektor.
  • Literatur-APIs: Parallele Abfrage von arXiv, CrossRef, OpenAlex, Semantic Scholar, DBLP und OpenLibrary für die Literaturprüfung und Literatursuche. Rate-Limiting wird über einen gemeinsamen Limiter koordiniert; Treffer werden auf Übereinstimmung mit dem ursprünglichen Eintrag bewertet.

Hochschulinterne Konnektoren

  • Personenverzeichnis (ZIS): Anbindung an das hochschulinterne Personeninformationssystem für Personen, Einrichtungen und Funktionen. Liefert Kontaktdaten, Zugehörigkeiten und Webseiten und dient gleichzeitig als Referenz für die Gegenprüfung von Aussagen aus Web-Quellen.
  • Personen-Suche (lokal): Lokaler durchsuchbarer Index aus dem Personenverzeichnis und gecrawlten Vita-/Homepage-Inhalten. Kombiniert Volltextsuche (FTS5), semantische Suche über einen Embedder und einen Cross-Encoder-Reranker.
  • Hochschul-Web-Index (Solr): Hochschulweiter Web-Index mit deutschem und englischem Kern für die Suche in den offiziellen Webinhalten der Universität.
  • Elasticsearch-Index: Optionale Anbindung an einen weiteren Volltext-Index, etwa für ein bestimmtes Webangebot oder ein redaktionelles System. Feldzuordnung ist konfigurierbar.
  • WebDAV: Optionale Anbindung an einen WebDAV-Speicher für interne Dokumentenquellen.
  • Lokale Dateien: Konnektor für hochgeladene Kontextdokumente und konfigurierbare lokale Verzeichnisse.

Import- und Exportformate

Im Eingabebereich akzeptiert die Anwendung freie Texte, URLs und hochgeladene Dokumente als Kontext. Verarbeitet werden PDF (über pdfminer mit Fallback auf eine schwergewichtige Extraktion), Word (DOCX/DOC), PowerPoint (PPTX/PPT), Excel (XLSX/XLS), HTML, RTF, Markdown, reStructuredText, Plain-Text und CSV. Die Dokumentenverarbeitung entfernt typische Artefakte wie Kopf- und Fußzeilen sowie Seitenzahlen und führt eine Deduplizierung gleicher Absätze durch.

Auf der Ausgabeseite wird der Bericht als Markdown im Browser angezeigt. Ein Export nach Word erzeugt ein strukturiertes Dokument mit klickbaren Hyperlinks im Fließtext und einem Anhang aus Quellenliste, Extrakten je Quelle, Fortschrittsprotokoll und Metadaten. Pro Recherche-Lauf wird zusätzlich ein Verzeichnis mit Bericht, Quellen-Snapshots, Extrakten und Metadaten persistiert.

Qualitätssicherung

Mehrere Mechanismen sichern die Qualität der Recherche-Ergebnisse ab und greifen an unterschiedlichen Stellen in die Pipeline ein.

  • URL-Deduplizierung und Domain-Blockliste: URLs werden vor Verarbeitung normalisiert (Protokoll, Subdomain, Pfad, Tracking-Parameter) und gegen eine Blockliste aus thematisch unpassenden, niedrigqualitativen oder typischerweise fehlerhaft gerouteten Domains geprüft.
  • Negativ-Extrakt-Filter: Aussagen, die explizit als nicht-vorhandene Information formuliert sind („keine Informationen", „nicht erwähnt"), werden vor der Synthese entfernt, damit der Bericht nicht mit Leerstellen-Beschreibungen aufgebläht wird.
  • Iterative Lückenanalyse: Nach jeder Recherche-Runde prüft ein eigenes LLM, welche Plan-Fragen noch offen sind, und plant gezielte Folge-Anfragen oder zusätzliche direkte URLs für die nächste Runde.
  • Diminishing-Returns-Erkennung: Wenn eine Runde keine neuen positiven Extrakte mehr liefert, wird die Recherche frühzeitig beendet, um unnötige Modell-Aufrufe zu vermeiden.
  • Reliability-Stufung pro Extrakt: Jedes extrahierte Fakt erhält eine Verlässlichkeitsstufe, die in die Synthese einfließt und im Extrakt-Panel angezeigt wird.
  • Personen-Gegenprüfung: Treffer aus dem Web, die eine Person der Universität zuordnen, werden gegen das verifizierte Personenverzeichnis abgeglichen; Abweichungen werden im Bericht als nicht verifiziert markiert. Ein Namens-Hartfilter verhindert Fuzzy-Match-Fehler bei der Personensuche.
  • Widerspruchserkennung: Auf den gesammelten Extrakten wird eine LLM-gestützte Widerspruchserkennung ausgeführt; identifizierte Konflikte werden im Bericht ausgewiesen.
  • Plan-Bestätigung: Optional kann der erstellte Plan vor Beginn der Such- und Extraktionsphase eingesehen und freigegeben werden.
  • Token- und Aufrufstatistik: Pro Lauf werden Anzahl der Modell-Aufrufe und Token-Verbrauch je Modell erfasst und im Bericht ausgewiesen.

Weitere Funktionen

  • Auftrag besprechen: Vor dem Start der Recherche kann die Anfrage in einem geführten Chat geschärft werden; das System schlägt im Anschluss eine konkrete Recherche-Formulierung vor.
  • Output-Vorlagen: Sechs vordefinierte Vorlagen für Recherche-Berichte (allgemeine Recherche, Zusammenfassung, strukturierte Übersicht, Vergleichsanalyse, Faktencheck, technische Dokumentation) steuern Aufbau und Stil des Berichts.
  • Modus-Filter: Zwei Schalter erlauben die Beschränkung auf hochschulinterne Quellen oder auf akademische Suchmaschinen.
  • Recherche-Historie: Frühere Läufe werden in der Seitenleiste aufgeführt und können erneut geöffnet werden.
  • Abbruch und Fortschrittsanzeige: Laufende Recherchen können jederzeit gestoppt werden; Fortschritt und Phase werden während des Laufs aktualisiert.
  • Analyse-Pipeline für strukturierte Modi: Die Analyse-Modi werden von einem DAG-Executor ausgeführt, der Sub-Tasks parallelisiert, Zwischenergebnisse als Checkpoints sichert und nach Abbruch oder Neuladen fortgesetzt werden kann.