Zum Inhalt

Funktionen

Talk to Your Documents stellt einen browserbasierten Arbeitsplatz bereit, in dem Dokumente hochgeladen, automatisch aufbereitet und anschließend per Chat befragt werden. Der Funktionsumfang gliedert sich in Dokumentenverarbeitung, Sprachmodell-Anbindung mit Quellenangaben, Sitzungs- und Export-Funktionen sowie Mechanismen zur Qualitätssicherung der zurückgegebenen Antworten.

Anwendungsszenarien

  • Strukturierte Zusammenfassung. Aus einem oder mehreren Dokumenten wird eine zusammenhängende Zusammenfassung mit nachvollziehbarer Struktur erzeugt — auf Wunsch in unterschiedlichem Detailgrad (Stichpunktliste, kurze Übersicht, kapitelweise Beschreibung).
  • Extraktion strukturierter Inhalte. Konkrete Zahlen, Daten, Fakten, mathematische Formeln, Empfehlungen oder Schlussfolgerungen lassen sich gezielt aus den Dokumenten herausziehen, ohne die Originaldatei manuell zu durchsuchen.
  • Erfassung von Verweisen und Zitationen. Literaturhinweise, Quellenangaben und Querverweise innerhalb eines Dokuments werden vollständig aufgelistet — nützlich bei der Aufbereitung wissenschaftlicher Arbeiten.
  • Vergleich mehrerer Dokumente. Inhalte verschiedener Versionen oder thematisch verwandter Dokumente werden gegenübergestellt und auf inhaltliche Unterschiede, Widersprüche oder Inkonsistenzen geprüft.
  • Kritische Reflexion. Auf Anforderung erstellt das Modell eine kritische Auseinandersetzung mit den Inhalten und benennt positive wie negative Aspekte; mehrstufige Vorgehensweisen lassen sich über entsprechende Prompts steuern.
  • Recherche zu Detailfragen. Konkrete Einzelfragen werden direkt anhand des Dokumenteninhalts beantwortet, mit Verweis auf die jeweilige Fundstelle.

Auf einen Blick

  • Verarbeitung von bis zu 25 Dokumenten gleichzeitig im selben Sitzungskontext
  • Unterstützung gängiger Bürodokumentformate sowie strukturierter Textformate (PDF, Word, Excel, PowerPoint, Text, Markdown, HTML, CSV, RTF)
  • Anbindung an OpenAI-API-kompatible Sprachmodelle (extern oder lokal betrieben)
  • Quellenangaben mit Absatz- und Seitenreferenzen, optional zuschaltbar
  • Streaming-Ausgabe mit Abbruchmöglichkeit, Echtzeit-Anzeige von Tokenverbrauch und Kontextauslastung
  • Export des Chatverlaufs als formatiertes Word-Dokument
  • Konfiguration über CLI-Argumente, Umgebungsvariablen oder Docker Compose

Dokumentenverarbeitung

Hochgeladene Dokumente durchlaufen eine einheitliche Verarbeitungspipeline, bevor sie an das Sprachmodell übergeben werden.

  • PDF. Extraktion von Fließtext, Überschriften und Seiteninformationen. Zusätzlich werden interaktive Formularfelder (AcroForm) ausgelesen, die von herkömmlichen PDF-Parsern in der Regel ignoriert werden. Seitennummern werden für die spätere Quellenangabe erfasst.
  • Word, Excel, PowerPoint. Einlesen von Word-Dokumenten (.docx, .doc), Excel-Mappen (.xlsx, .xls) und PowerPoint-Folien (.pptx, .ppt) einschließlich Tabellen- und Listenstrukturen.
  • Strukturierte Textformate. Direkte Verarbeitung von Markdown, HTML, reinem Text, RTF, CSV sowie Quellcode­dateien.
  • Bereinigung. Wiederkehrende Headers, Footers, Seitenzahlen, Wasserzeichen sowie typografische Trennlinien werden über regelbasierte Muster und Wiederholungs­analyse erkannt und entfernt.
  • Deduplizierung. Identische Inhalte werden über Hash-Vergleiche, ähnliche Inhalte über unscharfes Abgleichen mit konfigurierbarem Schwellwert (Default 0,95) erkannt und entfernt. Ergänzend werden strukturelle Wiederholungen (etwa mehrfach auftretende Tabellenköpfe) reduziert.
  • Strukturkonvertierung. Die bereinigten Inhalte werden in einheitliches Markdown überführt; Tabellen, Listen, Überschriften und gegebenenfalls Codeblöcke bleiben dabei erhalten.

Konnektoren und Datenquellen

Die Anwendung greift ausschließlich auf Inhalte zu, die ein Nutzer aktiv hochlädt. Externe Dienste werden ausschließlich für die Sprachmodell-Anbindung kontaktiert.

  • Lokaler Datei-Upload. Hochladen über die Weboberfläche aus dem Dateisystem des Nutzers; bis zu 25 Dateien je Sitzung. Unterstützte Endungen: .pdf, .docx, .doc, .xlsx, .xls, .pptx, .ppt, .txt, .md, .rst, .html, .htm, .csv, .rtf, .py.
  • Sprachmodell-Backend (extern). Die Anwendung kommuniziert über das OpenAI-API-Protokoll mit einem konfigurierbaren Inferenz-Endpunkt. Genutzt werden können kommerzielle Anbieter wie die OpenAI-API ebenso wie lokal betriebene Server, etwa Ollama oder vLLM. Endpunkt-URL, Modellname und API-Schlüssel sind frei konfigurierbar.

Quellenangaben und Nachvollziehbarkeit

Vor der Übergabe an das Sprachmodell wird jedem hinreichend langen Absatz eine eindeutige Referenz-ID in der Form [P1], [P2], [P3] … zugewiesen. Diese Marker werden in den Dokumenttext eingefügt und über einen Systemprompt an das Modell weitergegeben. Bei aktivierter Quellen-Anzeige enthalten die Antworten die Referenzen direkt im Fließtext; im Anschluss listet die Anwendung die zitierten Absätze mit Vorschau (bis 300 Zeichen), Dokumentnamen und — sofern verfügbar — Seitenzahl. Die Quellen-Anzeige lässt sich pro Anfrage ein- und ausblenden.

Sitzungs- und Kontextverwaltung

  • Tokenkontrolle. Beim Hinzufügen eines Dokuments wird dessen Tokenverbrauch geschätzt und gegen das Kontextlimit (standardmäßig 250.000 Token, mit Sicherheits­abschlag) geprüft. Anfragen, die das Kontextfenster überschreiten würden, werden abgewiesen.
  • Sitzungstrennung. Jede Browser-Sitzung erhält eine eigene UUID; Dokumente und Chatverläufe verschiedener Sitzungen sind voneinander getrennt.
  • Sitzungslose Speicherung. Hochgeladene Inhalte sowie Chatverläufe werden ausschließlich im Arbeitsspeicher des Servers vorgehalten und nach Beenden der Sitzung verworfen. Persistenz entsteht ausschließlich durch den explizit vom Nutzer ausgelösten Word-Export.

Chat und Ausgabe

  • Streaming. Antworten werden tokenweise gestreamt und in der Oberfläche fortlaufend aktualisiert.
  • Abbruchkontrolle. Eine laufende Antwort kann jederzeit über einen Stopp-Button abgebrochen werden.
  • Mathematische Notation. LaTeX-Ausdrücke werden inline und als Block direkt in der Chatansicht gerendert.
  • Beispielprompts. Eine integrierte Sammlung typischer Aufgabenstellungen (Zusammenfassung, kritische Reflexion, Versionsvergleich, Extraktion von Zahlen oder Formeln) erleichtert den Einstieg.
  • Word-Export. Der vollständige Chatverlauf einer Sitzung kann als .docx-Datei exportiert werden; Quellenangaben werden mit übernommen.

Konfiguration

Sämtliche Einstellungen — Sprachmodell-Endpunkt, Modellname, Tokenlimits, maximale Dokumentenanzahl, Bereinigungs- und Deduplizierungs­optionen, Default für die Quellen-Anzeige, Server-Port und Subpfad-Deployment hinter einem Reverse Proxy — sind über Umgebungsvariablen oder Kommandozeilen­parameter steuerbar.