Funktionen¶
Talk to Your Documents stellt einen browserbasierten Arbeitsplatz bereit, in dem Dokumente hochgeladen, automatisch aufbereitet und anschließend per Chat befragt werden. Der Funktionsumfang gliedert sich in Dokumentenverarbeitung, Sprachmodell-Anbindung mit Quellenangaben, Sitzungs- und Export-Funktionen sowie Mechanismen zur Qualitätssicherung der zurückgegebenen Antworten.
Anwendungsszenarien¶
- Strukturierte Zusammenfassung. Aus einem oder mehreren Dokumenten wird eine zusammenhängende Zusammenfassung mit nachvollziehbarer Struktur erzeugt — auf Wunsch in unterschiedlichem Detailgrad (Stichpunktliste, kurze Übersicht, kapitelweise Beschreibung).
- Extraktion strukturierter Inhalte. Konkrete Zahlen, Daten, Fakten, mathematische Formeln, Empfehlungen oder Schlussfolgerungen lassen sich gezielt aus den Dokumenten herausziehen, ohne die Originaldatei manuell zu durchsuchen.
- Erfassung von Verweisen und Zitationen. Literaturhinweise, Quellenangaben und Querverweise innerhalb eines Dokuments werden vollständig aufgelistet — nützlich bei der Aufbereitung wissenschaftlicher Arbeiten.
- Vergleich mehrerer Dokumente. Inhalte verschiedener Versionen oder thematisch verwandter Dokumente werden gegenübergestellt und auf inhaltliche Unterschiede, Widersprüche oder Inkonsistenzen geprüft.
- Kritische Reflexion. Auf Anforderung erstellt das Modell eine kritische Auseinandersetzung mit den Inhalten und benennt positive wie negative Aspekte; mehrstufige Vorgehensweisen lassen sich über entsprechende Prompts steuern.
- Recherche zu Detailfragen. Konkrete Einzelfragen werden direkt anhand des Dokumenteninhalts beantwortet, mit Verweis auf die jeweilige Fundstelle.
Auf einen Blick¶
- Verarbeitung von bis zu 25 Dokumenten gleichzeitig im selben Sitzungskontext
- Unterstützung gängiger Bürodokumentformate sowie strukturierter Textformate (PDF, Word, Excel, PowerPoint, Text, Markdown, HTML, CSV, RTF)
- Anbindung an OpenAI-API-kompatible Sprachmodelle (extern oder lokal betrieben)
- Quellenangaben mit Absatz- und Seitenreferenzen, optional zuschaltbar
- Streaming-Ausgabe mit Abbruchmöglichkeit, Echtzeit-Anzeige von Tokenverbrauch und Kontextauslastung
- Export des Chatverlaufs als formatiertes Word-Dokument
- Konfiguration über CLI-Argumente, Umgebungsvariablen oder Docker Compose
Dokumentenverarbeitung¶
Hochgeladene Dokumente durchlaufen eine einheitliche Verarbeitungspipeline, bevor sie an das Sprachmodell übergeben werden.
- PDF. Extraktion von Fließtext, Überschriften und Seiteninformationen. Zusätzlich werden interaktive Formularfelder (AcroForm) ausgelesen, die von herkömmlichen PDF-Parsern in der Regel ignoriert werden. Seitennummern werden für die spätere Quellenangabe erfasst.
- Word, Excel, PowerPoint. Einlesen von Word-Dokumenten (
.docx,.doc), Excel-Mappen (.xlsx,.xls) und PowerPoint-Folien (.pptx,.ppt) einschließlich Tabellen- und Listenstrukturen. - Strukturierte Textformate. Direkte Verarbeitung von Markdown, HTML, reinem Text, RTF, CSV sowie Quellcodedateien.
- Bereinigung. Wiederkehrende Headers, Footers, Seitenzahlen, Wasserzeichen sowie typografische Trennlinien werden über regelbasierte Muster und Wiederholungsanalyse erkannt und entfernt.
- Deduplizierung. Identische Inhalte werden über Hash-Vergleiche, ähnliche Inhalte über unscharfes Abgleichen mit konfigurierbarem Schwellwert (Default 0,95) erkannt und entfernt. Ergänzend werden strukturelle Wiederholungen (etwa mehrfach auftretende Tabellenköpfe) reduziert.
- Strukturkonvertierung. Die bereinigten Inhalte werden in einheitliches Markdown überführt; Tabellen, Listen, Überschriften und gegebenenfalls Codeblöcke bleiben dabei erhalten.
Konnektoren und Datenquellen¶
Die Anwendung greift ausschließlich auf Inhalte zu, die ein Nutzer aktiv hochlädt. Externe Dienste werden ausschließlich für die Sprachmodell-Anbindung kontaktiert.
- Lokaler Datei-Upload. Hochladen über die Weboberfläche aus dem Dateisystem des Nutzers; bis zu 25 Dateien je Sitzung. Unterstützte Endungen:
.pdf,.docx,.doc,.xlsx,.xls,.pptx,.ppt,.txt,.md,.rst,.html,.htm,.csv,.rtf,.py. - Sprachmodell-Backend (extern). Die Anwendung kommuniziert über das OpenAI-API-Protokoll mit einem konfigurierbaren Inferenz-Endpunkt. Genutzt werden können kommerzielle Anbieter wie die OpenAI-API ebenso wie lokal betriebene Server, etwa Ollama oder vLLM. Endpunkt-URL, Modellname und API-Schlüssel sind frei konfigurierbar.
Quellenangaben und Nachvollziehbarkeit¶
Vor der Übergabe an das Sprachmodell wird jedem hinreichend langen Absatz eine eindeutige Referenz-ID in der Form [P1], [P2], [P3] … zugewiesen. Diese Marker werden in den Dokumenttext eingefügt und über einen Systemprompt an das Modell weitergegeben. Bei aktivierter Quellen-Anzeige enthalten die Antworten die Referenzen direkt im Fließtext; im Anschluss listet die Anwendung die zitierten Absätze mit Vorschau (bis 300 Zeichen), Dokumentnamen und — sofern verfügbar — Seitenzahl. Die Quellen-Anzeige lässt sich pro Anfrage ein- und ausblenden.
Sitzungs- und Kontextverwaltung¶
- Tokenkontrolle. Beim Hinzufügen eines Dokuments wird dessen Tokenverbrauch geschätzt und gegen das Kontextlimit (standardmäßig 250.000 Token, mit Sicherheitsabschlag) geprüft. Anfragen, die das Kontextfenster überschreiten würden, werden abgewiesen.
- Sitzungstrennung. Jede Browser-Sitzung erhält eine eigene UUID; Dokumente und Chatverläufe verschiedener Sitzungen sind voneinander getrennt.
- Sitzungslose Speicherung. Hochgeladene Inhalte sowie Chatverläufe werden ausschließlich im Arbeitsspeicher des Servers vorgehalten und nach Beenden der Sitzung verworfen. Persistenz entsteht ausschließlich durch den explizit vom Nutzer ausgelösten Word-Export.
Chat und Ausgabe¶
- Streaming. Antworten werden tokenweise gestreamt und in der Oberfläche fortlaufend aktualisiert.
- Abbruchkontrolle. Eine laufende Antwort kann jederzeit über einen Stopp-Button abgebrochen werden.
- Mathematische Notation. LaTeX-Ausdrücke werden inline und als Block direkt in der Chatansicht gerendert.
- Beispielprompts. Eine integrierte Sammlung typischer Aufgabenstellungen (Zusammenfassung, kritische Reflexion, Versionsvergleich, Extraktion von Zahlen oder Formeln) erleichtert den Einstieg.
- Word-Export. Der vollständige Chatverlauf einer Sitzung kann als
.docx-Datei exportiert werden; Quellenangaben werden mit übernommen.
Konfiguration¶
Sämtliche Einstellungen — Sprachmodell-Endpunkt, Modellname, Tokenlimits, maximale Dokumentenanzahl, Bereinigungs- und Deduplizierungsoptionen, Default für die Quellen-Anzeige, Server-Port und Subpfad-Deployment hinter einem Reverse Proxy — sind über Umgebungsvariablen oder Kommandozeilenparameter steuerbar.