Dokumentenübersetzer¶
Der Dokumentenübersetzer ist eine webbasierte Anwendung zur Übersetzung von Texten und Dokumenten zwischen mehreren Sprachen. Eingaben erfolgen entweder als Datei (PDF, DOCX, Markdown, Text) oder als direkte Texteingabe; die Ausgabe steht als Word-, Markdown- oder HTML-Dokument zur Verfügung. Die Übersetzung selbst erfolgt über einen konfigurierbaren, OpenAI-kompatiblen LLM-Endpunkt. Charakteristisch ist die einheitliche Verarbeitungspipeline: Unabhängig vom Eingabeformat wird der Inhalt zunächst in eine strukturierte Markdown-Repräsentation überführt, anschließend abschnittsweise mit Kontextübergabe übersetzt und in das gewählte Zielformat zurückkonvertiert. Tabellen, Codeblöcke und Überschriften werden dabei strukturerhaltend behandelt.
Auf einen Blick¶
- Längere Word- und PDF-Dokumente vollständig übersetzen, ohne sie manuell in Abschnitte zerlegen zu müssen
- Beim Übersetzen den Stil des Zieltexts wählen — etwa akademisch, professionell, einfache Sprache oder technisch
- Für deutschsprachige Übersetzungen zwischen Sie- und Du-Form umschalten
- Fachbegriffe über ein eigenes Glossar konsistent halten
- Tabellen, Listen und Codeblöcke aus dem Originaldokument unverändert in der Übersetzung wiederfinden
- Zwischen über zehn Sprachen wechseln, einschließlich automatischer Erkennung der Quellsprache
- Das Ergebnis als Word, Markdown oder HTML herunterladen
Highlights¶
Im Unterschied zu einem direkten LLM-Prompt oder einem einfachen Übersetzungsskript ist die Anwendung darauf ausgelegt, vollständige Dokumente strukturerhaltend, terminologisch konsistent und mit fließendem Kontext über mehrere Abschnitte hinweg zu verarbeiten. Die folgenden Merkmale prägen das Ergebnis:
- Verarbeitung großer Dokumente — Lange Word- und PDF-Dateien werden nicht als ein einzelner Prompt verarbeitet, sondern in token-basierte Abschnitte zerlegt und parallel übersetzt. Damit lassen sich auch Dokumente jenseits typischer Kontextfenster vollständig in einem Lauf bearbeiten.
- Kontextbewusste Chunk-Übersetzung — Beim Übersetzen eines Abschnitts erhält das Modell Zusammenfassungen der vorangegangenen Abschnitte sowie die aktuelle Dokumentüberschrift als Kontext. Begriffe, Bezüge und Stil bleiben so über lange Texte hinweg einheitlich.
- Stil- und Anredeform-Steuerung — Neben einem Modus, der den Originalstil bewahrt, stehen mehrere Zielstile zur Auswahl (Akademisch, Professionell, Einfache Sprache, Technisch). Für Deutsch als Zielsprache lässt sich zwischen Sie- und Du-Form umschalten.
- Einheitliche Pipeline für alle Formate — PDF, Word, Markdown und Text durchlaufen denselben Verarbeitungsweg über eine Markdown-Zwischenstufe. Dadurch liefert die Anwendung formatübergreifend vergleichbare Ergebnisse.
- Tabellen-bewusste Verarbeitung — Markdown-Tabellen werden als zusammenhängende Einheit erkannt, ihre Struktur validiert, Kopfzeilen und Datenzeilen separat übersetzt und anschließend strukturgetreu rekonstruiert.
- Glossar für konsistente Terminologie — Eigene Begriffspaare können vor der Übersetzung hinterlegt werden und werden über alle Abschnitte hinweg angewandt.
- Anbindung an drei Gruppen externer Schnittstellen — Eingabeformate (PDF, DOCX, TXT, MD), Exportformate (Word, Markdown, HTML) und ein konfigurierbarer LLM-Endpunkt nach OpenAI-Standard.
- Strukturerhalt über die gesamte Pipeline — Überschriften, Listen, Tabellen, Codeblöcke und Hervorhebungen werden bei der Markdown-Konvertierung erkannt und in der Übersetzung wieder als entsprechende Strukturelemente ausgegeben.
- Parallelisierte Verarbeitung mit Wiederholungslogik — Mehrere Abschnitte werden gleichzeitig an den LLM-Endpunkt übergeben; fehlgeschlagene Anfragen werden mit exponentiellem Backoff wiederholt, ohne dass der Gesamtlauf abbricht.