Funktionen¶
Der Funktionsumfang umfasst die Aufnahme von Texten und Dokumenten in mehreren Eingabeformaten, deren Übersetzung mit wählbarem Stil und Anredeform, qualitätssichernde Mechanismen für Struktur und Terminologie sowie den Export in verschiedene Zielformate. Die Bedienung erfolgt über eine zweispaltige Weboberfläche mit Original- und Übersetzungsansicht.
Anwendungsszenarien¶
- Übersetzung wissenschaftlicher Texte — Längere Aufsätze, Berichte oder Manuskripte werden im akademischen Stil in eine andere Sprache überführt; Tabellen, Fußnoten und strukturelle Elemente bleiben erhalten.
- Verwaltungsdokumente und Geschäftskorrespondenz — Schreiben, Richtlinien oder Formulare aus Verwaltungskontexten lassen sich in der professionellen Sie-Form ins Deutsche oder aus dem Deutschen in andere Sprachen übersetzen.
- Übersetzung ins Deutsche für internationale Studierende — Englisch-, spanisch- oder französischsprachige Materialien werden ins Deutsche überführt, wahlweise in der formellen Sie-Form (für offizielle Dokumente) oder in der vertrauten Du-Form (für Tutorials und informelle Kommunikation).
- Technische Dokumentation — Anleitungen und technische Beschreibungen werden im Modus „Technisch" übersetzt; gängige englische Fachbegriffe werden auf Wunsch unverändert übernommen, Codeblöcke bleiben strukturerhaltend bestehen.
- Übersetzung in einfache Sprache — Komplexe Vorlagen lassen sich beim Übersetzen zugleich vereinfachen, sodass Inhalte in einer leichter verständlichen Form vorliegen.
- Spontane Textübersetzungen — Kürzere Texte können direkt in das Eingabefeld eingegeben werden, ohne dass eine Datei erstellt werden muss.
Auf einen Blick¶
- Eingabeformate: PDF, DOCX, TXT, Markdown sowie direkte Texteingabe
- Exportformate: Word (.docx), Markdown (.md), HTML
- Zwölf unterstützte Sprachen plus automatische Spracherkennung
- Zwei Übersetzungsmodi: stil-erhaltend oder stil-anpassend mit fünf Zielstilen
- Sie-/Du-Steuerung für deutschsprachige Übersetzungen
- Glossarunterstützung für eigene Begriffspaare
- Strukturerhalt für Tabellen, Codeblöcke, Listen und Überschriften
- Side-by-Side-Ansicht von Original und Übersetzung mit Fortschrittsanzeige
Eingabe und Ausgabe¶
Eingaben erfolgen entweder über einen Datei-Upload (Drag-and-Drop) oder über ein Textfeld. Folgende Eingabeformate werden unterstützt:
- PDF: Verarbeitung über pymupdf4llm, das eine LLM-orientierte Markdown-Extraktion liefert; falls die Bibliothek nicht verfügbar ist, fällt die Anwendung auf PyMuPDF zurück. Tabellen, Überschriften und Listen werden bei der Konvertierung erkannt.
- DOCX (Word): Strukturierte Extraktion über python-docx, einschließlich Absatzformatierungen, Tabellen, Listen und Überschriften.
- Markdown (.md) und Text (.txt): Übernahme als Markdown-Quelle ohne weitere Konvertierung; Strukturelemente werden direkt aus den Markdown-Auszeichnungen abgeleitet.
- Direkte Texteingabe: Texte können in einem Eingabefeld der Bedienoberfläche eingegeben werden und durchlaufen denselben Verarbeitungsweg wie Dateieingaben.
Auf der Ausgabeseite stehen folgende Formate zur Verfügung:
- Word (.docx): Strukturierte Word-Datei mit konfigurierbarer Standardschriftart und übernommener Dokumentstruktur (Überschriften, Listen, Tabellen).
- Markdown (.md): Reine Markdown-Ausgabe, optional mit Metadaten zum Übersetzungslauf.
- HTML: Ausgabe als HTML-Dokument; nutzbar als druck- und PDF-fähige Alternative.
LLM-Anbindung¶
Der Übersetzungsdienst wird über einen LLM-Endpunkt im OpenAI-Chat-Completions-Format angesprochen. Damit ist die Anwendung mit lokal oder zentral betriebenen Modell-Servern kompatibel — etwa Ollama, vLLM, LM Studio, Text Generation Web UI sowie der OpenAI-API selbst. Endpunkt, Modellname, Temperatur, Token-Grenzen, Timeout und Wiederholungsverhalten sind frei konfigurierbar.
Übersetzungsmodi und Stilsteuerung¶
Die Anwendung bietet zwei grundsätzliche Modi:
- Direkte Übersetzung: Stil, Tonalität und Formalitätsgrad des Originals werden so weit wie möglich in die Zielsprache übertragen.
- Stil-angepasste Übersetzung: Der Zieltext wird zusätzlich an einen vom Nutzer gewählten Stil angepasst. Verfügbar sind die Stile Akademisch, Professionell (Sie), Professionell (Du), Einfache Sprache und Technisch.
Für Deutsch als Zielsprache wirkt sich die Stilauswahl auch auf die Anredeform aus (Sie-Form oder Du-Form). Der zugrundeliegende Übersetzungs-Prompt ist als Textdatei hinterlegt und enthält detaillierte Vorgaben zu Genauigkeit, Strukturerhalt, Anredeform, kultureller Anpassung und der Behandlung von Eigennamen, URLs, Zahlen und Akronymen.
Qualitätssicherung¶
Mehrere Mechanismen sichern die Qualität und Vollständigkeit langer Übersetzungen ab:
- Token-bewusstes Chunking: Texte werden in Abschnitte segmentiert, deren Länge an das sprach-spezifische Zeichen-pro-Token-Verhältnis angepasst ist. Schnittpunkte folgen Satz- und Absatzgrenzen, sodass Sätze nicht zerschnitten werden.
- Tabellen-bewusste Behandlung: Markdown-Tabellen werden als Einheit erkannt; Struktur und Spaltenanzahl werden vor und nach der Übersetzung validiert. Kopfzeilen und Datenzeilen werden separat übersetzt und anschließend strukturgetreu zusammengefügt.
- Codeblock-Erhalt: Codeblöcke werden als solche erkannt und bei der Übersetzung gesondert behandelt; nur Kommentare und Bezeichner werden — soweit sinnvoll — übersetzt, der Code selbst bleibt unverändert.
- Kontextübergabe zwischen Abschnitten: Beim Übersetzen eines Abschnitts erhält das LLM eine Zusammenfassung der zuletzt übersetzten Abschnitte sowie die aktuelle Überschrift als Kontext. So bleiben Terminologie, Bezüge und Stil über das gesamte Dokument hinweg einheitlich.
- Glossar-Anwendung: Hinterlegte Begriffspaare werden dem LLM in jeder Übersetzungsanfrage mitgegeben und durchgängig konsistent angewendet.
- Wiederholungslogik mit Backoff: Schlägt eine einzelne Übersetzungsanfrage fehl, wird sie mit exponentiell wachsender Verzögerung wiederholt, bevor der gesamte Lauf abgebrochen wird. Teilweise erfolgreiche Läufe geben so viel Übersetzung zurück wie möglich.
- Rate-Limiting: Ein Token-Bucket-Mechanismus begrenzt die Anzahl gleichzeitiger Anfragen an den LLM-Endpunkt, um Überlastung und Throttling-Antworten zu vermeiden.
- Validierung der Markdown-Ausgabe: Die zusammengefügte Übersetzung wird auf konsistente Strukturen geprüft, bevor sie exportiert wird.
- Fortschrittsanzeige und Statusrückmeldung: Während des Laufs werden die aktuelle Position, der Typ des bearbeiteten Abschnitts (Text, Tabelle, Codeblock) und eine geschätzte Restlaufzeit angezeigt.
Bedienoberfläche¶
Die Bedienoberfläche ist als zweispaltiges Layout aufgebaut, mit der Originalansicht links und der Übersetzungsansicht rechts. Die Sprachauswahl bietet eine Tausch-Funktion, mit der Quell- und Zielsprache mit einem Klick getauscht werden. Sprachen, Modus und Stil werden in URL-Parametern gespiegelt, sodass eine Konfiguration über einen Link weitergegeben oder als Lesezeichen abgelegt werden kann.