Funktionen¶
STT-Helper deckt einen schmalen, klar umrissenen Funktionsumfang ab: die Aufnahme eines Transkripts, dessen mehrstufige Aufbereitung durch einen LLM-Dienst und die Zustellung des Ergebnisses per E-Mail. Die Detailfunktionen verteilen sich auf Eingabe, Verarbeitung, Qualitätssicherung und Ausgabe.
Anwendungsszenarien¶
- Vorlesungs- und Seminarmitschriften: Automatisch erstellte Transkripte einer Lehrveranstaltung werden zu lesbaren, sprachlich geglätteten Texten aufbereitet, die als Begleitmaterial weitergereicht werden können.
- Interview- und Sitzungstranskripte: Mündliche Beiträge mit Floskeln, abgebrochenen Sätzen und Transkriptionsfehlern werden bereinigt; das Ergebnis ist eine zitierfähige Textfassung.
- Stilistische Überführung in Schriftsprache: Mündlich formulierte Inhalte werden in einen sachlichen, aktiven Schreibstil umgeschrieben, der sich an wissenschaftlicher Prosa orientiert.
- Strukturierte Dokumentation aus Rohtext: Aus einem zusammenhängenden Transkript entsteht ein in Überschriften und Absätze gegliedertes Markdown-Dokument.
- Vorbereitung von Aufzeichnungen für RAG-Anwendungen: Aufgezeichnete Inhalte werden in eine bereinigte, gegliederte Markdown-Form überführt und stehen damit für die Indexierung in retrieval-basierten Chatbots oder Wissensdatenbanken in einer für die Segmentierung geeigneten Form bereit.
- Fachsprachliche Korrektur: Ein Kontextfeld für Fachgebiet und Terminologie steuert die Erkennung und Korrektur falsch transkribierter Fachbegriffe (etwa in Medizin, Recht oder Technik).
Auf einen Blick¶
- Eingabewege: Datei-Upload und direkte Texteingabe
- Drei wählbare, kumulative Verarbeitungsstufen (Korrektur, Überarbeitung, Formatierung)
- Freitextfeld zur Kontextangabe für fachsprachliche Steuerung
- Chunkbasierte Verarbeitung mit Überlappung, paralleler Ausführung und Wiederholversuchen
- Ergebniszustellung per E-Mail mit phasenspezifischem Dateinamen
- Zweisprachige Oberfläche (Deutsch und Englisch)
- Validierung der Eingangsdaten und der E-Mail-Adresse
Eingabe¶
Texte gelangen wahlweise per Datei-Upload oder als direkte Eingabe in das Webformular in die Anwendung. Beim Datei-Upload werden Klartextformate akzeptiert: .txt, .text, .md und .markdown mit einer maximalen Größe von 10 MB. Beim Lesen probiert die Anwendung mehrere Zeichensätze (UTF-8, UTF-8 mit BOM, Latin-1, CP1252) und erkennt rein binäre Inhalte über den Anteil von Null-Bytes. Eingabetexte unterhalb von 100 oder oberhalb von fünf Millionen Zeichen werden zurückgewiesen.
Eine E-Mail-Adresse für die Zustellung wird beim Absenden geprüft; die Domäne ist gegen eine institutionelle Vorgabe validierbar.
Verarbeitungsstufen¶
Die Verarbeitung erfolgt kumulativ: Stufe 2 setzt das Ergebnis von Stufe 1 voraus, Stufe 3 das Ergebnis von Stufe 2. Im UI wird die jeweilige Endstufe gewählt; die Anwendung führt alle bis dahin notwendigen Vorstufen automatisch aus.
- Stufe 1 — Korrektur: Beseitigung offensichtlicher Transkriptionsfehler, unvollständiger Sätze und umgangssprachlicher Floskeln. Fachbegriffe werden auf Basis des angegebenen Kontexts korrigiert.
- Stufe 2 — Überarbeitung: stilistische Überführung in einen sachlichen, professionellen Schreibstil mit Aktivformulierungen und vollständigen Sätzen. Inhalte werden weder ergänzt noch gekürzt.
- Stufe 3 — Formatierung: Strukturierung in Markdown mit Überschriften (Ebene zwei und tiefer), Absätzen und einer durchgängig lesbaren Gliederung.
Kontextsteuerung¶
Ein freies Eingabefeld nimmt eine Beschreibung des Fachgebiets oder gewünschter Terminologie auf. Dieser Kontext wird in jede Stufe als Bestandteil des Prompts eingespeist und beeinflusst sowohl die Korrektur einzelner Begriffe als auch die stilistische Ausrichtung. Wird kein Kontext angegeben, arbeitet die Anwendung mit einem allgemeinen Default.
Qualitätssichernde Funktionen¶
- Chunk-Überlappung: Aufeinanderfolgende Chunks teilen sich eine Überlappung von 500 Zeichen, damit Satzgrenzen und Sinnzusammenhänge nicht durch die Aufteilung verloren gehen.
- Mehrstufige Pipeline mit klaren Aufgaben: Jede Stufe verfolgt ein eigenes, isoliertes Ziel; Korrektur, Stilangleichung und Formatierung sind nicht in einem einzigen Prompt vermischt.
- Wiederholversuche pro Chunk: Bei API-Fehlern oder Timeouts wird ein Chunk bis zu fünfmal mit ansteigender Wartezeit erneut verarbeitet.
- Best-Result-Merging: Beim Zusammenführen wählt die Anwendung pro Chunk das höchstwertige erfolgreiche Stufenergebnis. Liefert eine spätere Stufe für einen Chunk kein Ergebnis, wird das Resultat einer früheren Stufe übernommen.
- Originalfallback: Schlägt die Verarbeitung eines Chunks in allen Stufen fehl, gibt die Anwendung den ursprünglichen Abschnitt mit einer Fehlernotiz aus, statt das Gesamtergebnis zu verwerfen.
- Eingabevalidierung: Datei- und Texteigenschaften werden vor Auftragsannahme geprüft (Größe, Endung, Encoding, Binärerkennung, Mindest- und Maximallänge).
- Statistikführung: Auftragseingänge werden mit Zeitstempel in einer Statistikdatei erfasst; der Schreibzugriff wird über eine Dateisperre serialisiert.
Ausgabe¶
Das Ergebnis wird als E-Mail-Anhang zugestellt. Der Dateiname spiegelt die gewählte Endstufe wider (corrected_text, revised_text oder formatted_text.md). Im Erfolgsfall enthält die Nachricht eine kurze Zusammenfassung und die Verarbeitungsdauer, im Fehlerfall eine Beschreibung des aufgetretenen Problems. Nach dem Versand werden alle Eingangsdaten, Zwischenergebnisse und das Arbeitsverzeichnis gelöscht.
Bedienung¶
Die Oberfläche ist in Deutsch und Englisch verfügbar; die Sprachwahl erfolgt automatisch über den Accept-Language-Header oder explizit über einen URL-Parameter. Eine separate Schaltfläche prüft die Verfügbarkeit der angebundenen LLM-API ohne Auftragsannahme.