Zum Inhalt

Funktionen

ASR Transcription stellt vier Arbeitsmodi zur Verfügung: Live-Transkription über das Mikrofon, Verarbeitung einzelner Audiodateien, sequenzielle Stapelverarbeitung mehrerer Dateien sowie ein Status- und Konfigurations-Tab für die Diagnose. Über die gesamte Verarbeitung hinweg greifen optionale Audio-Vorverarbeitung, automatische Segmentierung, eine Voice Activity Detection und ein Post-Processing zur Halluzinations-Erkennung.

Anwendungsszenarien

  • Live-Transkription von Vorträgen und Vorlesungen — Während der Veranstaltung wird das Mikrofon-Audio in einstellbaren Zeitfenstern an den ASR-Server gesendet. Das Transkript baut sich kumulativ im Browser auf und kann unmittelbar als Datei gespeichert werden.
  • Nachträgliche Transkription einzelner Aufnahmen — Hochgeladene Mitschnitte von Interviews, Besprechungen oder Forschungsgesprächen werden vollständig transkribiert. Lange Dateien werden ohne weiteres Zutun in Segmente aufgeteilt und am Ende zusammengefügt.
  • Batch-Transkription größerer Bestände — Mehrere Audiodateien werden in einem Durchgang sequenziell verarbeitet. Das eignet sich für Forschungskorpora, Lehrveranstaltungs-Archive oder die Aufbereitung qualitativer Datensätze.
  • Untertitelerstellung für barrierefreie Lehrmaterialien — Über das Antwortformat SRT oder VTT entstehen direkt Untertiteldateien, die sich in Lernplattformen oder Videoschnitt-Werkzeuge einbinden lassen.
  • Mehrsprachige Transkription mit Fachvokabular — Die Sprache wird entweder vorgegeben oder automatisch erkannt. Über das Kontext-Feld lassen sich Eigennamen, Akronyme und Fachbegriffe mitsenden, damit sie korrekt geschrieben werden.
  • Diagnose und Konfigurationsprüfung — Vor dem produktiven Einsatz oder nach einem Modellwechsel kann die Verbindung zum Inferenz-Server geprüft werden. Verfügbare Modelle, Antwortverhalten beider Endpoints und aktive Konfiguration werden in einem Tab gebündelt.

Auf einen Blick

  • Vier Arbeitsmodi: Live (Mikrofon-Streaming), Datei (Einzeldatei), Batch (mehrere Dateien), Test (Diagnose)
  • Zwei wählbare ASR-Modelle über Konfiguration: Qwen3-ASR-1.7B oder Voxtral-Mini-4B-Realtime
  • Zwei API-Methoden: klassische Transcriptions-API oder Chat-API mit System-Prompt für besseren Eigennamen-Umgang
  • Audio-Eingabe als WAV, MP3, FLAC, OGG, M4A oder WEBM; interne Verarbeitung als 16 kHz Mono PCM16
  • Antwortformate: JSON, verbose JSON (mit Zeitstempeln je Segment), Plain-Text, SRT, VTT
  • Qualitätssicherung über Audio-Vorverarbeitung, VAD, automatische Segmentierung und Halluzinations-Bereinigung
  • 13 Sprachen (Voxtral) oder 52 Sprachen (Qwen3-ASR), jeweils inklusive Auto-Erkennung

Eingabe und Datenquellen

Audio wird auf zwei Wegen in die Anwendung gegeben. Über das Browser-Mikrofon greift der Live-Tab in einstellbaren Zeitfenstern Audio-Chunks ab; alternativ lassen sich im Datei- und Batch-Tab Audiodateien hochladen.

  • Mikrofon-Streaming — Die Browser-Audio-Quelle liefert numpy-Chunks mit der nativen Samplerate (typischerweise 44,1 oder 48 kHz). Die Anwendung resampelt automatisch auf 16 kHz Mono.
  • Datei-Upload — Unterstützt werden gängige Audio-Container und -Codecs (WAV, MP3, FLAC, OGG, M4A, WEBM). Die Dekodierung erfolgt intern über librosa und FFmpeg.
  • Mehrfach-Upload für Stapelverarbeitung — Im Batch-Tab können mehrere Dateien gleichzeitig ausgewählt werden; sie werden nacheinander mit identischen Einstellungen verarbeitet.

Inferenz-Anbindung

Die eigentliche Spracherkennung läuft auf einem separat betriebenen Inferenz-Server. Die Anwendung kommuniziert ausschließlich mit diesem Server.

  • vLLM-Server (intern) — Bereitstellung der Modelle Qwen3-ASR oder Voxtral über die Endpoints /v1/audio/transcriptions und /v1/chat/completions. Server-URL und ein optionaler Bearer-Token werden über Umgebungsvariablen konfiguriert.

Antwortformate

Die Antwort des Servers kann in fünf Formaten angefordert werden:

  • JSON — Reiner Transkriptionstext im Standardfeld; Default für Live- und Batch-Modus.
  • verbose JSON — Zusätzlich erkannte Sprache, Audiodauer und Segmentliste mit Zeitstempeln; geeignet für nachgelagerte Verarbeitung.
  • Plain-Text — Unstrukturierter Fließtext.
  • SRT und VTT — Untertitelformate mit Zeitcodes, direkt nutzbar in Videoplattformen und Schnittprogrammen.

Über die Download-Schaltfläche wird das jeweilige Format mit passender Dateiendung als Datei bereitgestellt.

Qualitätssichernde Funktionen

Mehrere Mechanismen sollen die Verlässlichkeit der Transkription gegenüber einem direkten Modellaufruf verbessern.

  • Audio-Vorverarbeitung — Optional vor der Segmentierung. Drei einzeln schaltbare Stufen: Peak-Normalisierung auf -1 dB für einheitliche Lautstärke, spektrales Gating zur Entfernung stationären Hintergrundrauschens (Lüfter, Klimaanlage, Raumrauschen) und Hochpass-Filter bei 80 Hz gegen Netzbrummen und tieffrequente Störungen.
  • Voice Activity Detection — Energiebasierte Erkennung von Sprachanteilen. Segmente, die unterhalb eines Schwellenwerts liegen, werden vor dem Versand an das Modell übersprungen. Das spart Rechenzeit und vermeidet Halluzinationen auf reiner Stille.
  • Automatische Segmentierung mit Überlappung — Audiodateien jenseits der eingestellten Segmentlänge (Standard 15 Minuten) werden in Stücke geschnitten, die jeweils zwei Sekunden überlappen. Dadurch werden sowohl das Längenlimit als auch das Dateigrößenlimit der Inferenz-API umgangen, ohne dass an Segmentgrenzen Wörter verloren gehen.
  • Halluzinations-Bereinigung — Typische ASR-Fehlmuster (repetitive Zeichenfolgen, mehrfach wiederholte kurze Phrasen) werden per regulärem Ausdruck erkannt und reduziert. Wird durch die Bereinigung mehr als 80 % des Originaltextes entfernt, gilt die Antwort als vollständig halluziniert und wird durch einen Hinweistext ersetzt.
  • Kontext-Prompt — In jedem Tab kann ein Hinweisfeld gefüllt werden mit Eigennamen, Fachbegriffen, thematischem Kontext oder Stilangaben. Der Inhalt wird mit jedem Segment mitgesendet, was die Schreibweise von Namen und Begriffen stabilisiert.
  • Methodenwahl bei der API — Bei schwierigen Eigennamen-Vorgaben kann von der klassischen Transcriptions-API auf die Chat-API mit System-Prompt umgeschaltet werden. Diese gibt dem Modell eine explizite Instruktion mit, ausschließlich den transkribierten Text zurückzugeben und vorgegebene Begriffe exakt zu schreiben.
  • Fortschritts- und Fehleranzeige — Lange Verarbeitungen werden segmentweise im Ergebnisfeld nachverfolgbar. HTTP-Fehler des Backends werden mit Statuscode und Auszug der Antwort angezeigt, statt die Verarbeitung abzubrechen.
  • Verbindungs-Diagnose — Der Test-Tab prüft die Erreichbarkeit des Inferenz-Servers, listet die dort registrierten Modelle, sendet einen Stille-Test an beide Endpoints und fasst die aktive Konfiguration zusammen.

Konfiguration

Wesentliche Parameter sind über Umgebungsvariablen oder eine .env-Datei steuerbar: Backend-URL und API-Key, Modelltyp und Modell-Bezeichnung, Default-Werte für Temperature, Antwortformat und Live-Verarbeitungsfenster, maximale Segmentlänge sowie Bind-Adresse, Port und Reverse-Proxy-Pfad der Oberfläche.