ASR Transcription¶
ASR Transcription ist eine Web-Oberfläche zur Spracherkennung im Hochschulkontext. Audio wird über das Browser-Mikrofon oder als hochgeladene Datei eingespeist und an einen ASR-Server (vLLM mit OpenAI-kompatibler API) weitergereicht; das Transkript erscheint im Browser. Die Anwendung kombiniert ein konfigurierbares ASR-Modell mit mehrstufiger Audio-Vorverarbeitung, automatischer Segmentierung langer Aufnahmen, einer Voice Activity Detection und einer Halluzinations-Bereinigung im Post-Processing.
Auf einen Blick¶
- Vorlesungen und Vorträge live transkribieren — das Transkript erscheint laufend im Browser
- Aufgenommene Interviews, Sitzungen oder Vortragsmitschnitte als Datei hochladen und vollständig transkribieren lassen
- Mehrere Audiodateien in einem Durchgang sequenziell verarbeiten (Batch)
- Untertiteldateien im SRT- oder VTT-Format für barrierefreie Lehr- und Forschungsmaterialien erzeugen
- Eigennamen, Fachbegriffe oder thematischen Kontext per Hinweisfeld vorgeben, damit das Modell sie korrekt schreibt
- Aufnahmen mit störendem Hintergrundrauschen oder Brummen vor der Transkription automatisch bereinigen
- Zwischen 13 und 52 Sprachen wählen oder die Sprache automatisch erkennen lassen
Highlights¶
Im Unterschied zu einem direkten Aufruf einer Transkriptions-API oder einem einfachen Skript bündelt ASR Transcription mehrere Verarbeitungsstufen, die gemeinsam für stabilere und besser nutzbare Ergebnisse sorgen.
- Wählbares ASR-Modell — Über die Konfiguration kann zwischen Qwen3-ASR-1.7B (52 Sprachen) und Voxtral-Mini-4B-Realtime-2602 (13 Sprachen) gewechselt werden. Die Sprachauswahl der Oberfläche passt sich automatisch an das aktive Modell an.
- Zwei API-Methoden — Neben der klassischen Transcriptions-API steht eine Chat-API mit System-Prompt zur Verfügung. Letztere übergibt vorgegebene Eigennamen und Fachbegriffe als Anweisung an das Modell und liefert dadurch zuverlässigere Schreibweisen.
- Mehrstufige Audio-Vorverarbeitung — Optional können Peak-Normalisierung, spektrale Rauschunterdrückung und ein 80-Hz-Hochpass-Filter aktiviert werden, bevor das Audio segmentiert und versendet wird. Das verbessert die Erkennungsqualität bei nicht-idealen Aufnahmen.
- Automatische Segmentierung mit Stille-Erkennung — Aufnahmen, die das Längenlimit der Inferenz-API überschreiten, werden in überlappende Segmente aufgeteilt. Segmente ohne Sprachanteil werden über eine energiebasierte Voice Activity Detection übersprungen, was Verarbeitungszeit und Halluzinationen reduziert.
- Halluzinations-Bereinigung im Post-Processing — Typische ASR-Fehlmuster (repetitive Zeichenfolgen, mehrfach wiederholte kurze Phrasen) werden per Mustererkennung erkannt und reduziert. Vollständig halluzinierte Antworten werden durch einen entsprechenden Hinweis ersetzt.
- Kontext-Prompt für Eigennamen und Fachvokabular — Über ein optionales Textfeld lassen sich Namen, Begriffe oder thematische Hinweise mitsenden. Der Kontext begleitet jedes Segment, auch bei automatisch geteilten langen Dateien.
- Anbindung an interne Inferenz-Infrastruktur — Die Transkription erfolgt über einen separat betriebenen vLLM-Server. Die Anwendung selbst überträgt keine Audiodaten an externe Anbieter; URL und Zugangsdaten werden konfiguriert.
- DSGVO-bewusster Aufbau — Keine Einbindung externer Schriftarten oder CDN-Ressourcen, deaktivierte Telemetrie der Oberfläche, kein Tracking durch Drittdienste.
- Containerisierte Bereitstellung — Die Anwendung wird als Docker-Image ausgeliefert. Die Audio-Systembibliotheken (FFmpeg, libsndfile) sind im Image enthalten, der Prozess läuft als nicht-privilegierter Benutzer und ein Healthcheck prüft die Erreichbarkeit der Oberfläche.