Zum Inhalt

ASR Transcription

ASR Transcription ist eine Web-Oberfläche zur Spracherkennung im Hochschulkontext. Audio wird über das Browser-Mikrofon oder als hochgeladene Datei eingespeist und an einen ASR-Server (vLLM mit OpenAI-kompatibler API) weitergereicht; das Transkript erscheint im Browser. Die Anwendung kombiniert ein konfigurierbares ASR-Modell mit mehrstufiger Audio-Vorverarbeitung, automatischer Segmentierung langer Aufnahmen, einer Voice Activity Detection und einer Halluzinations-Bereinigung im Post-Processing.

Auf einen Blick

  • Vorlesungen und Vorträge live transkribieren — das Transkript erscheint laufend im Browser
  • Aufgenommene Interviews, Sitzungen oder Vortragsmitschnitte als Datei hochladen und vollständig transkribieren lassen
  • Mehrere Audiodateien in einem Durchgang sequenziell verarbeiten (Batch)
  • Untertiteldateien im SRT- oder VTT-Format für barrierefreie Lehr- und Forschungsmaterialien erzeugen
  • Eigennamen, Fachbegriffe oder thematischen Kontext per Hinweisfeld vorgeben, damit das Modell sie korrekt schreibt
  • Aufnahmen mit störendem Hintergrundrauschen oder Brummen vor der Transkription automatisch bereinigen
  • Zwischen 13 und 52 Sprachen wählen oder die Sprache automatisch erkennen lassen

Highlights

Im Unterschied zu einem direkten Aufruf einer Transkriptions-API oder einem einfachen Skript bündelt ASR Transcription mehrere Verarbeitungsstufen, die gemeinsam für stabilere und besser nutzbare Ergebnisse sorgen.

  • Wählbares ASR-Modell — Über die Konfiguration kann zwischen Qwen3-ASR-1.7B (52 Sprachen) und Voxtral-Mini-4B-Realtime-2602 (13 Sprachen) gewechselt werden. Die Sprachauswahl der Oberfläche passt sich automatisch an das aktive Modell an.
  • Zwei API-Methoden — Neben der klassischen Transcriptions-API steht eine Chat-API mit System-Prompt zur Verfügung. Letztere übergibt vorgegebene Eigennamen und Fachbegriffe als Anweisung an das Modell und liefert dadurch zuverlässigere Schreibweisen.
  • Mehrstufige Audio-Vorverarbeitung — Optional können Peak-Normalisierung, spektrale Rauschunterdrückung und ein 80-Hz-Hochpass-Filter aktiviert werden, bevor das Audio segmentiert und versendet wird. Das verbessert die Erkennungsqualität bei nicht-idealen Aufnahmen.
  • Automatische Segmentierung mit Stille-Erkennung — Aufnahmen, die das Längenlimit der Inferenz-API überschreiten, werden in überlappende Segmente aufgeteilt. Segmente ohne Sprachanteil werden über eine energiebasierte Voice Activity Detection übersprungen, was Verarbeitungszeit und Halluzinationen reduziert.
  • Halluzinations-Bereinigung im Post-Processing — Typische ASR-Fehlmuster (repetitive Zeichenfolgen, mehrfach wiederholte kurze Phrasen) werden per Mustererkennung erkannt und reduziert. Vollständig halluzinierte Antworten werden durch einen entsprechenden Hinweis ersetzt.
  • Kontext-Prompt für Eigennamen und Fachvokabular — Über ein optionales Textfeld lassen sich Namen, Begriffe oder thematische Hinweise mitsenden. Der Kontext begleitet jedes Segment, auch bei automatisch geteilten langen Dateien.
  • Anbindung an interne Inferenz-Infrastruktur — Die Transkription erfolgt über einen separat betriebenen vLLM-Server. Die Anwendung selbst überträgt keine Audiodaten an externe Anbieter; URL und Zugangsdaten werden konfiguriert.
  • DSGVO-bewusster Aufbau — Keine Einbindung externer Schriftarten oder CDN-Ressourcen, deaktivierte Telemetrie der Oberfläche, kein Tracking durch Drittdienste.
  • Containerisierte Bereitstellung — Die Anwendung wird als Docker-Image ausgeliefert. Die Audio-Systembibliotheken (FFmpeg, libsndfile) sind im Image enthalten, der Prozess läuft als nicht-privilegierter Benutzer und ein Healthcheck prüft die Erreichbarkeit der Oberfläche.