Zum Inhalt

Funktionen

TTS-Suite stellt fünf aufeinander aufbauende Arbeitsschritte als Tab-Oberfläche bereit: Skripterstellung, Stimm-Konfiguration, Generierung, Review und Export. Der Funktionsumfang umfasst die Anbindung an mehrere TTS- und ASR-Modelle, eine zentrale Emotionsverwaltung, automatische Qualitätsprüfung sowie ein konfigurierbares Audio-Post-Processing.

Anwendungsszenarien

  • Forschungs-Podcast — Aus einem wissenschaftlichen Manuskript wird ein mehrstimmiger Podcast mit zwei bis drei Hosts generiert. Das LLM erzeugt einen natürlichen Gesprächston mit thematischen Übergängen; die Sprecher-Profile werden aus Preset-Stimmen oder geklonten Stimmen der Beteiligten zusammengestellt.
  • Experten-Interview — Aus einem vorbereiteten Themenpapier entsteht ein strukturiertes Frage-Antwort-Format mit Moderator und Gast. Reale Hintergrundinformationen zu den Beteiligten werden über ein Freitext-Feld verbatim in den Prompt übernommen, um Halluzinationen auszuschließen.
  • Hörbuch-Produktion — Längere Texte werden mit Erzähler und Charakterstimmen vertont. Pro Sprecher-Profil können Emotions-Varianten als Referenz-Audio hinterlegt werden, sodass dramatische, ruhige und neutrale Passagen unterschiedliche Klangfarben erhalten.
  • Lehrvideo-Voiceover — Skripte für E-Learning-Module werden als ruhige Off-Stimme synthetisiert. Das Format setzt automatisch eine konstante neutrale Tonlage durch, verlängert die Pausen zwischen Sätzen und nutzt das spezifische Lehrvideo-Audio-Preset (–19 LUFS, klare Sprachverständlichkeit).
  • Audio-Vortrag oder Keynote — Aus einem Vortragsmanuskript wird ein strukturierter Einzelsprecher-Vortrag mit Einleitung, Hauptteil und Zusammenfassung erzeugt, einsetzbar etwa als Podcast-Episode oder Hörversion einer Publikation.
  • Barrierefreie Studieninhalte — Texte aus Lehrmaterialien, Skripten oder Studienaufgaben werden in eine Hörfassung überführt. Die ASR-basierte Qualitätsprüfung stellt sicher, dass das gesprochene Audio dem Originaltext entspricht — relevant für Studierende mit Sehbeeinträchtigung oder Lese-Schreib-Schwäche.

Auf einen Blick

  • Anbindung an drei TTS-Modellfamilien mit insgesamt sieben Betriebsmodi sowie ein ASR-Modell und einen OpenAI-kompatiblen LLM-Server
  • Sechs vorkonfigurierte Dialog-Formate mit format-spezifischen Prompt-Vorlagen und Pipeline-Anpassungen
  • Sieben Audio-Presets von Rohschnitt bis Broadcast EBU R128
  • Automatische Qualitätssicherung per ASR-Round-Trip mit konfigurierbarer WER-Schwelle
  • Persistente Stimm- und Skript-Bibliothek mit Verwaltungsfunktionen
  • Import: Rohtext sowie Referenz-Audio in WAV, MP3, OGG, FLAC, M4A (zusätzlich automatische Konvertierung browser-spezifischer Formate wie WebM, CAF, WMA)
  • Export: WAV, MP3, OGG

TTS-Backends

TTS-Suite bindet drei Modellfamilien an, die jeweils unterschiedliche Stärken einbringen. Die Anbindung erfolgt durchgängig über die OpenAI-kompatible API der vLLM-Omni-Inferenzserver.

  • Qwen3-TTS CustomVoice — Neun vortrainierte Stimmen (u.a. Vivian, Serena, Ryan) für zehn Sprachen. Emotionssteuerung über natürlichsprachliche Anweisungen im instructions-Feld. Geeignet für sofort einsatzbereite, konsistente Stimmen.
  • Qwen3-TTS VoiceDesign — Erzeugt eine Stimme aus reiner Textbeschreibung („warme Frauenstimme mit beruhigendem Ton"). Kein Referenz-Audio erforderlich.
  • Qwen3-TTS Base (Clone) — Voice-Cloning aus 10–30 Sekunden Referenz-Audio. Pro Emotion wird ein eigener Referenz-Clip hinterlegt; das Modell übernimmt die Prosodie des jeweiligen Clips.
  • Fish Speech S2 Pro — Voice-Cloning mit feingranularer Inline-Tag-Steuerung. Sprache wird automatisch aus dem Eingabetext erkannt (80+ Sprachen). Tags wie [whisper] oder [laughing] können an beliebiger Stelle im Skript gesetzt werden.
  • Voxtral 4B TTS — Zwanzig vortrainierte Stimmen für neun Sprachen oder Voice-Cloning aus bereits drei Sekunden Referenz-Audio. Emotionssteuerung über das instructions-Feld.

Skript-Generierung und Dialog-Formate

Sechs Dialog-Formate mit jeweils eigenen LLM-Prompt-Vorlagen, Vorgaben zur Sprecheranzahl und nachgelagerten Pipeline-Anpassungen:

  • Podcast — Zwei bis drei Hosts mit unterscheidbaren Persönlichkeiten, informeller Gesprächston, gegenseitiges Anreden mit Namen.
  • Interview — Moderator und Gast im strukturierten Frage-Antwort-Format.
  • Diskussion — Drei bis fünf Teilnehmende mit Moderator und unterschiedlichen Positionen.
  • Hörbuch — Erzähler mit optionalen Charakterstimmen für Dialogpassagen.
  • Vortrag — Einzelsprecher mit Einleitung, Hauptteil, Zusammenfassung und sachlich-vertrauenswürdigem Ton.
  • Lehrvideo — Neutrale Off-Stimme mit kurzen, klar abgegrenzten Sätzen, verlängerten Pausen und durchgehend neutraler Emotion.

Die optionale Intro/Outro-Generierung passt Begrüßung und Abschluss an das gewählte Format an. Ein separates Textfeld für reale Sprecher-Hintergründe wird verbatim in den Prompt eingefügt, um erfundene Titel oder Institutionen auszuschließen.

Stimmen-Bibliothek

Sprecher-Profile werden persistent gespeichert und stehen projektübergreifend zur Verfügung. Ein Profil enthält Name, Backend-Typ, Modus (Preset, VoiceDesign, Clone) und je nach Modus Preset-Name oder Emotions-Varianten mit Referenz-Audios.

  • Live-Vorschau: Zu jedem Profil kann ein Beispielsatz in der gewählten Sprache angehört werden, bevor es im Produktionseinsatz verwendet wird.
  • Verwaltung: Einzelne Profile, einzelne Emotions-Varianten oder ganze Projekte können gezielt gelöscht werden, ohne andere Daten zu beeinflussen.
  • Klon-Profile listen ihre Referenz-Aufnahmen mit Dateinamen und Emotion-Label auf.

Emotionssteuerung

Sieben Basis-Emotionen (neutral, freundlich, nachdenklich, begeistert, ernst, fragend, humorvoll) bilden ein backend-übergreifend einheitliches Vokabular. Verwandte Emotionen (z.B. warmherzig, enthusiastisch, skeptisch) werden über Fuzzy-Mapping einer der Basis-Emotionen zugeordnet. Je nach Backend wird die Emotion über drei Pfade umgesetzt:

  • Qwen3 / Voxtral: natürlichsprachliche Instruktion im API-Feld instructions
  • Fish Speech: Inline-Tag im Sprechtext ([warm and friendly tone] u.a.)
  • Clone-Modi: Auswahl des passenden Referenz-Audio-Clips pro Emotion

Manuell im Skript gesetzte Fish-Speech-Tags bleiben erhalten und werden mit den automatischen Tags kombiniert; bei Wechsel auf ein anderes Backend werden sie aus dem Text entfernt, damit sie nicht wörtlich vorgelesen werden.

Qualitätssicherung

Nach der Generierung wird jedes Segment automatisch über Qwen3-ASR zurücktranskribiert und mit dem ursprünglichen Skripttext verglichen. Das Ergebnis ist eine Wortfehlerrate (WER) pro Segment.

  • Konfigurierbare WER-Schwelle pro Projekt (Standard: 10 %)
  • Automatische Markierung auffälliger Segmente im Review-Tab
  • Einzel- und Batch-Regenerierung mit alternativer Emotion oder editiertem Text
  • Anzeige der ASR-Transkription neben dem Original zum direkten Vergleich
  • Format-spezifische Stabilisierung: Beim Lehrvideo-Format überschreibt der Emotions-Router individuelle Emotionen zwangsweise auf neutral, sodass alle Segmente in gleichmäßigem Tonfall generiert werden
  • Anti-Halluzinations-Logik in den LLM-Prompts inklusive eines separaten Feldes für reale Sprecher-Hintergründe

Audio-Pipeline und Export

Die generierten Segmente durchlaufen eine mehrstufige Verarbeitung:

  • Segment-RMS-Normalisierung auf gemeinsamen Pegel vor dem Zusammenfügen
  • Sample-Rate-Harmonisierung zwischen Backends mit unterschiedlichen Ausgaberaten (24 kHz, 44.1 kHz)
  • Crossfading und format-abhängige Pausen zwischen Segmenten (gleicher Sprecher, Sprecherwechsel, Absatzende)
  • Highpass-Filter, Kompressor mit Attack/Release, LUFS-Normalisierung, True-Peak-Limiter
  • Steady-State-Initialisierung der IIR-Filter zur Vermeidung hörbarer Einschwing-Artefakte am Dateianfang

Sieben Audio-Presets stehen zur Auswahl: Rohschnitt, Podcast (–16 LUFS), Radio (–14 LUFS), Hörbuch (–18 LUFS), Broadcast EBU R128 (–23 LUFS), Sonor (warme Radiosprech-Stimme mit Präsenz-EQ) und Lehrvideo (–19 LUFS). Export erfolgt als WAV, MP3 oder OGG.

Sicherheit und Robustheit

  • Alle SQL-Queries parametrisiert (kein SQL-Injection-Risiko)
  • Audio-Uploads werden auf Größe, Format und WAV-Header validiert
  • Dateinamen-Sanitization und Path-Traversal-Schutz für nutzergenerierte Pfade
  • Längen-Limits für Texteingaben und Segmentanzahl
  • Robuste Verarbeitung uneinheitlicher Audio-Formate aus unterschiedlichen Browsern und Aufnahmegeräten (WebM, CAF, WMA u.a.) mit automatischer Konvertierung nach WAV