Funktionen¶
TTS-Suite stellt fünf aufeinander aufbauende Arbeitsschritte als Tab-Oberfläche bereit: Skripterstellung, Stimm-Konfiguration, Generierung, Review und Export. Der Funktionsumfang umfasst die Anbindung an mehrere TTS- und ASR-Modelle, eine zentrale Emotionsverwaltung, automatische Qualitätsprüfung sowie ein konfigurierbares Audio-Post-Processing.
Anwendungsszenarien¶
- Forschungs-Podcast — Aus einem wissenschaftlichen Manuskript wird ein mehrstimmiger Podcast mit zwei bis drei Hosts generiert. Das LLM erzeugt einen natürlichen Gesprächston mit thematischen Übergängen; die Sprecher-Profile werden aus Preset-Stimmen oder geklonten Stimmen der Beteiligten zusammengestellt.
- Experten-Interview — Aus einem vorbereiteten Themenpapier entsteht ein strukturiertes Frage-Antwort-Format mit Moderator und Gast. Reale Hintergrundinformationen zu den Beteiligten werden über ein Freitext-Feld verbatim in den Prompt übernommen, um Halluzinationen auszuschließen.
- Hörbuch-Produktion — Längere Texte werden mit Erzähler und Charakterstimmen vertont. Pro Sprecher-Profil können Emotions-Varianten als Referenz-Audio hinterlegt werden, sodass dramatische, ruhige und neutrale Passagen unterschiedliche Klangfarben erhalten.
- Lehrvideo-Voiceover — Skripte für E-Learning-Module werden als ruhige Off-Stimme synthetisiert. Das Format setzt automatisch eine konstante neutrale Tonlage durch, verlängert die Pausen zwischen Sätzen und nutzt das spezifische Lehrvideo-Audio-Preset (–19 LUFS, klare Sprachverständlichkeit).
- Audio-Vortrag oder Keynote — Aus einem Vortragsmanuskript wird ein strukturierter Einzelsprecher-Vortrag mit Einleitung, Hauptteil und Zusammenfassung erzeugt, einsetzbar etwa als Podcast-Episode oder Hörversion einer Publikation.
- Barrierefreie Studieninhalte — Texte aus Lehrmaterialien, Skripten oder Studienaufgaben werden in eine Hörfassung überführt. Die ASR-basierte Qualitätsprüfung stellt sicher, dass das gesprochene Audio dem Originaltext entspricht — relevant für Studierende mit Sehbeeinträchtigung oder Lese-Schreib-Schwäche.
Auf einen Blick¶
- Anbindung an drei TTS-Modellfamilien mit insgesamt sieben Betriebsmodi sowie ein ASR-Modell und einen OpenAI-kompatiblen LLM-Server
- Sechs vorkonfigurierte Dialog-Formate mit format-spezifischen Prompt-Vorlagen und Pipeline-Anpassungen
- Sieben Audio-Presets von Rohschnitt bis Broadcast EBU R128
- Automatische Qualitätssicherung per ASR-Round-Trip mit konfigurierbarer WER-Schwelle
- Persistente Stimm- und Skript-Bibliothek mit Verwaltungsfunktionen
- Import: Rohtext sowie Referenz-Audio in WAV, MP3, OGG, FLAC, M4A (zusätzlich automatische Konvertierung browser-spezifischer Formate wie WebM, CAF, WMA)
- Export: WAV, MP3, OGG
TTS-Backends¶
TTS-Suite bindet drei Modellfamilien an, die jeweils unterschiedliche Stärken einbringen. Die Anbindung erfolgt durchgängig über die OpenAI-kompatible API der vLLM-Omni-Inferenzserver.
- Qwen3-TTS CustomVoice — Neun vortrainierte Stimmen (u.a. Vivian, Serena, Ryan) für zehn Sprachen. Emotionssteuerung über natürlichsprachliche Anweisungen im
instructions-Feld. Geeignet für sofort einsatzbereite, konsistente Stimmen. - Qwen3-TTS VoiceDesign — Erzeugt eine Stimme aus reiner Textbeschreibung („warme Frauenstimme mit beruhigendem Ton"). Kein Referenz-Audio erforderlich.
- Qwen3-TTS Base (Clone) — Voice-Cloning aus 10–30 Sekunden Referenz-Audio. Pro Emotion wird ein eigener Referenz-Clip hinterlegt; das Modell übernimmt die Prosodie des jeweiligen Clips.
- Fish Speech S2 Pro — Voice-Cloning mit feingranularer Inline-Tag-Steuerung. Sprache wird automatisch aus dem Eingabetext erkannt (80+ Sprachen). Tags wie
[whisper]oder[laughing]können an beliebiger Stelle im Skript gesetzt werden. - Voxtral 4B TTS — Zwanzig vortrainierte Stimmen für neun Sprachen oder Voice-Cloning aus bereits drei Sekunden Referenz-Audio. Emotionssteuerung über das
instructions-Feld.
Skript-Generierung und Dialog-Formate¶
Sechs Dialog-Formate mit jeweils eigenen LLM-Prompt-Vorlagen, Vorgaben zur Sprecheranzahl und nachgelagerten Pipeline-Anpassungen:
- Podcast — Zwei bis drei Hosts mit unterscheidbaren Persönlichkeiten, informeller Gesprächston, gegenseitiges Anreden mit Namen.
- Interview — Moderator und Gast im strukturierten Frage-Antwort-Format.
- Diskussion — Drei bis fünf Teilnehmende mit Moderator und unterschiedlichen Positionen.
- Hörbuch — Erzähler mit optionalen Charakterstimmen für Dialogpassagen.
- Vortrag — Einzelsprecher mit Einleitung, Hauptteil, Zusammenfassung und sachlich-vertrauenswürdigem Ton.
- Lehrvideo — Neutrale Off-Stimme mit kurzen, klar abgegrenzten Sätzen, verlängerten Pausen und durchgehend neutraler Emotion.
Die optionale Intro/Outro-Generierung passt Begrüßung und Abschluss an das gewählte Format an. Ein separates Textfeld für reale Sprecher-Hintergründe wird verbatim in den Prompt eingefügt, um erfundene Titel oder Institutionen auszuschließen.
Stimmen-Bibliothek¶
Sprecher-Profile werden persistent gespeichert und stehen projektübergreifend zur Verfügung. Ein Profil enthält Name, Backend-Typ, Modus (Preset, VoiceDesign, Clone) und je nach Modus Preset-Name oder Emotions-Varianten mit Referenz-Audios.
- Live-Vorschau: Zu jedem Profil kann ein Beispielsatz in der gewählten Sprache angehört werden, bevor es im Produktionseinsatz verwendet wird.
- Verwaltung: Einzelne Profile, einzelne Emotions-Varianten oder ganze Projekte können gezielt gelöscht werden, ohne andere Daten zu beeinflussen.
- Klon-Profile listen ihre Referenz-Aufnahmen mit Dateinamen und Emotion-Label auf.
Emotionssteuerung¶
Sieben Basis-Emotionen (neutral, freundlich, nachdenklich, begeistert, ernst, fragend, humorvoll) bilden ein backend-übergreifend einheitliches Vokabular. Verwandte Emotionen (z.B. warmherzig, enthusiastisch, skeptisch) werden über Fuzzy-Mapping einer der Basis-Emotionen zugeordnet. Je nach Backend wird die Emotion über drei Pfade umgesetzt:
- Qwen3 / Voxtral: natürlichsprachliche Instruktion im API-Feld
instructions - Fish Speech: Inline-Tag im Sprechtext (
[warm and friendly tone]u.a.) - Clone-Modi: Auswahl des passenden Referenz-Audio-Clips pro Emotion
Manuell im Skript gesetzte Fish-Speech-Tags bleiben erhalten und werden mit den automatischen Tags kombiniert; bei Wechsel auf ein anderes Backend werden sie aus dem Text entfernt, damit sie nicht wörtlich vorgelesen werden.
Qualitätssicherung¶
Nach der Generierung wird jedes Segment automatisch über Qwen3-ASR zurücktranskribiert und mit dem ursprünglichen Skripttext verglichen. Das Ergebnis ist eine Wortfehlerrate (WER) pro Segment.
- Konfigurierbare WER-Schwelle pro Projekt (Standard: 10 %)
- Automatische Markierung auffälliger Segmente im Review-Tab
- Einzel- und Batch-Regenerierung mit alternativer Emotion oder editiertem Text
- Anzeige der ASR-Transkription neben dem Original zum direkten Vergleich
- Format-spezifische Stabilisierung: Beim Lehrvideo-Format überschreibt der Emotions-Router individuelle Emotionen zwangsweise auf
neutral, sodass alle Segmente in gleichmäßigem Tonfall generiert werden - Anti-Halluzinations-Logik in den LLM-Prompts inklusive eines separaten Feldes für reale Sprecher-Hintergründe
Audio-Pipeline und Export¶
Die generierten Segmente durchlaufen eine mehrstufige Verarbeitung:
- Segment-RMS-Normalisierung auf gemeinsamen Pegel vor dem Zusammenfügen
- Sample-Rate-Harmonisierung zwischen Backends mit unterschiedlichen Ausgaberaten (24 kHz, 44.1 kHz)
- Crossfading und format-abhängige Pausen zwischen Segmenten (gleicher Sprecher, Sprecherwechsel, Absatzende)
- Highpass-Filter, Kompressor mit Attack/Release, LUFS-Normalisierung, True-Peak-Limiter
- Steady-State-Initialisierung der IIR-Filter zur Vermeidung hörbarer Einschwing-Artefakte am Dateianfang
Sieben Audio-Presets stehen zur Auswahl: Rohschnitt, Podcast (–16 LUFS), Radio (–14 LUFS), Hörbuch (–18 LUFS), Broadcast EBU R128 (–23 LUFS), Sonor (warme Radiosprech-Stimme mit Präsenz-EQ) und Lehrvideo (–19 LUFS). Export erfolgt als WAV, MP3 oder OGG.
Sicherheit und Robustheit¶
- Alle SQL-Queries parametrisiert (kein SQL-Injection-Risiko)
- Audio-Uploads werden auf Größe, Format und WAV-Header validiert
- Dateinamen-Sanitization und Path-Traversal-Schutz für nutzergenerierte Pfade
- Längen-Limits für Texteingaben und Segmentanzahl
- Robuste Verarbeitung uneinheitlicher Audio-Formate aus unterschiedlichen Browsern und Aufnahmegeräten (WebM, CAF, WMA u.a.) mit automatischer Konvertierung nach WAV