Zum Inhalt

TTS-Suite

TTS-Suite ist eine webbasierte Plattform zur Produktion mehrstimmiger Audio-Inhalte aus Text. Sie bündelt drei heterogene TTS-Modellfamilien mit insgesamt sieben Betriebsmodi, ein ASR-Modell zur automatischen Qualitätssicherung und ein LLM zur Skriptgenerierung zu einer durchgängigen Produktionskette. Die Verarbeitung erfolgt als mehrstufige, segmentweise Pipeline mit zentralisierter Emotionssteuerung und studio-tauglichem Audio-Post-Processing.

Auf einen Blick

  • Aus einem Rohtext fertige Audio-Produktionen erzeugen — vom LLM-generierten Skript bis zur exportfertigen Datei in einem Werkzeug
  • Sprecher-Profile aus Preset-Stimmen, Textbeschreibungen oder eigenem Referenz-Audio anlegen, mit Emotions-Varianten je Profil
  • Audio-Inhalte für Forschungs-Podcasts, Experten-Interviews, moderierte Diskussionsrunden, Hörbücher, Audio-Vorträge, Lehrvideos und barrierefreie Studienmaterialien produzieren
  • Generierte Segmente automatisch per ASR auf Sprachtreue prüfen und gezielt nur problematische Stellen neu generieren
  • Audio nach branchenüblichen Lautheits-Standards (LUFS, EBU R128) für unterschiedliche Veröffentlichungswege nachbearbeiten
  • Stimm-Bibliothek persistent verwalten und über Projekte hinweg wiederverwenden

Highlights

Im Unterschied zu einem direkten Aufruf eines einzelnen TTS-Modells oder einem dünnen Skript um eine API liefert TTS-Suite eine vollständige Produktionskette. Die folgenden Differenzierungsmerkmale prägen die Ergebnisqualität:

  • Drei TTS-Modellfamilien hinter einer Abstraktion — Qwen3-TTS (Alibaba), Voxtral 4B (Mistral AI) und Fish Speech S2 Pro werden über einen einheitlichen Router eingebunden. Sieben Betriebsmodi (Preset-Stimmen, VoiceDesign aus Textbeschreibung, Voice-Cloning) stehen zur Wahl, ohne dass die Unterschiede in den Backend-APIs nach außen sichtbar werden.
  • Anbindung an sieben externe Endpoints — vLLM-Omni-Instanzen für die fünf TTS-Modi und das ASR-Modell sowie ein OpenAI-kompatibler LLM-Server (Ollama, vLLM, OpenAI API) für die Skriptgenerierung.
  • Einheitliche Emotionssteuerung über zwei Paradigmen — Ein Emotions-Router übersetzt eine abstrakte Emotion (neutral, freundlich, begeistert u.a.) backend-spezifisch in natürlichsprachliche Instruktionen (Qwen3, Voxtral) oder in Inline-Tags im Sprechtext (Fish Speech). Fuzzy-Mapping erkennt Synonyme; ein dreistufiger Fallback (direkt → gemappt → Standard) garantiert ein lauffähiges Routing.
  • ASR-gestützte Qualitätssicherung — Jedes generierte Segment wird per Qwen3-ASR zurücktranskribiert und mit dem Originaltext verglichen. Die Wortfehlerrate (WER) markiert auffällige Segmente, die einzeln oder als Batch mit alternativer Emotion neu generiert werden können. Die WER-Schwelle ist pro Projekt einstellbar.
  • LLM-gestützte Skriptgenerierung mit Format-Regeln — Sechs vordefinierte Dialog-Formate (Podcast, Interview, Diskussion, Hörbuch, Vortrag, Lehrvideo) bringen jeweils eigene Prompt-Vorlagen, Sprecheranzahl-Vorgaben und nachgelagerte Pipeline-Anpassungen mit. Anti-Halluzinations-Regeln und ein separates Feld für verbatim einzufügende Sprecher-Hintergründe verhindern erfundene biografische Details.
  • Konsistenter Ton über segmentweise Synthese — Längere Audio-Strecken wirken über Segmentgrenzen hinweg gleichmäßig, weil das LLM zusammenhängende Sätze zu größeren Segmenten bündelt, der Emotion-Router beim Lehrvideo-Format zwangsweise auf neutral schaltet und backend-spezifische Stabilitäts-Tags injiziert werden.
  • Studio-taugliches Audio-Post-Processing — Eine konfigurierbare DSP-Kette aus Highpass, Kompressor, LUFS-Normalisierung und True-Peak-Limiter mit sieben Presets (Rohschnitt, Podcast, Radio, Hörbuch, Broadcast EBU R128, Sonor, Lehrvideo). IIR-Filter werden mit Steady-State-Initialisierung betrieben, sodass am Dateianfang keine hörbaren Einschwing-Artefakte entstehen.
  • Robuste Pegel- und Sample-Rate-Harmonisierung — Vor dem Zusammenfügen werden Segmente auf einen einheitlichen RMS-Pegel gebracht und Sample-Raten unterschiedlicher Backends (24 kHz Qwen3/Voxtral, 44.1 kHz Fish Speech) einander angeglichen.
  • Geführter Workflow mit gemeinsamem Sitzungs-Zustand — Skript-ID, Projekt-ID und WER-Schwelle werden zwischen den fünf Tabs automatisch durchgereicht. Manuelles Kopieren von IDs oder JSON-Strukturen entfällt.
  • Persistente Stimm- und Skript-Bibliothek — Stimmprofile inklusive Referenz-Audios und Skripte liegen in einer SQLite-Datenbank (WAL-Modus, Thread-safe) und stehen projektübergreifend zur Verfügung.