Zyphra veröffentlicht ZONOS2: Open-Source MoE-TTS mit 8B Parametern und Voice Cloning
ZONOS2 setzt auf eine Sparse-Mixture-of-Experts-Architektur, bei der von 8B Gesamtparametern zur Inferenzzeit nur 900M aktiv sind – ein Designprinzip, das hohe Modellkapazität mit vertretbarem Rechenaufwand verbindet und Echtzeit-TTS auf Consumer-Hardware ermöglichen soll. Für die Audiogenerierung prognostiziert das Modell Descript Audio Codec (DAC)-Tokens bei 44,1 kHz, was Studio-Qualität verspricht, aber höhere Modellierungsanforderungen stellt als gängige Low-Quality-Codec-Setups. Statt eines klassischen Phonemizers verarbeitet ZONOS2 rohe UTF-8-Bytes direkt, was laut Zyphra besonders für Sprachen wie Chinesisch, Koreanisch und Japanisch sowie für Code-Switching innerhalb eines Satzes Vorteile bringt. Das Trainingsvolumen wurde von rund 200.000 auf über 6 Millionen Stunden Audio massiv ausgebaut; ein mehrstufiges Daten-Filtering mit steigender Transkript-Übereinstimmungsstrenge soll Halluzinationen, Aussprachefehlern und Wiederholungen entgegenwirken. Im hauseigenen TTSDS-Prosody-Benchmark erreicht ZONOS2 8B einen Score von 88,7 und liegt damit vor Konkurrenzmodellen wie Qwen 3 TTS (87,6), Inworld TTS 2 (87,5) und ElevenLabs V3 (83,2). Zyphra stellt gleichzeitig ZTTS1-Eval als neues Open-Source-Benchmark-Framework vor, das bis zu 17 Sprachen abdeckt und moderne Evaluierungsmodelle wie Qwen3-ASR, ReDimNet und MSR-UTMOS sowie Prosodiekennzahlen integriert. Modellgewichte und Inferenzcode sind unter Apache 2.0 frei verfügbar; zusätzlich bietet Zyphra Cloud einen gehosteten Zugang auf AMD-Hardware an.
- Trainingskorpus wurde von ~200.000 auf 6+ Millionen Stunden Audio ausgebaut – mit dreistufigem Filtering (Pretraining, Midtraining, Annealing).
- ZTTS1-Eval umfasst Clean- und In-the-Wild-Datensätze in bis zu 17 Sprachen und nutzt Qwen3-ASR sowie ReDimNet zur Evaluierung.
- ZONOS2 8B (Quality Mode) erreicht im TTSDS-Prosody-Benchmark nur 85,6 – weniger als der Standard-Modus (88,7), was auf einen Speed-Quality-Tradeoff hindeutet.
- Zyphra Cloud betreibt das Modell auf AMD-Hardware und bietet damit eine gehostete Alternative zur lokalen Ausführung.
- Inference-Code und Eval-Code werden in separaten GitHub-Repositories (Zyphra/ZONOS2 und Zyphra/ZTTS1-Eval) bereitgestellt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com2w
TontaubeV1: Offenes 2,9B-TTS-Modell für lokale Langform-Sprachgenerierung
- LAUNCHreddit.com5d
LoudKit: Lokales TTS mit Voice Cloning, 10 Sprachen und Multi-SDK-Support
- LAUNCHreddit.com3w
FireRedTeam veröffentlicht FireRedAudio (9B) und FireRedTTS3 für Audio & Sprache
- MEINUNGreddit.com2w
Breeze-TTS-2: Frontier-TTS-Modell lokal nutzbar mit ~7 GB
Zyphra veröffentlicht ZONOS2: Open-Source MoE-TTS mit 8B Parametern und Voice Cloning
ZONOS2 setzt auf eine Sparse-Mixture-of-Experts-Architektur, bei der von 8B Gesamtparametern zur Inferenzzeit nur 900M aktiv sind – ein Designprinzip, das hohe Modellkapazität mit vertretbarem Rechenaufwand verbindet und Echtzeit-TTS auf Consumer-Hardware ermöglichen soll. Für die Audiogenerierung prognostiziert das Modell Descript Audio Codec (DAC)-Tokens bei 44,1 kHz, was Studio-Qualität verspricht, aber höhere Modellierungsanforderungen stellt als gängige Low-Quality-Codec-Setups. Statt eines klassischen Phonemizers verarbeitet ZONOS2 rohe UTF-8-Bytes direkt, was laut Zyphra besonders für Sprachen wie Chinesisch, Koreanisch und Japanisch sowie für Code-Switching innerhalb eines Satzes Vorteile bringt. Das Trainingsvolumen wurde von rund 200.000 auf über 6 Millionen Stunden Audio massiv ausgebaut; ein mehrstufiges Daten-Filtering mit steigender Transkript-Übereinstimmungsstrenge soll Halluzinationen, Aussprachefehlern und Wiederholungen entgegenwirken. Im hauseigenen TTSDS-Prosody-Benchmark erreicht ZONOS2 8B einen Score von 88,7 und liegt damit vor Konkurrenzmodellen wie Qwen 3 TTS (87,6), Inworld TTS 2 (87,5) und ElevenLabs V3 (83,2). Zyphra stellt gleichzeitig ZTTS1-Eval als neues Open-Source-Benchmark-Framework vor, das bis zu 17 Sprachen abdeckt und moderne Evaluierungsmodelle wie Qwen3-ASR, ReDimNet und MSR-UTMOS sowie Prosodiekennzahlen integriert. Modellgewichte und Inferenzcode sind unter Apache 2.0 frei verfügbar; zusätzlich bietet Zyphra Cloud einen gehosteten Zugang auf AMD-Hardware an.
- Trainingskorpus wurde von ~200.000 auf 6+ Millionen Stunden Audio ausgebaut – mit dreistufigem Filtering (Pretraining, Midtraining, Annealing).
- ZTTS1-Eval umfasst Clean- und In-the-Wild-Datensätze in bis zu 17 Sprachen und nutzt Qwen3-ASR sowie ReDimNet zur Evaluierung.
- ZONOS2 8B (Quality Mode) erreicht im TTSDS-Prosody-Benchmark nur 85,6 – weniger als der Standard-Modus (88,7), was auf einen Speed-Quality-Tradeoff hindeutet.
- Zyphra Cloud betreibt das Modell auf AMD-Hardware und bietet damit eine gehostete Alternative zur lokalen Ausführung.
- Inference-Code und Eval-Code werden in separaten GitHub-Repositories (Zyphra/ZONOS2 und Zyphra/ZTTS1-Eval) bereitgestellt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com2w
TontaubeV1: Offenes 2,9B-TTS-Modell für lokale Langform-Sprachgenerierung
- LAUNCHreddit.com5d
LoudKit: Lokales TTS mit Voice Cloning, 10 Sprachen und Multi-SDK-Support
- LAUNCHreddit.com3w
FireRedTeam veröffentlicht FireRedAudio (9B) und FireRedTTS3 für Audio & Sprache
- MEINUNGreddit.com2w
Breeze-TTS-2: Frontier-TTS-Modell lokal nutzbar mit ~7 GB