OpenMOSS veröffentlicht MOSS-TTS-v1.5 mit 31 Sprachen und expliziter Pause-Steuerung
MOSS-TTS-v1.5 ist das Nachfolgemodell von MOSS-TTS 1.0 des OpenMOSS-Teams und baut direkt auf dessen Funktionsumfang auf. Das Modell unterstützt Zero-Shot-Voice-Cloning, Long-Form-Sprachsynthese, Token-Level-Duration-Control sowie Pinyin/IPA-Aussprachesteuerung. Gegenüber Version 1.0 wurden vor allem die mehrsprachige Synthese, die Stabilität beim Voice-Cloning und die Interpunktions-Prosodie verbessert. Neu ist die explizite Pause-Steuerung über Inline-Marker wie „[pause 3.2s]", die sich direkt in den Eingabetext einfügen lassen. Die Sprachunterstützung wurde von 20 auf 31 Sprachen ausgebaut – neu hinzugekommen sind u. a. Kantonesisch, Niederländisch, Finnisch, Hindi, Malaiisch, Rumänisch, Suaheli, Tagalog, Thailändisch und Vietnamesisch. Sprach-Tags können über den Parameter `language` im `build_user_message`-Aufruf gesetzt werden, was laut den Entwicklern bei fast allen unterstützten Sprachen zu besseren Ergebnissen führt als der sprachunabhängige Modus. Zusätzlich veröffentlichte das Team das begleitende Modell MOSS-SoundEffect-v2.0 auf Hugging Face.
- MOSS-TTS-v1.5 erweitert die Sprachunterstützung von 20 auf 31 Sprachen, u. a. Kantonesisch, Hindi, Tagalog und Vietnamesisch.
- Neue Inline-Pause-Marker wie [pause 3.2s] ermöglichen präzise zeitliche Steuerung im Fließtext.
- Verbessertes Voice-Cloning: höhere Speaker-Similarity und geringere Varianz bei wiederholten Generierungen.
- v1.5 behandelt Szenarien, in denen die Referenz-Audio deutlich länger als der Zieltext ist, zuverlässiger als 1.0.
- Parallel veröffentlicht: MOSS-SoundEffect-v2.0 auf Hugging Face vom selben Team.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com5d
LoudKit: Lokales TTS mit Voice Cloning, 10 Sprachen und Multi-SDK-Support
- LAUNCHreddit.com2w
TontaubeV1: Offenes 2,9B-TTS-Modell für lokale Langform-Sprachgenerierung
- LAUNCHreddit.com3w
FireRedTeam veröffentlicht FireRedAudio (9B) und FireRedTTS3 für Audio & Sprache
- FORSCHUNGarxiv.org0mo
Voice Cloning in T2AV-Modelle via einzelne Zero-Init-Schicht
OpenMOSS veröffentlicht MOSS-TTS-v1.5 mit 31 Sprachen und expliziter Pause-Steuerung
MOSS-TTS-v1.5 ist das Nachfolgemodell von MOSS-TTS 1.0 des OpenMOSS-Teams und baut direkt auf dessen Funktionsumfang auf. Das Modell unterstützt Zero-Shot-Voice-Cloning, Long-Form-Sprachsynthese, Token-Level-Duration-Control sowie Pinyin/IPA-Aussprachesteuerung. Gegenüber Version 1.0 wurden vor allem die mehrsprachige Synthese, die Stabilität beim Voice-Cloning und die Interpunktions-Prosodie verbessert. Neu ist die explizite Pause-Steuerung über Inline-Marker wie „[pause 3.2s]", die sich direkt in den Eingabetext einfügen lassen. Die Sprachunterstützung wurde von 20 auf 31 Sprachen ausgebaut – neu hinzugekommen sind u. a. Kantonesisch, Niederländisch, Finnisch, Hindi, Malaiisch, Rumänisch, Suaheli, Tagalog, Thailändisch und Vietnamesisch. Sprach-Tags können über den Parameter `language` im `build_user_message`-Aufruf gesetzt werden, was laut den Entwicklern bei fast allen unterstützten Sprachen zu besseren Ergebnissen führt als der sprachunabhängige Modus. Zusätzlich veröffentlichte das Team das begleitende Modell MOSS-SoundEffect-v2.0 auf Hugging Face.
- MOSS-TTS-v1.5 erweitert die Sprachunterstützung von 20 auf 31 Sprachen, u. a. Kantonesisch, Hindi, Tagalog und Vietnamesisch.
- Neue Inline-Pause-Marker wie [pause 3.2s] ermöglichen präzise zeitliche Steuerung im Fließtext.
- Verbessertes Voice-Cloning: höhere Speaker-Similarity und geringere Varianz bei wiederholten Generierungen.
- v1.5 behandelt Szenarien, in denen die Referenz-Audio deutlich länger als der Zieltext ist, zuverlässiger als 1.0.
- Parallel veröffentlicht: MOSS-SoundEffect-v2.0 auf Hugging Face vom selben Team.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com5d
LoudKit: Lokales TTS mit Voice Cloning, 10 Sprachen und Multi-SDK-Support
- LAUNCHreddit.com2w
TontaubeV1: Offenes 2,9B-TTS-Modell für lokale Langform-Sprachgenerierung
- LAUNCHreddit.com3w
FireRedTeam veröffentlicht FireRedAudio (9B) und FireRedTTS3 für Audio & Sprache
- FORSCHUNGarxiv.org0mo
Voice Cloning in T2AV-Modelle via einzelne Zero-Init-Schicht