Inflect v2: Ultra-kompakte TTS-Modelle mit unter 4M und 10M Parametern
Inflect v2 ist das Folgeprojekt eines Schüler-Entwicklers (Reddit-Nutzer b111ue / GitHub: owenawsong), der sich auf miniaturisierte Text-to-Speech-Systeme spezialisiert hat. Die Vorgängerversion Inflect-Nano-v1 (4,63M Parameter) erschien rund einen Monat vor dem heutigen Release und diente als Machbarkeitsnachweis, litt aber an unstabilem Timing, metallisch klingendem Output, schwacher Prosodie und einem zu kleinen Waveform-Decoder – Probleme, die in v2 gezielt adressiert wurden. Beide neuen Modelle geben 24-kHz-Sprache aus, sind vollständig self-contained (Text-Prozessierung, Timing-Vorhersage, Sprachgenerierung und Waveform-Decoder in einem Checkpoint) und laufen über eine einheitliche PyTorch-API auf CPU oder CUDA. Die Qualitätsmessung erfolgte über UTMOS22 (ein automatisches Mean-Opinion-Score-Modell) sowie semantische Wortfehlerrate (WER): Micro erreicht 4,395 UTMOS22 bei 3,99 % WER, Nano 4,386 UTMOS22 bei 4,21 % WER. In einem blinden Community-Vergleich gegen andere kompakte TTS-Systeme belegten Micro und Nano die Plätze zwei und drei. Grenzen des Systems sind klar benannt: ausschließlich Englisch, eine feste männliche Stimme, kein Voice-Cloning, und Schwäche bei unbekannten Eigennamen, Abkürzungen, Zahlen und Homographen. Ein v3 ist in Erwägung gezogen und würde sich laut Entwickler eher auf zusätzliche Stimmen, mehr Sprachen und einfacheres Fine-Tuning konzentrieren als auf weitere Parametereinsparungen.
- Nano (3,96M) ist 126× kleiner als Chatterbox und über 1.000× kleiner als Fish Audio S2 Pro – rein auf Parameteranzahl bezogen.
- Das Training erfolgte mit begrenztem Budget; Effizienz musste laut Entwickler nicht nur für Inferenz, sondern auch für Training und Evaluation gelten.
- Beide Modelle sind auf HuggingFace Spaces als interaktiver Playground testbar (owensong/Inflect-v2), Gewichte und Code liegen auf GitHub (owenawsong/Inflect).
- Micro liefert 6,28× Echtzeit auf CPU, Nano 10,72× – d.h. 1 Sekunde Rechenzeit erzeugt bis zu 10,72 Sekunden Sprachausgabe.
- Bekannte Schwachstellen: Nano klingt gelegentlich dünner als Micro; beide können metallische oder geclippte Artefakte bei schwierigen Eingaben erzeugen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com1w
sanoTTS: Kleinstes neuronales TTS-Modell mit 294k Parametern läuft auf 3-Dollar-Mikrocontroller
- MEINUNGreddit.com2w
Breeze-TTS-2: Frontier-TTS-Modell lokal nutzbar mit ~7 GB
- LAUNCHreddit.com2w
TontaubeV1: Offenes 2,9B-TTS-Modell für lokale Langform-Sprachgenerierung
- MEINUNGreddit.com2w
Community-Diskussion: Lokale TTS-Modelle im Praxistest – Zuverlässigkeit mangelhaft
Inflect v2: Ultra-kompakte TTS-Modelle mit unter 4M und 10M Parametern
Inflect v2 ist das Folgeprojekt eines Schüler-Entwicklers (Reddit-Nutzer b111ue / GitHub: owenawsong), der sich auf miniaturisierte Text-to-Speech-Systeme spezialisiert hat. Die Vorgängerversion Inflect-Nano-v1 (4,63M Parameter) erschien rund einen Monat vor dem heutigen Release und diente als Machbarkeitsnachweis, litt aber an unstabilem Timing, metallisch klingendem Output, schwacher Prosodie und einem zu kleinen Waveform-Decoder – Probleme, die in v2 gezielt adressiert wurden. Beide neuen Modelle geben 24-kHz-Sprache aus, sind vollständig self-contained (Text-Prozessierung, Timing-Vorhersage, Sprachgenerierung und Waveform-Decoder in einem Checkpoint) und laufen über eine einheitliche PyTorch-API auf CPU oder CUDA. Die Qualitätsmessung erfolgte über UTMOS22 (ein automatisches Mean-Opinion-Score-Modell) sowie semantische Wortfehlerrate (WER): Micro erreicht 4,395 UTMOS22 bei 3,99 % WER, Nano 4,386 UTMOS22 bei 4,21 % WER. In einem blinden Community-Vergleich gegen andere kompakte TTS-Systeme belegten Micro und Nano die Plätze zwei und drei. Grenzen des Systems sind klar benannt: ausschließlich Englisch, eine feste männliche Stimme, kein Voice-Cloning, und Schwäche bei unbekannten Eigennamen, Abkürzungen, Zahlen und Homographen. Ein v3 ist in Erwägung gezogen und würde sich laut Entwickler eher auf zusätzliche Stimmen, mehr Sprachen und einfacheres Fine-Tuning konzentrieren als auf weitere Parametereinsparungen.
- Nano (3,96M) ist 126× kleiner als Chatterbox und über 1.000× kleiner als Fish Audio S2 Pro – rein auf Parameteranzahl bezogen.
- Das Training erfolgte mit begrenztem Budget; Effizienz musste laut Entwickler nicht nur für Inferenz, sondern auch für Training und Evaluation gelten.
- Beide Modelle sind auf HuggingFace Spaces als interaktiver Playground testbar (owensong/Inflect-v2), Gewichte und Code liegen auf GitHub (owenawsong/Inflect).
- Micro liefert 6,28× Echtzeit auf CPU, Nano 10,72× – d.h. 1 Sekunde Rechenzeit erzeugt bis zu 10,72 Sekunden Sprachausgabe.
- Bekannte Schwachstellen: Nano klingt gelegentlich dünner als Micro; beide können metallische oder geclippte Artefakte bei schwierigen Eingaben erzeugen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com1w
sanoTTS: Kleinstes neuronales TTS-Modell mit 294k Parametern läuft auf 3-Dollar-Mikrocontroller
- MEINUNGreddit.com2w
Breeze-TTS-2: Frontier-TTS-Modell lokal nutzbar mit ~7 GB
- LAUNCHreddit.com2w
TontaubeV1: Offenes 2,9B-TTS-Modell für lokale Langform-Sprachgenerierung
- MEINUNGreddit.com2w
Community-Diskussion: Lokale TTS-Modelle im Praxistest – Zuverlässigkeit mangelhaft