CPU-only TTS-Benchmark: Kokoro 82M vs Supertonic-3 vs Inflect-Nano mit UTMOS-Scoring
Der Benchmark wurde von Nutzer /u/gvij auf Reddit veröffentlicht und vergleicht fünf Konfigurationen aus drei Open-Weight-TTS-Familien ausschließlich auf CPU – konkret einem Intel Xeon mit 4 Kernen und 15,6 GB RAM, ohne GPU-Unterstützung. Die Methodik ist ungewöhnlich rigoros für einen Community-Beitrag: Sechs Textlängen (12 bis 1712 Zeichen), fünf Wiederholungen pro Zelle nach Warmup, insgesamt 150 getimte Durchläufe und automatische Sprachqualitätsbewertung mit UTMOS (utmos22_strong) für jede einzelne Audioausgabe. Besonders relevant ist der Hinweis auf ein strukturelles Problem bei Inflect-Nano-v1: Der akustische Encoder hat ein hartes Limit von max_frames=1400, was einer Ausgabedauer von etwa 15 Sekunden entspricht. Längere Texte werden stillschweigend abgeschnitten, wodurch die RTF-Werte des Modells für lange Eingaben systematisch verfälscht sind. Supertonic-3 im 2-Step-Modus ist zwar fast so schnell wie Inflect-Nano, erreicht aber nur einen UTMOS-MOS von 1.53 und ist laut Autor nicht produktionsreif. Kokoro zeigt ein unerwartetes Skalierungsverhalten: Statt bei längeren Texten effizienter zu werden (Amortisierung), steigt der RTF-Wert mit der Textlänge an – im PyTorch-Backend von 0,60 auf 0,99, im ONNX-Backend von 0,51 auf 0,69. Der Benchmark wurde nach eigener Aussage des Autors vollständig von einem KI-Coding-Agenten namens Neo erstellt und ausgeführt, was ihn zugleich zu einem Proof-of-Concept für autonomes Benchmark-Engineering macht.
- Inflect-Nano-v1 hat nur 4,6M Parameter und erreicht 7,3× Echtzeit – sein UTMOS-Score wird aber durch HiFi-GAN-Vocoder-Artefakte künstlich hochgetrieben.
- Der harte max_frames=1400-Grenzwert bei Inflect-Nano führt zu stiller Trunkierung; ein fairer Vergleich ist laut Autor nur bei Eingaben innerhalb des 15s-Limits möglich.
- Kokoro ONNX ist gegenüber Kokoro PyTorch deutlich schneller (RTF 0,5711 vs. 0,7865), liefert dabei aber praktisch identische UTMOS-Scores (Differenz unter 0,01).
- Supertonic-3 steht unter der OpenRAIL-M-Lizenz – für kommerzielle Use-Cases muss diese Bedingung explizit geprüft werden.
- Das gesamte Benchmark-Setup inklusive Code wurde nach Angabe des Autors von einem KI-Agenten namens Neo generiert und ausgeführt; Repo und eingebettete Audiobeispiele sind im ersten Kommentar verlinkt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com2w
Community-Diskussion: Lokale TTS-Modelle im Praxistest – Zuverlässigkeit mangelhaft
- LAUNCHreddit.com3w
Qwen3-TTS mit 34 ms Time-to-First-Audio und 10 RPS auf H100
- FORSCHUNGarxiv.org6d
TontaubeV1: Streaming-TTS mit hierarchischem Codec und 200 ms bis zum ersten Audio
- LAUNCHreddit.com1w
sanoTTS: Kleinstes neuronales TTS-Modell mit 294k Parametern läuft auf 3-Dollar-Mikrocontroller
CPU-only TTS-Benchmark: Kokoro 82M vs Supertonic-3 vs Inflect-Nano mit UTMOS-Scoring
Der Benchmark wurde von Nutzer /u/gvij auf Reddit veröffentlicht und vergleicht fünf Konfigurationen aus drei Open-Weight-TTS-Familien ausschließlich auf CPU – konkret einem Intel Xeon mit 4 Kernen und 15,6 GB RAM, ohne GPU-Unterstützung. Die Methodik ist ungewöhnlich rigoros für einen Community-Beitrag: Sechs Textlängen (12 bis 1712 Zeichen), fünf Wiederholungen pro Zelle nach Warmup, insgesamt 150 getimte Durchläufe und automatische Sprachqualitätsbewertung mit UTMOS (utmos22_strong) für jede einzelne Audioausgabe. Besonders relevant ist der Hinweis auf ein strukturelles Problem bei Inflect-Nano-v1: Der akustische Encoder hat ein hartes Limit von max_frames=1400, was einer Ausgabedauer von etwa 15 Sekunden entspricht. Längere Texte werden stillschweigend abgeschnitten, wodurch die RTF-Werte des Modells für lange Eingaben systematisch verfälscht sind. Supertonic-3 im 2-Step-Modus ist zwar fast so schnell wie Inflect-Nano, erreicht aber nur einen UTMOS-MOS von 1.53 und ist laut Autor nicht produktionsreif. Kokoro zeigt ein unerwartetes Skalierungsverhalten: Statt bei längeren Texten effizienter zu werden (Amortisierung), steigt der RTF-Wert mit der Textlänge an – im PyTorch-Backend von 0,60 auf 0,99, im ONNX-Backend von 0,51 auf 0,69. Der Benchmark wurde nach eigener Aussage des Autors vollständig von einem KI-Coding-Agenten namens Neo erstellt und ausgeführt, was ihn zugleich zu einem Proof-of-Concept für autonomes Benchmark-Engineering macht.
- Inflect-Nano-v1 hat nur 4,6M Parameter und erreicht 7,3× Echtzeit – sein UTMOS-Score wird aber durch HiFi-GAN-Vocoder-Artefakte künstlich hochgetrieben.
- Der harte max_frames=1400-Grenzwert bei Inflect-Nano führt zu stiller Trunkierung; ein fairer Vergleich ist laut Autor nur bei Eingaben innerhalb des 15s-Limits möglich.
- Kokoro ONNX ist gegenüber Kokoro PyTorch deutlich schneller (RTF 0,5711 vs. 0,7865), liefert dabei aber praktisch identische UTMOS-Scores (Differenz unter 0,01).
- Supertonic-3 steht unter der OpenRAIL-M-Lizenz – für kommerzielle Use-Cases muss diese Bedingung explizit geprüft werden.
- Das gesamte Benchmark-Setup inklusive Code wurde nach Angabe des Autors von einem KI-Agenten namens Neo generiert und ausgeführt; Repo und eingebettete Audiobeispiele sind im ersten Kommentar verlinkt.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com2w
Community-Diskussion: Lokale TTS-Modelle im Praxistest – Zuverlässigkeit mangelhaft
- LAUNCHreddit.com3w
Qwen3-TTS mit 34 ms Time-to-First-Audio und 10 RPS auf H100
- FORSCHUNGarxiv.org6d
TontaubeV1: Streaming-TTS mit hierarchischem Codec und 200 ms bis zum ersten Audio
- LAUNCHreddit.com1w
sanoTTS: Kleinstes neuronales TTS-Modell mit 294k Parametern läuft auf 3-Dollar-Mikrocontroller