Gepard TTS: 68,7 ms Time-to-First-Audio auf einer RTX 4090 – Apache 2.0
Gepard 1.0, entwickelt von nineninesix.ai, wurde über das öffentliche Benchmark-Harness von Coval gegen 25 TTS-APIs getestet. Die Latenz-Messung unterscheidet dabei zwischen dem Silence-Offset (20,5 ms) und der eigentlichen Time-to-First-Audio (TTFA), die beim Median (p50) bei 68,7 ms liegt. Der p90-Wert beträgt 85,8 ms, die schlechteste gemessene Einzelprobe kam auf 104,8 ms. Wichtig für die Einordnung: Das Team von nineninesix.ai hat den Benchmark selbst von Kalifornien aus gegen den eigenen Endpoint durchgeführt und den Netzwerk-Roundtrip herausgerechnet — die Einträge auf Covals offiziellem Board sind dagegen nicht netzwerknormalisiert und tragen daher den jeweiligen Latenz-Overhead des Coval-Runners. Das Modell lief auf einer einzelnen RTX 4090 via RunPod, also auf Consumer-Hardware ohne dediziertes Serverrack. Das Benchmark-Harness ist auf GitHub unter nineninesix-ai/benchmarks öffentlich verfügbar und unterstützt das Testen eigener Modelle über vLLM. Vollständige Methodik und Charts sind im Blogpost auf nineninesix.ai dokumentiert; das Team gibt an, eine unabhängige Verifizierung durch Coval zu bevorzugen.
- TTFA p90 liegt bei 85,8 ms, schlechtester Einzelwert bei 104,8 ms — Silenz-Vorlauf beträgt 20,5 ms vor dem ersten Audiosample.
- Test lief auf einer einzelnen RTX 4090 über RunPod (kein dediziertes Rechenzentrum), Netzwerk-Roundtrip wurde manuell herausgerechnet.
- Das Benchmark-Harness ist unter github.com/nineninesix-ai/benchmarks öffentlich, eigene Endpoints lassen sich via vLLM einbinden.
- 24 der 25 APIs auf dem Coval-Leaderboard sind closed-source; Gepard 1.0 ist das einzige Apache-2.0-lizenzierte Modell im Vergleich.
- Reddit-Post stammt vom Nutzer /u/ylankgz, Volltext-Methodik und Charts sind im nineninesix.ai-Blog veröffentlicht.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com3w
Qwen3-TTS mit 34 ms Time-to-First-Audio und 10 RPS auf H100
- FORSCHUNGarxiv.org4d
TontaubeV1: Streaming-TTS mit hierarchischem Codec und 200 ms bis zum ersten Audio
- LAUNCHreddit.com2w
TontaubeV1: Offenes 2,9B-TTS-Modell für lokale Langform-Sprachgenerierung
- MEINUNGreddit.com2w
Community-Diskussion: Lokale TTS-Modelle im Praxistest – Zuverlässigkeit mangelhaft
Gepard TTS: 68,7 ms Time-to-First-Audio auf einer RTX 4090 – Apache 2.0
Gepard 1.0, entwickelt von nineninesix.ai, wurde über das öffentliche Benchmark-Harness von Coval gegen 25 TTS-APIs getestet. Die Latenz-Messung unterscheidet dabei zwischen dem Silence-Offset (20,5 ms) und der eigentlichen Time-to-First-Audio (TTFA), die beim Median (p50) bei 68,7 ms liegt. Der p90-Wert beträgt 85,8 ms, die schlechteste gemessene Einzelprobe kam auf 104,8 ms. Wichtig für die Einordnung: Das Team von nineninesix.ai hat den Benchmark selbst von Kalifornien aus gegen den eigenen Endpoint durchgeführt und den Netzwerk-Roundtrip herausgerechnet — die Einträge auf Covals offiziellem Board sind dagegen nicht netzwerknormalisiert und tragen daher den jeweiligen Latenz-Overhead des Coval-Runners. Das Modell lief auf einer einzelnen RTX 4090 via RunPod, also auf Consumer-Hardware ohne dediziertes Serverrack. Das Benchmark-Harness ist auf GitHub unter nineninesix-ai/benchmarks öffentlich verfügbar und unterstützt das Testen eigener Modelle über vLLM. Vollständige Methodik und Charts sind im Blogpost auf nineninesix.ai dokumentiert; das Team gibt an, eine unabhängige Verifizierung durch Coval zu bevorzugen.
- TTFA p90 liegt bei 85,8 ms, schlechtester Einzelwert bei 104,8 ms — Silenz-Vorlauf beträgt 20,5 ms vor dem ersten Audiosample.
- Test lief auf einer einzelnen RTX 4090 über RunPod (kein dediziertes Rechenzentrum), Netzwerk-Roundtrip wurde manuell herausgerechnet.
- Das Benchmark-Harness ist unter github.com/nineninesix-ai/benchmarks öffentlich, eigene Endpoints lassen sich via vLLM einbinden.
- 24 der 25 APIs auf dem Coval-Leaderboard sind closed-source; Gepard 1.0 ist das einzige Apache-2.0-lizenzierte Modell im Vergleich.
- Reddit-Post stammt vom Nutzer /u/ylankgz, Volltext-Methodik und Charts sind im nineninesix.ai-Blog veröffentlicht.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com3w
Qwen3-TTS mit 34 ms Time-to-First-Audio und 10 RPS auf H100
- FORSCHUNGarxiv.org4d
TontaubeV1: Streaming-TTS mit hierarchischem Codec und 200 ms bis zum ersten Audio
- LAUNCHreddit.com2w
TontaubeV1: Offenes 2,9B-TTS-Modell für lokale Langform-Sprachgenerierung
- MEINUNGreddit.com2w
Community-Diskussion: Lokale TTS-Modelle im Praxistest – Zuverlässigkeit mangelhaft