Qwen3-TTS mit 34 ms Time-to-First-Audio und 10 RPS auf H100
Der Reddit-Nutzer /u/Forsaken_Goal3692 hat eine Open-Source-Implementierung von Qwen3-TTS 1.7B veröffentlicht, die auf einen deutlich niedrigeren Latenzbereich als bisherige lokale Lösungen abzielt. Kern des Projekts ist die Optimierung der sogenannten Time-to-First-Audio (TTFA) – der Zeit von der Anfrage bis zum ersten hörbaren Audioausgang. Verglichen werden die Ergebnisse explizit mit vLLM-Omni und SGLang-Omni, zwei verbreiteten Inferenz-Engines, gegenüber denen die neue Implementierung laut den Autoren einen deutlichen Geschwindigkeitsvorteil erzielt. Bemerkenswert ist, dass selbst kommerzielle Cloud-TTS-Dienste bisher oft schnellere Antwortzeiten aufwiesen als lokal betriebene Modelle – inklusive Netzwerklatenz. Die Implementierung ist auf GitHub verfügbar und enthält auch Benchmarks sowie eine erläuternde Blogpost-Dokumentation der Methodik. Neben dem H100-Setup wird ausdrücklich eine Konfiguration für die RTX 4090 beschrieben, die ähnliche TTFA-Werte erreicht. Das Projekt richtet sich damit sowohl an professionelle Deployments als auch an Enthusiasten mit Consumer-Hardware.
- Qwen3-TTS 1.7B ist das eingesetzte Modell – ein relativ kompaktes TTS-Modell, das für schnelle Inferenz geeignet ist.
- Die Benchmark-Methodik ist in einem begleitenden Blogpost dokumentiert und der Quellcode ist vollständig open source verfügbar.
- Als Vergleichsbasis dienen vLLM-Omni und SGLang-Omni, gegenüber denen die Implementierung laut Autoren erheblich schneller ist.
- Auf einem einzelnen H100 werden 10 RPS bei p95-TTFA unter 50 ms erreicht; mit Anpassungen steigt der Durchsatz auf 20 RPS bei unter 100 ms p95.
- Die RTX 4090 erreicht bei angepassten Einstellungen ebenfalls ~50 ms p95 TTFA – vergleichbar mit dem H100-Wert bei geringerem Durchsatz.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com2w
TontaubeV1: Offenes 2,9B-TTS-Modell für lokale Langform-Sprachgenerierung
- MEINUNGreddit.com2w
Community-Diskussion: Lokale TTS-Modelle im Praxistest – Zuverlässigkeit mangelhaft
- FORSCHUNGarxiv.org5d
TontaubeV1: Streaming-TTS mit hierarchischem Codec und 200 ms bis zum ersten Audio
- BENCHMARKreddit.com2w
Gepard TTS: 68,7 ms Time-to-First-Audio auf einer RTX 4090 – Apache 2.0
Qwen3-TTS mit 34 ms Time-to-First-Audio und 10 RPS auf H100
Der Reddit-Nutzer /u/Forsaken_Goal3692 hat eine Open-Source-Implementierung von Qwen3-TTS 1.7B veröffentlicht, die auf einen deutlich niedrigeren Latenzbereich als bisherige lokale Lösungen abzielt. Kern des Projekts ist die Optimierung der sogenannten Time-to-First-Audio (TTFA) – der Zeit von der Anfrage bis zum ersten hörbaren Audioausgang. Verglichen werden die Ergebnisse explizit mit vLLM-Omni und SGLang-Omni, zwei verbreiteten Inferenz-Engines, gegenüber denen die neue Implementierung laut den Autoren einen deutlichen Geschwindigkeitsvorteil erzielt. Bemerkenswert ist, dass selbst kommerzielle Cloud-TTS-Dienste bisher oft schnellere Antwortzeiten aufwiesen als lokal betriebene Modelle – inklusive Netzwerklatenz. Die Implementierung ist auf GitHub verfügbar und enthält auch Benchmarks sowie eine erläuternde Blogpost-Dokumentation der Methodik. Neben dem H100-Setup wird ausdrücklich eine Konfiguration für die RTX 4090 beschrieben, die ähnliche TTFA-Werte erreicht. Das Projekt richtet sich damit sowohl an professionelle Deployments als auch an Enthusiasten mit Consumer-Hardware.
- Qwen3-TTS 1.7B ist das eingesetzte Modell – ein relativ kompaktes TTS-Modell, das für schnelle Inferenz geeignet ist.
- Die Benchmark-Methodik ist in einem begleitenden Blogpost dokumentiert und der Quellcode ist vollständig open source verfügbar.
- Als Vergleichsbasis dienen vLLM-Omni und SGLang-Omni, gegenüber denen die Implementierung laut Autoren erheblich schneller ist.
- Auf einem einzelnen H100 werden 10 RPS bei p95-TTFA unter 50 ms erreicht; mit Anpassungen steigt der Durchsatz auf 20 RPS bei unter 100 ms p95.
- Die RTX 4090 erreicht bei angepassten Einstellungen ebenfalls ~50 ms p95 TTFA – vergleichbar mit dem H100-Wert bei geringerem Durchsatz.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com2w
TontaubeV1: Offenes 2,9B-TTS-Modell für lokale Langform-Sprachgenerierung
- MEINUNGreddit.com2w
Community-Diskussion: Lokale TTS-Modelle im Praxistest – Zuverlässigkeit mangelhaft
- FORSCHUNGarxiv.org5d
TontaubeV1: Streaming-TTS mit hierarchischem Codec und 200 ms bis zum ersten Audio
- BENCHMARKreddit.com2w
Gepard TTS: 68,7 ms Time-to-First-Audio auf einer RTX 4090 – Apache 2.0