audio.cpp Release 0.4: Higgs Audio v3 TTS 4B mit 10× Echtzeit-Speed in C++/GGML
audio.cpp ist ein auf C++ und GGML basierendes Inference-Framework, das lokale Sprachverarbeitung ohne Cloud-Anbindung ermöglicht. Mit Release 0.4 erweitert das Projekt seinen Modellkatalog auf 35 unterstützte Model-Familien, darunter neu hinzugekommen: Higgs Audio v3 (4B-Parameter-TTS), Fish Audio S2 Pro (TTS), Voxtral Realtime ASR sowie die Community-Modelle OuteTTS und VieNeu-TTS-v3. Ein zentrales Merkmal des Releases ist die vollständige GGUF-Unterstützung über das gesamte Projekt hinweg — alle veröffentlichten Model-Familien laden jetzt im GGUF-Format, und fertige Pakete stehen bereit. Die Q8-Quantisierung zeigt dabei auf einer RTX 5090 messbare Vorteile gegenüber 16-Bit-GGUF: bis zu 1,5× höhere Geschwindigkeit und bis zu 37 % weniger Peak-VRAM, je nach Modell und Nutzungsweg. Fish Audio S2 Pro erreicht warme Anfragen mit 3,1×–3,4× Echtzeit, läuft aber noch auf einer naiven Framework-Adaption mit Optimierungspotenzial. Für Voxtral ASR liegt die Offline-Verarbeitungsgeschwindigkeit bei 15,7× Echtzeit; Streaming-Anfragen starten mit einem TTFT (Time to First Token) von rund 171 ms. Der Autor weist explizit darauf hin, dass Q8 nicht universell sicher ist und hält eine öffentliche GGUF-Support-Matrix sowie einen Q8-Performance-Report vor, statt pauschal alle Quantisierungsstufen zu empfehlen.
- Higgs Audio v3 TTS 4B: warme Anfragen laufen 8,8×–10,1× schneller als Echtzeit; Longform-Generierung (6000+ Zeichen) liegt bei ca. 8,5× Echtzeit.
- Fish Audio S2 Pro: aktuelle Implementierung ist eine naive Framework-Adaption — der Autor sieht hier noch deutlich Luft nach oben bei der Performance.
- Voxtral ASR: Streaming-Modus erreicht ein Time-to-First-Token (TTFT) von ~171 ms; Offline-Modus läuft 15,7× schneller als Echtzeit.
- Tipp im Post: Chunk-Größe anpassen und Referenz-Audio-Länge kürzen kann bei Modellen wie Qwen3-TTS die Performance um bis zu 2× steigern.
- audio.cpp führt einen eigenen Community-Models-Bereich ein, für den eine niedrigere Review-Schwelle gilt — gedacht für Ports, die nützlich, aber noch nicht vollständig ausgereift sind.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com0mo
audio.cpp Release 0.6: MiniMax-H3, dots.tts und 5 neue Modellfamilien
- LAUNCHreddit.com2w
audio.cpp 0.7: 62 Audio-Modellfamilien, Arena UI für lokale Modellvergleiche
- MEINUNGreddit.com2w
Community-Diskussion: Lokale TTS-Modelle im Praxistest – Zuverlässigkeit mangelhaft
- FORSCHUNGarxiv.org4d
TontaubeV1: Streaming-TTS mit hierarchischem Codec und 200 ms bis zum ersten Audio
audio.cpp Release 0.4: Higgs Audio v3 TTS 4B mit 10× Echtzeit-Speed in C++/GGML
audio.cpp ist ein auf C++ und GGML basierendes Inference-Framework, das lokale Sprachverarbeitung ohne Cloud-Anbindung ermöglicht. Mit Release 0.4 erweitert das Projekt seinen Modellkatalog auf 35 unterstützte Model-Familien, darunter neu hinzugekommen: Higgs Audio v3 (4B-Parameter-TTS), Fish Audio S2 Pro (TTS), Voxtral Realtime ASR sowie die Community-Modelle OuteTTS und VieNeu-TTS-v3. Ein zentrales Merkmal des Releases ist die vollständige GGUF-Unterstützung über das gesamte Projekt hinweg — alle veröffentlichten Model-Familien laden jetzt im GGUF-Format, und fertige Pakete stehen bereit. Die Q8-Quantisierung zeigt dabei auf einer RTX 5090 messbare Vorteile gegenüber 16-Bit-GGUF: bis zu 1,5× höhere Geschwindigkeit und bis zu 37 % weniger Peak-VRAM, je nach Modell und Nutzungsweg. Fish Audio S2 Pro erreicht warme Anfragen mit 3,1×–3,4× Echtzeit, läuft aber noch auf einer naiven Framework-Adaption mit Optimierungspotenzial. Für Voxtral ASR liegt die Offline-Verarbeitungsgeschwindigkeit bei 15,7× Echtzeit; Streaming-Anfragen starten mit einem TTFT (Time to First Token) von rund 171 ms. Der Autor weist explizit darauf hin, dass Q8 nicht universell sicher ist und hält eine öffentliche GGUF-Support-Matrix sowie einen Q8-Performance-Report vor, statt pauschal alle Quantisierungsstufen zu empfehlen.
- Higgs Audio v3 TTS 4B: warme Anfragen laufen 8,8×–10,1× schneller als Echtzeit; Longform-Generierung (6000+ Zeichen) liegt bei ca. 8,5× Echtzeit.
- Fish Audio S2 Pro: aktuelle Implementierung ist eine naive Framework-Adaption — der Autor sieht hier noch deutlich Luft nach oben bei der Performance.
- Voxtral ASR: Streaming-Modus erreicht ein Time-to-First-Token (TTFT) von ~171 ms; Offline-Modus läuft 15,7× schneller als Echtzeit.
- Tipp im Post: Chunk-Größe anpassen und Referenz-Audio-Länge kürzen kann bei Modellen wie Qwen3-TTS die Performance um bis zu 2× steigern.
- audio.cpp führt einen eigenen Community-Models-Bereich ein, für den eine niedrigere Review-Schwelle gilt — gedacht für Ports, die nützlich, aber noch nicht vollständig ausgereift sind.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com0mo
audio.cpp Release 0.6: MiniMax-H3, dots.tts und 5 neue Modellfamilien
- LAUNCHreddit.com2w
audio.cpp 0.7: 62 Audio-Modellfamilien, Arena UI für lokale Modellvergleiche
- MEINUNGreddit.com2w
Community-Diskussion: Lokale TTS-Modelle im Praxistest – Zuverlässigkeit mangelhaft
- FORSCHUNGarxiv.org4d
TontaubeV1: Streaming-TTS mit hierarchischem Codec und 200 ms bis zum ersten Audio