audio.cpp Release 0.6: MiniMax-H3, dots.tts und 5 neue Modellfamilien
audio.cpp ist ein C++-basiertes Framework für lokale Audio-KI-Inferenz, das mit Release 0.6 auf 49 Modellfamilien und über 70 Varianten angewachsen ist. Neben den fünf Neuaufnahmen der Version 0.6 — dots.tts, NeuTTS-2e, MuScriptor (Music-to-MIDI), MiniMax-H3 und SenseVoice-Small — haben Community-Beitragende seitdem weitere Modelle nachgereicht: Irodori-TTS v4, IndexTTS 2.5, ACE-Step 1.5 XL und MiniMax-Music3. Ein zentrales technisches Highlight ist die MiniMax-H3-Implementierung, die das Framework-interne Ökosystem für Diffusion-Transformer-Modelle (DiT) erheblich ausbaut: Optimierungen wie SageAttention, First Block Cache und Spectrum, die bislang manuell konfiguriert werden mussten, lassen sich nun per einfachem Parameteraufruf aktivieren. Die Performance-Charakteristik ist in der Datei docs/reports/minimax_h3_performance.md im Repository dokumentiert. Ein unerwartetes Nebenprodukt der MiniMax-H3-Integration ist die experimentelle Unterstützung von Video-Frames, da das zugrundeliegende DiT Audio- und Video-Latents gemeinsam generiert — Output erfolgt derzeit als Roh-RGB-Daten plus JSON-Metadaten ohne Post-Processing. MiniMax-Music3 befindet sich noch im Preview-Zweig (preview/minimax-music-3) und wurde auf CUDA, Vulkan und HIP getestet. Neu ist außerdem eine native WebUI, umgesetzt durch Contributor mirek190, sowie die Veröffentlichung des Quellcodes für VibeVoice 1.5B auf dem vibevoice-optimizations-Branch.
- MiniMax-Music3 (Preview): VRAM-Bedarf skaliert mit Audiodauer — ~11 GB für 30s, 14 GB für 60s, 17 GB für 180s bei 30 Steps + CFG und Demo-Prompt (4000+ Zeichen Caption, 1200 Zeichen Lyrics).
- MuScriptor ist eine der neu aufgenommenen Modellfamilien und wandelt Musik in MIDI um — ein vergleichsweise seltener lokaler Use-Case im audio.cpp-Ökosystem.
- VibeVoice 1.5B ist explizit iOS-freundlich optimiert; der Quellcode wurde auf dem Branch vibevoice-optimizations veröffentlicht.
- Der Dev-Branch wird typischerweise einige Tage vor dem offiziellen Release mit neuem Inhalt befüllt, um Community-Tests zu ermöglichen.
- Die Video-Frame-Ausgabe via MiniMax-H3 ist rein experimentell: kein Upscaler, kein Post-Processing — nur RGB-Rohdaten + JSON-Metadaten, die extern zu einer Videodatei enkodiert werden müssen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com2w
audio.cpp 0.7: 62 Audio-Modellfamilien, Arena UI für lokale Modellvergleiche
- FORSCHUNGarxiv.org6d
TontaubeV1: Streaming-TTS mit hierarchischem Codec und 200 ms bis zum ersten Audio
- LAUNCHreddit.com3w
Qwen3-TTS mit 34 ms Time-to-First-Audio und 10 RPS auf H100
- MEINUNGreddit.com2w
Community-Diskussion: Lokale TTS-Modelle im Praxistest – Zuverlässigkeit mangelhaft
audio.cpp Release 0.6: MiniMax-H3, dots.tts und 5 neue Modellfamilien
audio.cpp ist ein C++-basiertes Framework für lokale Audio-KI-Inferenz, das mit Release 0.6 auf 49 Modellfamilien und über 70 Varianten angewachsen ist. Neben den fünf Neuaufnahmen der Version 0.6 — dots.tts, NeuTTS-2e, MuScriptor (Music-to-MIDI), MiniMax-H3 und SenseVoice-Small — haben Community-Beitragende seitdem weitere Modelle nachgereicht: Irodori-TTS v4, IndexTTS 2.5, ACE-Step 1.5 XL und MiniMax-Music3. Ein zentrales technisches Highlight ist die MiniMax-H3-Implementierung, die das Framework-interne Ökosystem für Diffusion-Transformer-Modelle (DiT) erheblich ausbaut: Optimierungen wie SageAttention, First Block Cache und Spectrum, die bislang manuell konfiguriert werden mussten, lassen sich nun per einfachem Parameteraufruf aktivieren. Die Performance-Charakteristik ist in der Datei docs/reports/minimax_h3_performance.md im Repository dokumentiert. Ein unerwartetes Nebenprodukt der MiniMax-H3-Integration ist die experimentelle Unterstützung von Video-Frames, da das zugrundeliegende DiT Audio- und Video-Latents gemeinsam generiert — Output erfolgt derzeit als Roh-RGB-Daten plus JSON-Metadaten ohne Post-Processing. MiniMax-Music3 befindet sich noch im Preview-Zweig (preview/minimax-music-3) und wurde auf CUDA, Vulkan und HIP getestet. Neu ist außerdem eine native WebUI, umgesetzt durch Contributor mirek190, sowie die Veröffentlichung des Quellcodes für VibeVoice 1.5B auf dem vibevoice-optimizations-Branch.
- MiniMax-Music3 (Preview): VRAM-Bedarf skaliert mit Audiodauer — ~11 GB für 30s, 14 GB für 60s, 17 GB für 180s bei 30 Steps + CFG und Demo-Prompt (4000+ Zeichen Caption, 1200 Zeichen Lyrics).
- MuScriptor ist eine der neu aufgenommenen Modellfamilien und wandelt Musik in MIDI um — ein vergleichsweise seltener lokaler Use-Case im audio.cpp-Ökosystem.
- VibeVoice 1.5B ist explizit iOS-freundlich optimiert; der Quellcode wurde auf dem Branch vibevoice-optimizations veröffentlicht.
- Der Dev-Branch wird typischerweise einige Tage vor dem offiziellen Release mit neuem Inhalt befüllt, um Community-Tests zu ermöglichen.
- Die Video-Frame-Ausgabe via MiniMax-H3 ist rein experimentell: kein Upscaler, kein Post-Processing — nur RGB-Rohdaten + JSON-Metadaten, die extern zu einer Videodatei enkodiert werden müssen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com2w
audio.cpp 0.7: 62 Audio-Modellfamilien, Arena UI für lokale Modellvergleiche
- FORSCHUNGarxiv.org6d
TontaubeV1: Streaming-TTS mit hierarchischem Codec und 200 ms bis zum ersten Audio
- LAUNCHreddit.com3w
Qwen3-TTS mit 34 ms Time-to-First-Audio und 10 RPS auf H100
- MEINUNGreddit.com2w
Community-Diskussion: Lokale TTS-Modelle im Praxistest – Zuverlässigkeit mangelhaft