audio.cpp 0.7: 62 Audio-Modellfamilien, Arena UI für lokale Modellvergleiche
audio.cpp ist ein auf llama.cpp-Ansätzen basierendes Framework, das lokale Audio-KI-Modelle ohne Cloud-Abhängigkeit ausführbar macht. Version 0.7 erweitert das Repertoire auf 62 Modellfamilien mit über 85 Varianten – ein deutlicher Sprung, der laut dem Maintainer maßgeblich durch Community-Beiträge ermöglicht wurde, teils bereits am oder kurz nach dem Erscheinungstag neuer Modelle. Neben den bekannten Neuzugängen im TTS-Bereich (FireRedTTS3, MagpieTTS, PersonaPlex, F5-TTS/Habibi) kommen mit FireRedAudio, IBM Granite Speech 5.0 TurboCTC und einem MMS Forced Aligner auch Modelle für Sprachverständnis und Zwangsausrichtung hinzu. Im Bereich Musikgenerierung sind MiniMax Music 3, MiDashengLM-Gen und ACE-Step 1.5 XL-Varianten neu, ControlFoley für Sound-Effekt-Synthese wird als experimentell markiert. Das Framework bietet nun vorgefertigte Binaries für acht Plattformkombinationen – Windows und Ubuntu mit CPU, Vulkan und CUDA (12.4 sowie 13.3), macOS arm64 mit Metal und macOS x64 mit CPU –, wobei ein Contributor namens drzsdrtfg die automatisierten Build-Workflows beigesteuert hat. Die Edge-Hardware-Tests durch Contributor Hi5808 zeigen, dass 40 von 40 Modellfamilien stabil auf einem NVIDIA Jetson Orin NX 16GB laufen; auf dem kleineren Orin Nano 8GB sind es 34 von 40.
- Arena UI: Ein gemeinsamer Eingabe-Prompt speist mehrere lokale Modelle oder GGUF-Varianten gleichzeitig, Ausgaben werden nebeneinander dargestellt.
- RTF-Werte im Arena UI stammen aus Cold-One-Shot-Anfragen inkl. Server-Overhead – der Maintainer warnt ausdrücklich, sie nicht als Modell-Leaderboard zu interpretieren.
- Voice-Conversion-Bereich: MeanVC2 ist die einzige neue Modellfamilie in dieser Kategorie in Release 0.7.
- AudioSR ergänzt die Audio-Tools-Kategorie als neues Werkzeug zur Hochskalierung von Audioqualität.
- Prebuilt-Binaries decken nun CUDA 13.3 zusätzlich zu CUDA 12.4 ab – relevant für aktuelle NVIDIA-GPU-Generationen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com0mo
audio.cpp Release 0.6: MiniMax-H3, dots.tts und 5 neue Modellfamilien
- MEINUNGreddit.com2w
Community-Diskussion: Lokale TTS-Modelle im Praxistest – Zuverlässigkeit mangelhaft
- MEINUNGreddit.com2w
Community sucht lokale Voice-to-Voice-Modelle für Consumer-GPUs
- LAUNCHreddit.com3w
MeanVC2: Streaming-Voice-Conversion-Modell läuft 3× Echtzeit auf CPU
audio.cpp 0.7: 62 Audio-Modellfamilien, Arena UI für lokale Modellvergleiche
audio.cpp ist ein auf llama.cpp-Ansätzen basierendes Framework, das lokale Audio-KI-Modelle ohne Cloud-Abhängigkeit ausführbar macht. Version 0.7 erweitert das Repertoire auf 62 Modellfamilien mit über 85 Varianten – ein deutlicher Sprung, der laut dem Maintainer maßgeblich durch Community-Beiträge ermöglicht wurde, teils bereits am oder kurz nach dem Erscheinungstag neuer Modelle. Neben den bekannten Neuzugängen im TTS-Bereich (FireRedTTS3, MagpieTTS, PersonaPlex, F5-TTS/Habibi) kommen mit FireRedAudio, IBM Granite Speech 5.0 TurboCTC und einem MMS Forced Aligner auch Modelle für Sprachverständnis und Zwangsausrichtung hinzu. Im Bereich Musikgenerierung sind MiniMax Music 3, MiDashengLM-Gen und ACE-Step 1.5 XL-Varianten neu, ControlFoley für Sound-Effekt-Synthese wird als experimentell markiert. Das Framework bietet nun vorgefertigte Binaries für acht Plattformkombinationen – Windows und Ubuntu mit CPU, Vulkan und CUDA (12.4 sowie 13.3), macOS arm64 mit Metal und macOS x64 mit CPU –, wobei ein Contributor namens drzsdrtfg die automatisierten Build-Workflows beigesteuert hat. Die Edge-Hardware-Tests durch Contributor Hi5808 zeigen, dass 40 von 40 Modellfamilien stabil auf einem NVIDIA Jetson Orin NX 16GB laufen; auf dem kleineren Orin Nano 8GB sind es 34 von 40.
- Arena UI: Ein gemeinsamer Eingabe-Prompt speist mehrere lokale Modelle oder GGUF-Varianten gleichzeitig, Ausgaben werden nebeneinander dargestellt.
- RTF-Werte im Arena UI stammen aus Cold-One-Shot-Anfragen inkl. Server-Overhead – der Maintainer warnt ausdrücklich, sie nicht als Modell-Leaderboard zu interpretieren.
- Voice-Conversion-Bereich: MeanVC2 ist die einzige neue Modellfamilie in dieser Kategorie in Release 0.7.
- AudioSR ergänzt die Audio-Tools-Kategorie als neues Werkzeug zur Hochskalierung von Audioqualität.
- Prebuilt-Binaries decken nun CUDA 13.3 zusätzlich zu CUDA 12.4 ab – relevant für aktuelle NVIDIA-GPU-Generationen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com0mo
audio.cpp Release 0.6: MiniMax-H3, dots.tts und 5 neue Modellfamilien
- MEINUNGreddit.com2w
Community-Diskussion: Lokale TTS-Modelle im Praxistest – Zuverlässigkeit mangelhaft
- MEINUNGreddit.com2w
Community sucht lokale Voice-to-Voice-Modelle für Consumer-GPUs
- LAUNCHreddit.com3w
MeanVC2: Streaming-Voice-Conversion-Modell läuft 3× Echtzeit auf CPU