Voice — August 2026
63 Beiträge im August 2026.
- LAUNCH31. Aug.Self-hosted Audiobook-Pipeline: Gemma4, IndexTTS 2.5 und Whisper-QC kombiniertDie Pipeline zeigt, wie mehrere self-hosted Modelle (TTS, STT, LLM) zu einem vollständigen Audiobook-Workflow kombinierbar sind – inklusive Mehrfach-Stimmen, Emotions-Steuerung und Audio-Filtern, was kommerzielle Tools wie ElevenReader bisher verweigern.
- MEINUNG31. Aug.Community-Diskussion: Beste ASR-Modelle mit Speaker DiarisationFür Entwickler, die Transkription mit Sprechertrennung lokal betreiben, liefert das HF Open ASR Leaderboard einen guten Einstiegspunkt. Der Community-Thread kann konkrete Praxiserfahrungen mit diarisation-fähigen Modellen sammeln, die in Benchmarks allein nicht abgebildet werden.
- LAUNCH31. Aug.pipecat-ai PhoneLLM Alpha-1: GPT-5.6-Terra-Leistung bei 1/3 Latenz und 1/18 KostenFür Builder von Sprach-Agenten verspricht PhoneLLM Alpha-1 vergleichbare Qualität zu GPT-5.6 Terra bei nur einem Drittel der Latenz und einem Achtzehntel der Kosten – relevant für produktionsreife, kostensensitive Voice-Pipelines.
- MEINUNG29. Aug.Community sucht lokale Voice-to-Voice-Modelle für Consumer-GPUsZeigt anhaltende Nachfrage nach lokal lauffähigen Sprach-zu-Sprach-Modellen. Wer entsprechende Lösungen baut oder sucht, findet in diesem Thread möglicherweise Community-Empfehlungen zu aktuellen Open-Source-Optionen.
- MEINUNG28. Aug.Breeze-TTS-2: Frontier-TTS-Modell lokal nutzbar mit ~7 GBEin kompaktes TTS-Modell (~7 GB) auf potenziellem Frontier-Niveau ermöglicht hochwertige Sprachsynthese ohne Cloud-Abhängigkeit – relevant für lokale AI-Pipelines und datenschutzsensible Deployments.
- LAUNCH28. Aug.TontaubeV1: Offenes 2,9B-TTS-Modell für lokale Langform-SprachgenerierungLokale TTS-Inferenz mit vLLM-Backend, Zero-Shot Voice Cloning und 50× Echtzeit-Durchsatz – relevant für alle, die hochwertige Sprachsynthese ohne Cloud-Abhängigkeit betreiben wollen. Aktuell sind min. 24 GB VRAM nötig; quantisierte Versionen für kleinere GPUs sind in Planung.
- LAUNCH27. Aug.audio.cpp 0.7: 62 Audio-Modellfamilien, Arena UI für lokale ModellvergleicheLokale Audio-KI wird damit deutlich zugänglicher: Das Arena UI ersetzt manuelle Skript-Vergleiche, und alle 40 getesteten Modellfamilien laufen stabil auf NVIDIA Jetson Orin NX 16GB – relevant für Edge-Deployments ohne Cloud-Abhängigkeit.
- MEINUNG27. Aug.Community-Diskussion: Lokale TTS-Modelle im Praxistest – Zuverlässigkeit mangelhaftLokale TTS-Modelle bieten zwar bessere Sprachqualität als ältere Systeme, scheitern aber noch an Zuverlässigkeit und Ressourceneffizienz auf reiner CPU – für unbeaufsichtigte Batch-Aufgaben bleiben sie damit aktuell wenig geeignet.
- LAUNCH27. Aug.Plaud One: KI-Ohrstöpsel mit 4G für automatische GesprächsaufzeichnungFür Nutzer, die Meetings oder Gespräche automatisch dokumentieren wollen, bietet Plaud One eine eigenständige Lösung ohne Smartphone-Abhängigkeit. Das integrierte 4G im Case macht die Earbuds zu einem unabhängigen KI-Recorder-Gerät.
- MEINUNG26. Aug.Geminis Branding-Chaos: KI-Industrie überfordert Nutzer mit internen ArchitekturenKI-Apps zwingen Nutzer, interne Architekturentscheidungen zu verstehen, statt Anfragen einfach zu tippen. Das begünstigt schlankere Ansätze – Apple Siri-Integration und SMS-basierte KI-Assistenten – die ohne neue UI-Lernkurve auskommen.
- LAUNCH26. Aug.Google DeepMind lanciert Gemini 3.5 Transcribe mit 2,6 % WEREntwickler erhalten über die Gemini API Zugang zu Sub-Sekunden-Streaming-Transkription und präziser Batch-Verarbeitung mit Word-Level-Timestamps – 70 % schnellere Time-to-Final-Transcription gegenüber Chirp 3 macht es für Echtzeit-Voice-Agents und Call-Analytics praxistauglich.
- BENCHMARK26. Aug.Gepard TTS: 68,7 ms Time-to-First-Audio auf einer RTX 4090 – Apache 2.0Gepard 1.0 ist Apache-2.0-lizenziert und damit als einziges der 25 verglichenen Systeme vollständig open-source. Entwickler können das Modell selbst auf einer Consumer-GPU betreiben und über das veröffentlichte Benchmark-Harness gegen eigene Endpoints testen.
- FUNDING26. Aug.Ringg sichert sich 10 Mio. USD von Peak XV für Voice-AI-Plattform in IndienRingg positioniert sich als Orchestrierungsschicht für komplexe Enterprise-Workflows (KYC, Appointment Booking, L1/L2-Support) – nicht nur als einfacher Outbound-Dialer. Für AI-Builder relevant: Das Modell zeigt, dass Defensibilität im Voice-AI-Stack zunehmend beim Halten der Kundenbeziehung und messbaren Outcomes liegt, nicht beim Modell selbst.
- LAUNCH25. Aug.MIT AgeLab-Forschung inspiriert KI-Startup für ältere ErwachseneDas Startup adressiert ein häufig unterschätztes Problem: unzugängliche Geräte für ältere Nutzer. Für AI-Builder zeigt dies ein konkretes Marktfeld, in dem altersgerechte UX und KI-gestützte Assistenz echten Bedarf decken.
- LAUNCH25. Aug.IBM Granite Speech 5.0 Turbo CTC: extrem schnelle SprachtranskriptionKonkreter Mehrwert ohne Volltext nicht vollständig beurteilbar. Der Fokus auf Geschwindigkeit und Genauigkeit via CTC-Ansatz könnte das Modell für latenzempfindliche Produktivtranskriptions-Pipelines interessant machen.
- LAUNCH24. Aug.Audiobookify: Lokale Offline-TTS für EPUB-Reader auf dem iPhoneDie App demonstriert, dass qualitativ hochwertige TTS-Modelle (Kokoro) per CoreML effizient auf Mobile-Hardware laufen – mit guten Thermals und Akkulaufzeit. Interessant für Entwickler, die On-Device-Inferenz für TTS auf iOS evaluieren.
- MEINUNG24. Aug.Übersicht: Beste KI-Voice-Cloning-Tools 2026Konkreter Mehrwert ohne Volltext nicht beurteilbar – der Beitrag ist ein reiner Link-Post ohne inhaltliche Details im Auszug.
- MEINUNG24. Aug.Community fragt: KI-Upscaler für Audio und Musik gesuchtDie Frage zeigt Bedarf an Audio-Restoration-Modellen für lokalen Einsatz. Konkrete Tool-Empfehlungen oder Stand der Technik sind im Post nicht enthalten; Konkreter Mehrwert ohne Antworten im Thread nicht beurteilbar.
- MEINUNG22. Aug.Reddit-Frage: TTS-Stimme aus Tiergeräuschen erstellenZeigt eine Lücke bestehender Voice-Cloning-Lösungen: Nicht-humane Audio-Quellen werden kaum unterstützt. Für kreative Videoprojekte mit Tier-TTS gibt es derzeit keinen etablierten Workflow.
- LAUNCH22. Aug.RayNeo iO Glasses: KI-Brille ohne Kamera mit Text-Overlay und Gemini 3.1Die Brille zeigt einen Designansatz, der Datenschutzbedenken durch den Verzicht auf eine Kamera adressiert. Entwickler können auf Gemini 3.1 Flash Lite (kostenlos) oder per Abo auf weitere Modelle zugreifen – allerdings sind alle gelisteten Modelle bereits veraltet, was die Aktualität des Ökosystems infrage stellt.
- LAUNCH21. Aug.FireRedTeam veröffentlicht FireRedAudio (9B) und FireRedTTS3 für Audio & SpracheFireRedAudio deckt mit einem einzigen 9B-Backbone ASR, Audio-Verstehen und Sprachgenerierung bis zu einstündiger Aufnahmen ab. FireRedTTS3-Instruct ermöglicht sprachgesteuertes Voice-Design und freie Sprach-Editierung ohne Referenzaudio – beides direkt lokal nutzbar.
- LAUNCH21. Aug.Qwen3-TTS mit 34 ms Time-to-First-Audio und 10 RPS auf H100Lokale TTS-Modelle waren bisher oft langsamer als Cloud-Lösungen. Diese Implementierung übertrifft vLLM-Omni und SGLang-Omni deutlich und macht Echtzeit-Sprachausgabe mit Qwen3-TTS auch auf Consumer-Hardware (4090) praktisch nutzbar.
- LAUNCH21. Aug.MeanVC2: Streaming-Voice-Conversion-Modell läuft 3× Echtzeit auf CPUEchtzeit-Stimmkonvertierung ohne GPU senkt die Einstiegshürde für lokale Sprach-Apps erheblich. Entwickler können MeanVC2 über Hugging Face direkt einbinden und damit Voice-Cloning-Features ohne Cloud-Abhängigkeit umsetzen.
- LAUNCH20. Aug.Adobe Firefly integriert KI-Audiotools und Google Gemini Omni FlashVideo-Creator erhalten in Firefly eine integrierte Pipeline für KI-generierte Musik, Sprachausgaben und Soundeffekte – ohne Lizenzrisiken. Die Gemini-Omni-Flash-Integration erweitert zudem die Modellauswahl innerhalb der Adobe-Plattform.
- LAUNCH19. Aug.S1-mini: 600M-Parameter-Modell läuft lokal im Browser via WebGPUEntwickler können Speech-to-Text-Ausgaben ohne Server-Infrastruktur direkt im Browser bereinigen – inklusive Entfernung von Versprechern, Satzzeichensetzung und Formatierung von Zahlen, Daten und Währungen.
- LAUNCH19. Aug.Superwhisper veröffentlicht S1-mini: 0,6B-Parameter-Modell zur STT-TextnormalisierungEin sehr kleines, spezialisiertes Modell für STT-Normalisierung kann lokal mit minimalem Ressourcenaufwand betrieben werden – relevant für Entwickler, die STT-Pipelines ohne Cloud-Abhängigkeit aufbauen wollen.
- LAUNCH19. Aug.Amazon macht Alexa+ auf Fire TV kostenlos – kein Prime nötigAlexa+ mit konversationeller Suche, Smart-Home-Steuerung und KI-Empfehlungen wird automatisch für alle kompatiblen Fire TV-Geräte aktiviert – ohne Opt-in. KI-Assistenten auf TV-Plattformen werden damit zum Standard, ähnlich wie Google Gemini auf Google TV und Rokus KI-Voice-Upgrade.
- LAUNCH19. Aug.Fish Audio Modelle kostenlos auf Vercel AI Gateway bis 18. SeptemberEntwickler können TTS (regulär $15/Mio. Zeichen) und Transkription (regulär $0,36/Stunde) 30 Tage lang kostenlos testen und über das AI SDK 7 direkt in ihre Apps einbinden – inklusive Voice Cloning und Word-Level-Timestamps.
- GERÜCHT18. Aug.Geleaktes Video zeigt Apples AirPods mit eingebauter KameraKamera-AirPods könnten kontextbewusstes Computing ohne Smartphone-Griff ermöglichen. Die Integration von Visual Intelligence direkt im Ohr erweitert Siri um eine passive Wahrnehmungsebene für AI-Builder, die Wearable-nahe Pipelines entwickeln.
- LAUNCH17. Aug.Speko (YC S26): OpenRouter-Ansatz für Voice-AI-StacksTeams, die Voice Agents betreiben, können veraltete Modell-Stacks ohne eigene Benchmark-Infrastruktur austauschen. Das BYOK-Gateway (MIT, Go) ermöglicht lokale Nutzung ohne Cloud-Abhängigkeit; der gehostete Router übernimmt kontinuierliches Benchmarking und Failover automatisch.
- FUNDING17. Aug.Wispr sammelt 280 Mio. USD bei 2-Mrd.-Bewertung und launcht Modell CantoWispr erweitert sich vom Diktat-Tool zum Meeting-Notetaker und neuen Hardware-Integrationen (z. B. Oasis-Ring). Das neue Modell Canto adressiert konkrete Qualitätsprobleme – relevant für Teams, die auf KI-Transkription setzen und zuverlässige Fehlerraten benötigen.
- LAUNCH16. Aug.audio.cpp Release 0.6: MiniMax-H3, dots.tts und 5 neue ModellfamilienMiniMax-H3 läuft mit bis zu 3× Echtzeit und vereinfacht DiT-Setup (SageAttention, First Block Cache etc. per Parameter statt manueller Konfiguration). Mit ~11 GB VRAM für 30s Musik-Output lokal nutzbar — relevant für Audio/TTS-Pipelines ohne Cloud-Abhängigkeit.
- LAUNCH13. Aug.Microsoft entfernt Mico-Avatar aus Copilot Voice ModeMicrosofts Versuch, dem KI-Assistenten durch einen animierten Avatar eine visuelle Identität zu geben, wird nach knapp einem Jahr beendet. Für Entwickler und Produktteams zeigt dies, dass emotive UI-Elemente in Voice-Assistenten schwer dauerhaft zu positionieren sind.
- MEINUNG12. Aug.Sandbar setzt mit Stream-Ring auf Voice als Zukunft der KI-WearablesVoice-basierte KI-Ringe könnten einen neuen Formfaktor für passives Capturing etablieren. Für AI-Builder relevant als Signal, dass Sprachinteraktion auf Mini-Hardware ohne Display an Bedeutung gewinnt.
- LAUNCH11. Aug.IndexTTS 2.5 veröffentlichtKonkreter Mehrwert ohne Volltext nicht beurteilbar. IndexTTS ist ein lokales TTS-Modell; Version 2.5 könnte Qualitäts- oder Effizienzverbesserungen bringen – Details müssen der verlinkten Quelle entnommen werden.
- LAUNCH10. Aug.NVIDIA Magpie TTS: Open-Weights-Modell für mehrsprachige Voice AgentsEntwickler können mehrsprachige Voice Agents mit eigenen Gewichten selbst hosten und so Latenz und Datenschutz kontrollieren – ohne Abhängigkeit von proprietären TTS-APIs.
- LAUNCH10. Aug.Kinney Drugs zieht KI-Telefonassistenten nach Hunderten Kundenbeschwerden zurückDer Fall zeigt konkret, dass KI-Telefonassistenten im Kundenkontakt ohne ausreichende Qualitätssicherung schnell zu Reputationsschäden führen können. Für AI-Builder im Customer-Service-Bereich ist das ein Warnsignal: Nutzerakzeptanz und Fallback-Optionen müssen vor dem Rollout validiert werden.
- MEINUNG10. Aug.Bose CEO Lila Snyder über Lizenzstrategie, KI-Wearables und Audio-ZukunftBose wandelt sich vom reinen Produkthersteller zum B2B-Technologielieferanten – ein Modell, das auch für KI-Wearable-Startups relevant ist, die Audio-Verarbeitung für Voice-Interfaces benötigen. Für AI-Builder, die an sprachbasierten Geräten arbeiten, könnte Bose Audio Tech ein relevanter Technologiepartner werden.
- LAUNCH10. Aug.Ford führt KI-Assistent für Fahrzeugdaten in Mobile-App einDer Assistent greift auf Live-Fahrzeugdaten zu und beantwortet praktische Fragen zu Reichweite, Zuladung und Service – ein Beispiel, wie Automobilhersteller LLM-basierte Interfaces direkt in Fahrzeug-Apps integrieren.
- MEINUNG10. Aug.Nutzer sucht Chat-UI mit nativem Audio-Input für multimodale ModelleFür lokale multimodale Modelle fehlt bisher eine weit verbreitete Chat-UI mit nativem Audio-Pass-through. Wer Gemma 4 oder ähnliche Modelle als Voice-Assistant nutzen will, muss derzeit auf llama-server oder eigene API-Anbindungen (z. B. Pydantic AI) ausweichen.
- LAUNCH10. Aug.Voice-driven Murder-Mystery: AI-Verdächtige per Sprache befragenZeigt einen konkreten Anwendungsfall für speech-to-speech Realtime-APIs in interaktiven Erlebnissen. Die Architektur – Realtime-Modell für Dialog, kleineres Modell als Judge zur Kostenoptimierung – ist ein praxistaugliches Muster für eigene Voice-Agent-Projekte.
- LAUNCH08. Aug.Lokaler Realtime-Voice-Stack: Parakeet STT → Qwen 2.5 7B → Qwen3-TTS für OllamaZeigt eine funktionsfähige End-to-End-Voice-Pipeline komplett lokal und ohne Cloud-Abhängigkeit auf Basis von Ollama – relevant für Entwickler, die datenschutzkonforme Sprachassistenten bauen wollen. Konkreter Mehrwert der Implementierung ohne Volltext schwer beurteilbar.
- GERÜCHT07. Aug.OpenAI plant Smart Speaker für 300–400 $ mit beweglichen TeilenOpenAI positioniert den Speaker als Smartphone-Ersatz mit ChatGPT-Voice-Funktionen – zu einem Preis, der deutlich über bisherigen Smart Speakern liegt. Für AI-Builder zeigt dies, dass OpenAI auf dedizierte Hardware als neuen Umsatztreiber setzt, obwohl der Markt schwierig ist.
- LAUNCH07. Aug.parakeet.wgsl: GPU-beschleunigte Browser-Transkription via WebGPU & WASMEntwickler können hochgenaue Spracherkennung vollständig client-seitig ohne externe Abhängigkeiten einbetten – npm-Paket verfügbar. WebGPU-Transpilierung eröffnet zudem Offline-Einsatz via Dawn oder wgpu auf nahezu beliebiger Hardware.
- LAUNCH07. Aug.Lokale Voice-Input-Extension für pi mit Nemotron 3.5 ASR 0.6BDas GGML-basierte NeMo-Speech.cpp-Runtime von NVIDIA läuft CPU-seitig in Echtzeit und benötigt nur ~700 MB. Entwickler können damit vollständig lokale Spracheingabe in pi-Workflows integrieren, ohne externe Server oder Cloud-Abhängigkeiten.
- LAUNCH07. Aug.llama.cpp auf Amazon Echo Dot 2: 28M-LLM läuft lokal mit 4 Tokens/sZeigt, dass llama.cpp mit KV-Cache-Prefix auf extrem limitierter ARM-Hardware (512 MB RAM) für strukturierte Intent-Erkennung per Sprache praxistauglich ist – relevant für Edge-AI-Projekte ohne Cloud-Anbindung auf Altgeräten.
- LAUNCH06. Aug.NVIDIAs Speech-Stack läuft lokal: ASR, TTS und Codec als GGUF via NeMo-Speech.cppEntwickler können nun NVIDIAs gesamte Sprach-Pipeline (Erkennung, Synthese, Codec) ohne Cloud-Anbindung on-device betreiben. GGUF-Quantisierung senkt die Hardware-Hürde erheblich und ermöglicht Offline-Voice-Pipelines auch auf Consumer-Hardware.
- GERÜCHT06. Aug.OpenAI-Gerät von Jony Ive: Hockey-Puck-großer Smart Speaker für 2027Das Gerät soll 2027 für über 300 USD erscheinen und als portabler KI-Assistent fürs Zuhause positioniert werden – ein direkter Angriff auf Amazons Echo-Linie, jedoch mit stärkerem Fokus auf KI-Interaktion statt reiner Sprachsteuerung.
- LAUNCH06. Aug.Reddit-User veröffentlicht kostenloses Voice-Cloning-Tool zum TestenDas Tool ist frei zugänglich und ohne Anmeldung nutzbar – interessant für Entwickler, die Voice-Cloning-Qualität abseits kommerzieller Anbieter evaluieren möchten. Da es sich um eine frühe Version handelt, sind Robustheit und Qualität noch unklar.
- FUNDING06. Aug.Omilia sammelt 67 Mio. USD Series B für KI-Kundensupport-PlattformOmilia setzt bewusst auf einen Mix aus klassischen und generativen KI-Methoden statt ausschließlich LLMs – ein Ansatz, der bessere Unit Economics verspricht. Für Builder im Contact-Center-Bereich ist das ein Hinweis, dass hybride Automatisierungsstrategien gegenüber reinen GenAI-Lösungen wirtschaftlich konkurrenzfähig sein können.
- LAUNCH05. Aug.Scenema Audio als ComfyUI-Node: Text-to-Speech mit 8 GB VRAMLokales, expressives TTS mit Voice-Cloning ist nun auf Consumer-GPUs ab RTX 3070 nutzbar. Einschränkung: erster Download ~30 GB Weights, Text-Encoder Gemma 3 12B erfordert HuggingFace-Token und Lizenzzustimmung.
- MEINUNG05. Aug.OpenAI-Forscherin verlässt Unternehmen für Thought-to-Text-Startup ConduitConduit sammelt große Mengen nicht-invasiver Neurodaten, um Sprachmodelle mit neuronalen Latenzen zu koppeln – ein möglicher Paradigmenwechsel für Human-AI-Interfaces jenseits von Tastatur und Sprache. Für AI-Builder relevant als früher Signal eines neuen Input-Modalitäts-Ökosystems.
- LAUNCH05. Aug.Google stellt Assistant auf Android-Phones und Tablets ab September einApps und Workflows, die auf Google Assistant-Integration setzen, müssen bis Anfang September auf Gemini migriert werden. Entwickler sollten ihre Assistant-Aktionen und Smart-Home-Integrationen zeitnah prüfen.
- LAUNCH05. Aug.Speechfony: Lokale PDF/EPUB-zu-Audiobook-App mit Kokoro TTS und llama.cppFür Entwickler, die Dokumente lokal verarbeiten wollen, bietet Speechfony eine fertige Lösung ohne Cloud-Abhängigkeit. Kokoro 82M (~130 MB), lokale Embeddings und Hardware-Beschleunigung (CoreML/DirectML/CUDA) machen den Stack auch auf Consumer-Hardware nutzbar.
- LAUNCH05. Aug.Qwen3-TTS Voice Cloning jetzt in mainline llama.cpp integriertVoice Cloning ist damit direkt in mainline llama.cpp verfügbar, was die Integration lokaler Sprachausgabe in bestehende llama.cpp-Projekte deutlich vereinfacht. Der /tts-Server-Endpunkt ist noch ein Draft-PR; Vergleichswerte gegenüber spezialisierten Ports fehlen bisher.
- LAUNCH05. Aug.VibeVoice 1.5B läuft lokal auf iPhone mit 2,2 GB RAM und 1,28× EchtzeitKleine Sprachmodelle werden auf Consumer-Hardware wie iPhones praktisch einsetzbar: 1,28× Echtzeit bedeutet flüssige lokale Sprachgenerierung ohne Cloud. Das Modell ist im audio.cpp HF-Repo verfügbar, xcframework und Branch-Code folgen mit Release 0.6.
- LAUNCH04. Aug.Wrinkles: KI-App erzählt Geschichten der Orte um dich herumMuseen, Tourismusbehörden und Hotels können Wrinkles nutzen, um standortbasierte Erlebnisse ohne eigene App-Entwicklung anzubieten – inklusive Buchungs- und Ticket-Links mit Revenue-Share-Modell.
- LAUNCH04. Aug.srt2speech: Offline-Tool für mehrsprachige SRT-Vertonung mit Voice CloningEntwickler können damit lokal und kostenfrei Videovertontungen mit präzisem Subtitle-Timing erstellen. Auf einer RTX 4080 Laptop-GPU läuft das Tool mit 12–13× Echtzeit, auf CPU noch mit 1,5–2×, was es auch auf älterer Hardware nutzbar macht.
- LAUNCH03. Aug.NVIDIA veröffentlicht NemotronLabs-VoiceChat-11B mit Full-Duplex-UnterstützungFull-Duplex ermöglicht gleichzeitiges Sprechen und Zuhören ohne künstliche Gesprächspausen – relevant für AI-Builder, die natürliche Sprach-Agenten oder Voice-Interfaces lokal oder auf eigener Infrastruktur betreiben wollen.
- LAUNCH03. Aug.OpenAI stellt GPT-Live vor: Echtzeit-Sprachsystem ohne GesprächspausenDas turnlose Design entfällt klassische Push-to-Talk-Pausen, was Voice-Agenten deutlich flüssiger macht. Entwickler können diese Architektur als Referenz für eigene Echtzeit-Voice-Pipelines nutzen.
- LAUNCH02. Aug.Parlor v2: Lokaler GPT-Live-Klon auf Apple M3 ProWer GPT-Live-ähnliche Voice-Interaktion lokal und ohne Cloud betreiben will, bekommt mit Parlor v2 eine funktionsfähige Open-Source-Basis für M3-Pro-Hardware. Echter Full-Duplex lokal bleibt laut Autor noch ein offenes Problem.
- MEINUNG01. Aug.Lokales LLM als Japanisch-Lehrer: Vibe-Coding-Projekt mit Gemma 4 31B und Kokoro TTSZeigt, wie lokale Modelle (Gemma 4 31B) per Vibe-Coding zu personalisierten Sprachlern-Pipelines kombiniert werden können – inklusive OCR/Bildanalyse, TTS und dynamischen Lektionen ohne Cloud-Abhängigkeit.
- LAUNCH01. Aug.audio.cpp 0.5: DramaBox TTS, Confucius4 Sprachübertragung und AMD ROCm-SupportLokale Audio-Inferenz wird deutlich vielseitiger: Emotion, Pausen und Sprechverhalten lassen sich per Prompt steuern, AMD-GPUs werden erstmals unterstützt, und Apple-Silicon-Metal-Pfade sind schneller. Für Entwickler relevanter Plattformausbau ohne Cloud-Abhängigkeit.