Vollständig offline Voice-Loop für Ollama und LM Studio – 100% CPU, kein GPU
Der Reddit-Nutzer u/blackstoreonline hat ein Open-Source-Projekt namens „opencode-voice-service" veröffentlicht, das eine vollständig lokale Sprachinteraktions-Pipeline für bestehende LLM-Setups bereitstellt. Der technische Kern besteht aus drei ONNX-Modellen: Silero VAD übernimmt die Sprachaktivierungserkennung mit rund 5 ms Latenz pro Frame, Parakeet TDT 0.6B (INT8-quantisiert) transkribiert Sprache in 25 Sprachen und stellt eine OpenAI-kompatible API auf Port 5093 bereit, und Supertonic TTS 3 synthetisiert Sprache auf Englisch, Spanisch, Koreanisch, Portugiesisch und Französisch. Die gesamte Pipeline läuft ausschließlich auf der CPU und nutzt das ONNX-Runtime-Format, das im Vergleich zu nativen PyTorch-Modellen deutlich ressourcenschonender ist. Der Entwickler konnte das System erfolgreich auf einem vier Jahre alten ThinkPad ohne dedizierte GPU betreiben. Das Setup-Skript integriert sich automatisch in die jeweiligen Systemdienste – launchd unter macOS, systemd unter Linux und den Task Scheduler unter Windows – und unterstützt mehrere Agent-Integrationen, darunter Claude Code, OpenCode, OpenClaw, Hermes und Codex. Der datenschutzrelevante Aspekt liegt darin, dass zu keinem Zeitpunkt Audiodaten oder Transkripte das lokale Gerät verlassen.
- Parakeet TDT 0.6B läuft als ONNX INT8-Modell und stellt eine OpenAI-kompatible STT-API auf Port 5093 bereit.
- Der interaktive Installer fragt ab, welche Komponenten (Parakeet, Supertonic, VAD-venv) und welche Agent-Integrationen (u. a. Claude Code, Hermes, Codex) eingerichtet werden sollen.
- Silero VAD erkennt Sprachbeginn und -ende automatisch (~5 ms/Frame) — kein Push-to-Talk oder manuelles Schneiden erforderlich.
- Supertonic TTS 3 unterstützt fünf Sprachen: Englisch, Spanisch, Koreanisch, Portugiesisch und Französisch.
- Das Projekt ist auf GitHub unter groxaxo/opencode-voice-service verfügbar und wurde auf einem vier Jahre alten ThinkPad ohne GPU getestet.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com1w
Vellium v1.1.0: Open-Source-Desktop-App mit lokalem STT/TTS und Live-Voice
- MEINUNGreddit.com1w
Community-Diskussion: Beste lokale STT-Interfaces für Produktivität
- MEINUNGreddit.com2w
Community sucht lokale Voice-to-Voice-Modelle für Consumer-GPUs
- MEINUNGreddit.com2w
Breeze-TTS-2: Frontier-TTS-Modell lokal nutzbar mit ~7 GB
Vollständig offline Voice-Loop für Ollama und LM Studio – 100% CPU, kein GPU
Der Reddit-Nutzer u/blackstoreonline hat ein Open-Source-Projekt namens „opencode-voice-service" veröffentlicht, das eine vollständig lokale Sprachinteraktions-Pipeline für bestehende LLM-Setups bereitstellt. Der technische Kern besteht aus drei ONNX-Modellen: Silero VAD übernimmt die Sprachaktivierungserkennung mit rund 5 ms Latenz pro Frame, Parakeet TDT 0.6B (INT8-quantisiert) transkribiert Sprache in 25 Sprachen und stellt eine OpenAI-kompatible API auf Port 5093 bereit, und Supertonic TTS 3 synthetisiert Sprache auf Englisch, Spanisch, Koreanisch, Portugiesisch und Französisch. Die gesamte Pipeline läuft ausschließlich auf der CPU und nutzt das ONNX-Runtime-Format, das im Vergleich zu nativen PyTorch-Modellen deutlich ressourcenschonender ist. Der Entwickler konnte das System erfolgreich auf einem vier Jahre alten ThinkPad ohne dedizierte GPU betreiben. Das Setup-Skript integriert sich automatisch in die jeweiligen Systemdienste – launchd unter macOS, systemd unter Linux und den Task Scheduler unter Windows – und unterstützt mehrere Agent-Integrationen, darunter Claude Code, OpenCode, OpenClaw, Hermes und Codex. Der datenschutzrelevante Aspekt liegt darin, dass zu keinem Zeitpunkt Audiodaten oder Transkripte das lokale Gerät verlassen.
- Parakeet TDT 0.6B läuft als ONNX INT8-Modell und stellt eine OpenAI-kompatible STT-API auf Port 5093 bereit.
- Der interaktive Installer fragt ab, welche Komponenten (Parakeet, Supertonic, VAD-venv) und welche Agent-Integrationen (u. a. Claude Code, Hermes, Codex) eingerichtet werden sollen.
- Silero VAD erkennt Sprachbeginn und -ende automatisch (~5 ms/Frame) — kein Push-to-Talk oder manuelles Schneiden erforderlich.
- Supertonic TTS 3 unterstützt fünf Sprachen: Englisch, Spanisch, Koreanisch, Portugiesisch und Französisch.
- Das Projekt ist auf GitHub unter groxaxo/opencode-voice-service verfügbar und wurde auf einem vier Jahre alten ThinkPad ohne GPU getestet.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com1w
Vellium v1.1.0: Open-Source-Desktop-App mit lokalem STT/TTS und Live-Voice
- MEINUNGreddit.com1w
Community-Diskussion: Beste lokale STT-Interfaces für Produktivität
- MEINUNGreddit.com2w
Community sucht lokale Voice-to-Voice-Modelle für Consumer-GPUs
- MEINUNGreddit.com2w
Breeze-TTS-2: Frontier-TTS-Modell lokal nutzbar mit ~7 GB