Dockerized Nemotron 3.5 ASR: 4,5× Echtzeit-Speed auf CPU mit Streaming
Reddit-Nutzer Apart_Boat9666 hat Nemotron 3.5 ASR in einen Docker-Container gepackt und damit einen praxistauglichen Einstiegspunkt für lokale Spracherkennungs-Pipelines geschaffen. Der Wechsel von Parakeet zu Nemotron 3.5 war laut Beitrag durch zwei zentrale Anforderungen motiviert: breitere Sprachunterstützung und echtes Streaming. Nemotron 3.5 deckt über 40 Sprach-Locales aus einem einzigen Modell ab, während Parakeet hauptsächlich auf Englisch optimiert ist. Als Inference-Backend kommt onnxruntime-genai zum Einsatz, das auf CPU eine Verarbeitungsgeschwindigkeit von 4,5× Echtzeit ermöglicht — Audio wird also deutlich schneller als in Realzeit transkribiert. Die native Streaming-Architektur des Modells eliminiert das früher notwendige Puffern ganzer Audiodateien, was Latenz in Live-Anwendungen reduziert. Das Repository enthält Beispieldateien für beide Nutzungsszenarien: Streaming und klassischer Datei-Upload via API-Client. GPU-Beschleunigung via CUDA ist im Container noch nicht abschließend getestet; laut Autor sind manuelle Anpassungen an der YAML-Konfiguration und der requirements.txt wahrscheinlich notwendig.
- Backend: onnxruntime-genai wird als Inference-Engine eingesetzt — kein PyTorch-Stack erforderlich.
- Repository enthält Beispiel-Clients für zwei Modi: Streaming-API und klassischer Datei-Upload.
- CUDA-Support ist laut Autor prinzipiell vorgesehen, aber noch ungetestet — yaml und requirements.txt müssen manuell angepasst werden.
- Parakeet wurde als Vorgänger abgelöst, primär wegen fehlender nativer Mehrsprachigkeit und fehlendem Streaming.
- Einstieg per Clone-and-Run: Das Docker-Setup soll ohne weitere Konfiguration auf CPU sofort lauffähig sein.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Dockerized Nemotron 3.5 ASR: 4,5× Echtzeit-Speed auf CPU mit Streaming
Reddit-Nutzer Apart_Boat9666 hat Nemotron 3.5 ASR in einen Docker-Container gepackt und damit einen praxistauglichen Einstiegspunkt für lokale Spracherkennungs-Pipelines geschaffen. Der Wechsel von Parakeet zu Nemotron 3.5 war laut Beitrag durch zwei zentrale Anforderungen motiviert: breitere Sprachunterstützung und echtes Streaming. Nemotron 3.5 deckt über 40 Sprach-Locales aus einem einzigen Modell ab, während Parakeet hauptsächlich auf Englisch optimiert ist. Als Inference-Backend kommt onnxruntime-genai zum Einsatz, das auf CPU eine Verarbeitungsgeschwindigkeit von 4,5× Echtzeit ermöglicht — Audio wird also deutlich schneller als in Realzeit transkribiert. Die native Streaming-Architektur des Modells eliminiert das früher notwendige Puffern ganzer Audiodateien, was Latenz in Live-Anwendungen reduziert. Das Repository enthält Beispieldateien für beide Nutzungsszenarien: Streaming und klassischer Datei-Upload via API-Client. GPU-Beschleunigung via CUDA ist im Container noch nicht abschließend getestet; laut Autor sind manuelle Anpassungen an der YAML-Konfiguration und der requirements.txt wahrscheinlich notwendig.
- Backend: onnxruntime-genai wird als Inference-Engine eingesetzt — kein PyTorch-Stack erforderlich.
- Repository enthält Beispiel-Clients für zwei Modi: Streaming-API und klassischer Datei-Upload.
- CUDA-Support ist laut Autor prinzipiell vorgesehen, aber noch ungetestet — yaml und requirements.txt müssen manuell angepasst werden.
- Parakeet wurde als Vorgänger abgelöst, primär wegen fehlender nativer Mehrsprachigkeit und fehlendem Streaming.
- Einstieg per Clone-and-Run: Das Docker-Setup soll ohne weitere Konfiguration auf CPU sofort lauffähig sein.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.