13M-Parameter ASR-Conformer läuft auf ESP32-S3-Mikrocontroller unter 10 Dollar
Der Reddit-Nutzer wunschpunsch3D hat ein auf Nvidias kleinem Conformer-Modell (verfügbar auf Hugging Face) basierendes ASR-System auf den ESP32-S3 portiert – einen Mikrocontroller, der für unter 10 Dollar erhältlich ist. Ausgangspunkt war Nvidias vortrainiertes „small conformer"-Modell, das durch Wissensdestillation und anschließende Quantisierung so weit komprimiert wurde, dass es in 14 MB Flash-Speicher passt. Parallel dazu reduzierte sich der RAM-Bedarf auf 256 KB SRAM, ergänzt durch 4 MB PSRAM für den eigentlichen Inferenz-Puffer. Der ESP32-S3 besitzt Hardware-Beschleunigung für 8-Bit-Integer-Mathematik, was die ML-Inferenz auf der Plattform überhaupt erst praktikabel macht. Ein erster Versuch benötigte noch rund 10 Minuten für 5 Sekunden Audio; nach Optimierung transkribiert das finale System 8 Sekunden Audio, wenn auch weiterhin langsam. Ein paralleler Test mit Whisper Tiny scheiterte praktisch: Dort wurden über 50 Minuten Inferenzzeit für 5 Sekunden Audio gemessen, weshalb eine weitere Optimierung nicht verfolgt wurde. Die vollständige Evaluation der Word Error Rate auf den Hugging Face ASR-Benchmark-Datensätzen ist im GitHub-Repository des Projekts dokumentiert.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com1w
sanoTTS: Kleinstes neuronales TTS-Modell mit 294k Parametern läuft auf 3-Dollar-Mikrocontroller
- FORSCHUNGarxiv.org2w
Neuromorphes Spracherkennungssystem erreicht 99,77 % auf Heidelberg Digits
- FORSCHUNGarxiv.org2w
TFA: Synthesisierbarer INT8-Chip für Transformer-Inferenz auf 2,73 mm²
- FORSCHUNGarxiv.org1w
LeanStream: Effiziente On-Device-LLM-Inferenz mit 2,1× höherem Durchsatz
13M-Parameter ASR-Conformer läuft auf ESP32-S3-Mikrocontroller unter 10 Dollar
Der Reddit-Nutzer wunschpunsch3D hat ein auf Nvidias kleinem Conformer-Modell (verfügbar auf Hugging Face) basierendes ASR-System auf den ESP32-S3 portiert – einen Mikrocontroller, der für unter 10 Dollar erhältlich ist. Ausgangspunkt war Nvidias vortrainiertes „small conformer"-Modell, das durch Wissensdestillation und anschließende Quantisierung so weit komprimiert wurde, dass es in 14 MB Flash-Speicher passt. Parallel dazu reduzierte sich der RAM-Bedarf auf 256 KB SRAM, ergänzt durch 4 MB PSRAM für den eigentlichen Inferenz-Puffer. Der ESP32-S3 besitzt Hardware-Beschleunigung für 8-Bit-Integer-Mathematik, was die ML-Inferenz auf der Plattform überhaupt erst praktikabel macht. Ein erster Versuch benötigte noch rund 10 Minuten für 5 Sekunden Audio; nach Optimierung transkribiert das finale System 8 Sekunden Audio, wenn auch weiterhin langsam. Ein paralleler Test mit Whisper Tiny scheiterte praktisch: Dort wurden über 50 Minuten Inferenzzeit für 5 Sekunden Audio gemessen, weshalb eine weitere Optimierung nicht verfolgt wurde. Die vollständige Evaluation der Word Error Rate auf den Hugging Face ASR-Benchmark-Datensätzen ist im GitHub-Repository des Projekts dokumentiert.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com1w
sanoTTS: Kleinstes neuronales TTS-Modell mit 294k Parametern läuft auf 3-Dollar-Mikrocontroller
- FORSCHUNGarxiv.org2w
Neuromorphes Spracherkennungssystem erreicht 99,77 % auf Heidelberg Digits
- FORSCHUNGarxiv.org2w
TFA: Synthesisierbarer INT8-Chip für Transformer-Inferenz auf 2,73 mm²
- FORSCHUNGarxiv.org1w
LeanStream: Effiziente On-Device-LLM-Inferenz mit 2,1× höherem Durchsatz