Orukeet: Neues multilinguales ASR-Modell übertrifft NVIDIA Parakeet
Orukeet wurde von einem Nutzer der r/LocalLLaMA-Community via Reddit vorgestellt, nachdem das Modell in der App OpenWhispr als Empfehlung aufgetaucht war. Es handelt sich um eine Weiterentwicklung von NVIDIAs Parakeet TDT 0.6B v3, einem der leistungsfähigsten englischsprachigen ASR-Modelle. Der zentrale architektonische Eingriff besteht darin, die Hälfte der temporalen Depthwise-Filter im Encoder durch 12.288 gefittete, eingefrorene Gabor-Kerne zu ersetzen – ein Ansatz, der aus der Signalverarbeitungstheorie stammt und filterbasierte Merkmalsextraktion mit gelernten Parametern kombiniert. Die verbleibenden Modellgewichte wurden anschließend auf multilingualen und multi-akzentierten Daten trainiert, ohne das Gesamtgewicht des Modells zu erhöhen. Das Ergebnis ist ein Modell, das 25 Sprachen beherrscht und auf 61 von 74 getesteten Datensatz-Splits besser abschneidet als das Ausgangsmodell Parakeet. Die finale Modellselektion erfolgte anhand von LibriSpeech test-other als Checkpoint-Kriterium. Das Modell ist öffentlich auf Hugging Face unter dem Account „oruk" verfügbar und wird insbesondere für den Einsatz auf Apple-Silicon-Macs empfohlen.
- Gabor-Kerne: Exakt 12.288 gefittete, eingefrorene Gabor-Filter ersetzen 50 % der temporalen Depthwise-Filter im Parakeet-Encoder.
- FLEURS-Ergebnis: Über alle 25 Sprachen gepoolter WER von 9,85 % vs. 11,01 % bei Parakeet – entspricht 10,6 % relativer Reduktion.
- LibriSpeech test-other: Orukeet erreicht 2,86 % WER gegenüber 3,14 % bei Parakeet TDT 0.6B v3.
- Checkpoint-Selektion: Die finale Modelladaption nutzt LibriSpeech test-other als Auswahlkriterium, nicht test-clean.
- Verfügbarkeit: Modell liegt auf Hugging Face unter huggingface.co/oruk/orukeet; Entdeckt über die App OpenWhispr als automatische Empfehlung.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Orukeet: Neues multilinguales ASR-Modell übertrifft NVIDIA Parakeet
Orukeet wurde von einem Nutzer der r/LocalLLaMA-Community via Reddit vorgestellt, nachdem das Modell in der App OpenWhispr als Empfehlung aufgetaucht war. Es handelt sich um eine Weiterentwicklung von NVIDIAs Parakeet TDT 0.6B v3, einem der leistungsfähigsten englischsprachigen ASR-Modelle. Der zentrale architektonische Eingriff besteht darin, die Hälfte der temporalen Depthwise-Filter im Encoder durch 12.288 gefittete, eingefrorene Gabor-Kerne zu ersetzen – ein Ansatz, der aus der Signalverarbeitungstheorie stammt und filterbasierte Merkmalsextraktion mit gelernten Parametern kombiniert. Die verbleibenden Modellgewichte wurden anschließend auf multilingualen und multi-akzentierten Daten trainiert, ohne das Gesamtgewicht des Modells zu erhöhen. Das Ergebnis ist ein Modell, das 25 Sprachen beherrscht und auf 61 von 74 getesteten Datensatz-Splits besser abschneidet als das Ausgangsmodell Parakeet. Die finale Modellselektion erfolgte anhand von LibriSpeech test-other als Checkpoint-Kriterium. Das Modell ist öffentlich auf Hugging Face unter dem Account „oruk" verfügbar und wird insbesondere für den Einsatz auf Apple-Silicon-Macs empfohlen.
- Gabor-Kerne: Exakt 12.288 gefittete, eingefrorene Gabor-Filter ersetzen 50 % der temporalen Depthwise-Filter im Parakeet-Encoder.
- FLEURS-Ergebnis: Über alle 25 Sprachen gepoolter WER von 9,85 % vs. 11,01 % bei Parakeet – entspricht 10,6 % relativer Reduktion.
- LibriSpeech test-other: Orukeet erreicht 2,86 % WER gegenüber 3,14 % bei Parakeet TDT 0.6B v3.
- Checkpoint-Selektion: Die finale Modelladaption nutzt LibriSpeech test-other als Auswahlkriterium, nicht test-clean.
- Verfügbarkeit: Modell liegt auf Hugging Face unter huggingface.co/oruk/orukeet; Entdeckt über die App OpenWhispr als automatische Empfehlung.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.