Sori-1B: Audio-Sprach-Modell komplett ohne Text-Only-Pretraining trainiert
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com3w
Superwhisper veröffentlicht S1-mini: 0,6B-Parameter-Modell zur STT-Textnormalisierung
- FORSCHUNGarxiv.org4d
TontaubeV1: Streaming-TTS mit hierarchischem Codec und 200 ms bis zum ersten Audio
- FORSCHUNGarxiv.org1w
Mechanismen des Audio-Groundings in Audio LLMs untersucht
- FORSCHUNGarxiv.org1w
TEMPO: Erstes einheitliches Modell für Audio-Zeitstempel-Aufgaben per Post-Training
Sori-1B: Audio-Sprach-Modell komplett ohne Text-Only-Pretraining trainiert
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com3w
Superwhisper veröffentlicht S1-mini: 0,6B-Parameter-Modell zur STT-Textnormalisierung
- FORSCHUNGarxiv.org4d
TontaubeV1: Streaming-TTS mit hierarchischem Codec und 200 ms bis zum ersten Audio
- FORSCHUNGarxiv.org1w
Mechanismen des Audio-Groundings in Audio LLMs untersucht
- FORSCHUNGarxiv.org1w
TEMPO: Erstes einheitliches Modell für Audio-Zeitstempel-Aufgaben per Post-Training