Agnes-3.0-Flash 33B: Multimodales Open-Weight-Modell mit Hybrid-Attention
Warum es zählt
Die Hybrid-Architektur reduziert den KV-Cache auf nur 18 der 72 Decoder-Layer – das senkt den VRAM-Bedarf bei langen Kontexten erheblich. Als Open-Weight-Modell ist es lokal ausführbar, trotz irrtümlicher Kennzeichnung als proprietär auf Artificial Analysis.
— Lumeric Redaktion
262 144 Tokens
Kontextfenster des Modells
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Agnes-3.0-Flash 33B: Multimodales Open-Weight-Modell mit Hybrid-Attention
Warum es zählt
Die Hybrid-Architektur reduziert den KV-Cache auf nur 18 der 72 Decoder-Layer – das senkt den VRAM-Bedarf bei langen Kontexten erheblich. Als Open-Weight-Modell ist es lokal ausführbar, trotz irrtümlicher Kennzeichnung als proprietär auf Artificial Analysis.
— Lumeric Redaktion
262 144 Tokens
Kontextfenster des Modells
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.