Ornith 1.5 35B-A3B erreicht 180 tok/s auf zwei RTX 5070 Ti – 3× schneller als Qwen3.8 27B
Warum es zählt
Ornith 1.5 35B-A3B nutzt Mixture-of-Experts mit nur ~3B aktiven Parametern pro Token und überwiegend linearer Attention, was den KV-Cache minimal hält und bei 128K Kontext (24,4 GB) vollständig auf zwei Consumer-GPUs passt. Das macht es für lokale Agent-Workloads mit langen Kontexten praktisch attraktiver als dichte 27B-Modelle.
— Lumeric Redaktion
Lokaler Agenten-Speed-Vergleich (tok/s) · Spitzenwert
180%
Ornith 1.5 35B-A3B (Q4_K_M)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Ornith 1.5 35B-A3B erreicht 180 tok/s auf zwei RTX 5070 Ti – 3× schneller als Qwen3.8 27B
Warum es zählt
Ornith 1.5 35B-A3B nutzt Mixture-of-Experts mit nur ~3B aktiven Parametern pro Token und überwiegend linearer Attention, was den KV-Cache minimal hält und bei 128K Kontext (24,4 GB) vollständig auf zwei Consumer-GPUs passt. Das macht es für lokale Agent-Workloads mit langen Kontexten praktisch attraktiver als dichte 27B-Modelle.
— Lumeric Redaktion
Lokaler Agenten-Speed-Vergleich (tok/s) · Spitzenwert
180%
Ornith 1.5 35B-A3B (Q4_K_M)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.