Qwen3.8-27B mit DFlash2 auf RTX 4080: 86,7 tok/s bei 120k Kontext
Warum es zählt
DFlash2 ist noch nicht im llama.cpp-Master-Branch, sondern nur via ungemergtem PR #27342 verfügbar. Der Setup-Guide ermöglicht es, ein 27B-Modell in Q2-Quantisierung mit über 60 tok/s bei 120k-Kontext auf Consumer-Hardware zu betreiben – relevant für alle, die große Modelle lokal mit langen Kontexten nutzen wollen.
— Lumeric Redaktion
Tok/s Throughput – RTX 4080 16GB, Qwen3.8-27B Q2_K_P · Spitzenwert
86.7%
4k Kontext (DFlash2)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-27B mit DFlash2 auf RTX 4080: 86,7 tok/s bei 120k Kontext
Warum es zählt
DFlash2 ist noch nicht im llama.cpp-Master-Branch, sondern nur via ungemergtem PR #27342 verfügbar. Der Setup-Guide ermöglicht es, ein 27B-Modell in Q2-Quantisierung mit über 60 tok/s bei 120k-Kontext auf Consumer-Hardware zu betreiben – relevant für alle, die große Modelle lokal mit langen Kontexten nutzen wollen.
— Lumeric Redaktion
Tok/s Throughput – RTX 4080 16GB, Qwen3.8-27B Q2_K_P · Spitzenwert
86.7%
4k Kontext (DFlash2)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.