Qwen3.8-27B auf RTX 3090: 138 tps durch DFlash2 und Lookup-Drafting
ToolsQwen
CompaniesPerplexity
Warum es zählt
Prefix-Caching für Hybrid-Modelle reduziert Folge-Turn-Latenz von 23 s auf unter 1,35 s; der Lookup-Drafting-Kernel bringt +29 % Tokens/Schritt bei reproduktiven Tasks. Alle Patches sind Open Source und per Docker deploybar – direkt verwertbar für lokale Inferenz-Setups.
— Lumeric Redaktion
138 tps
Single-User-Durchsatz auf RTX 3090 (250 W)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Qwen3.8-27B auf RTX 3090: 138 tps durch DFlash2 und Lookup-Drafting
ToolsQwen
CompaniesPerplexity
Warum es zählt
Prefix-Caching für Hybrid-Modelle reduziert Folge-Turn-Latenz von 23 s auf unter 1,35 s; der Lookup-Drafting-Kernel bringt +29 % Tokens/Schritt bei reproduktiven Tasks. Alle Patches sind Open Source und per Docker deploybar – direkt verwertbar für lokale Inferenz-Setups.
— Lumeric Redaktion
138 tps
Single-User-Durchsatz auf RTX 3090 (250 W)
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.