NInfer: 543 tok/s mit Qwen3.6-35B-A3B auf einer RTX 5090
Warum es zählt
Für lokale Inferenz zeigt NInfer, dass mit spezialisierter End-to-end-Optimierung (Custom Quantisierung ~5 bpw, Kernel-Fusion, LM-Head-Draft) auf einer Single-GPU über 540 tok/s erreichbar sind. Als Open-Source-Projekt inkl. Hugging-Face-Artefakten direkt reproduzierbar – jedoch nur für RTX 5090 und zwei Qwen3.6-Checkpoints.
— Lumeric Redaktion
542,8 tok/s
Single-Request-Decode über 65.536 Token
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
NInfer: 543 tok/s mit Qwen3.6-35B-A3B auf einer RTX 5090
Warum es zählt
Für lokale Inferenz zeigt NInfer, dass mit spezialisierter End-to-end-Optimierung (Custom Quantisierung ~5 bpw, Kernel-Fusion, LM-Head-Draft) auf einer Single-GPU über 540 tok/s erreichbar sind. Als Open-Source-Projekt inkl. Hugging-Face-Artefakten direkt reproduzierbar – jedoch nur für RTX 5090 und zwei Qwen3.6-Checkpoints.
— Lumeric Redaktion
542,8 tok/s
Single-Request-Decode über 65.536 Token
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.