INT8-vLLM-Fork: Qwen3.8 27B erreicht 972 tok/s auf 4x MI100 für 6.500 $
Der Reddit-Nutzer u/1ncehost hat einen umfassenden Fork von vLLM veröffentlicht, der vollständige INT8-Unterstützung für ältere GPUs nachrüstet, die über hohe INT8-TOPS-Werte verfügen, aber kein natives FP8 beherrschen. Kernstück ist ein kompletter INT8-Serving-Stack, der auf vLLM, der AMD-Kernelbibliothek AITER und einem eigens erstellten GPTQ-INT8-W8A8-Quant von Qwen3.8 27B aufbaut. Der Fork ersetzt nicht nur einzelne Operationen, sondern integriert INT8 auf jeder Ebene der Inferenz-Pipeline: W8A8-GEMM, INT8-KV-Cache, INT8-Unified-Attention (mit Triton-Fallback für nicht-MI100-Hardware), INT8-Mamba- und GDN-Attention sowie INT8-optimiertes AllReduce und AllGather für XGMI-Interlinks. Besonderes Augenmerk legt der Autor auf Qualitätssicherung: Die Genauigkeit wurde nicht nur per End-to-End-Metrik, sondern durch KL-Divergenz-Messung auf Ebene jedes einzelnen GEMMs, jedes Attention-Blocks, jedes KV-Lookups und jeder Schicht verifiziert – alle Diagnose-Skripte sind im Fork enthalten. Obwohl die Tuning-Arbeit primär auf das 4x-MI100-Setup abzielt, sind die Triton-Fallback-Kernel hardwareagnostisch und sollen auch auf MI50, MI210 sowie älteren Nvidia-Karten ohne natives FP8 deutlich schneller als Stock vLLM laufen. Die beiden quantisierten Modellvarianten (mit und ohne DFlash2) sind auf Hugging Face unter dem Account „curvedinf" verfügbar.
- W8A8 GEMM mit Gruppensize 128 (GS128): Das INT8-Quant nutzt aktivierungsgewichtete 8-Bit-GEMM mit 128er-Gruppen, was Präzisionsverluste minimiert.
- Zwei Modellvarianten auf HuggingFace: Qwen3.8-27B-GPTQ-INT8-W8A8-GS128 und eine DFlash2-Variante (curvedinf/Qwen3.8-27B-DFlash2-GPTQ-INT8-W8A8-GS128).
- INT8 Unified Attention via AITER ist laut Autor schneller als Flash Attention; Triton-Fallback läuft auf beliebiger Hardware ohne MI100-spezifische Optimierungen.
- Qualitätsprüfung per KLD auf Ebene jedes GEMMs, Attention-Blocks, KV-Lookups und Layers — Diagnose-Skripte sind im Fork öffentlich zugänglich.
- Das Projekt ist als Community-PR-Basis gedacht: Tuning für andere GPU-Architekturen und Modell-Architekturen wird ausdrücklich per Pull Request willkommen geheißen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
INT8-vLLM-Fork: Qwen3.8 27B erreicht 972 tok/s auf 4x MI100 für 6.500 $
Der Reddit-Nutzer u/1ncehost hat einen umfassenden Fork von vLLM veröffentlicht, der vollständige INT8-Unterstützung für ältere GPUs nachrüstet, die über hohe INT8-TOPS-Werte verfügen, aber kein natives FP8 beherrschen. Kernstück ist ein kompletter INT8-Serving-Stack, der auf vLLM, der AMD-Kernelbibliothek AITER und einem eigens erstellten GPTQ-INT8-W8A8-Quant von Qwen3.8 27B aufbaut. Der Fork ersetzt nicht nur einzelne Operationen, sondern integriert INT8 auf jeder Ebene der Inferenz-Pipeline: W8A8-GEMM, INT8-KV-Cache, INT8-Unified-Attention (mit Triton-Fallback für nicht-MI100-Hardware), INT8-Mamba- und GDN-Attention sowie INT8-optimiertes AllReduce und AllGather für XGMI-Interlinks. Besonderes Augenmerk legt der Autor auf Qualitätssicherung: Die Genauigkeit wurde nicht nur per End-to-End-Metrik, sondern durch KL-Divergenz-Messung auf Ebene jedes einzelnen GEMMs, jedes Attention-Blocks, jedes KV-Lookups und jeder Schicht verifiziert – alle Diagnose-Skripte sind im Fork enthalten. Obwohl die Tuning-Arbeit primär auf das 4x-MI100-Setup abzielt, sind die Triton-Fallback-Kernel hardwareagnostisch und sollen auch auf MI50, MI210 sowie älteren Nvidia-Karten ohne natives FP8 deutlich schneller als Stock vLLM laufen. Die beiden quantisierten Modellvarianten (mit und ohne DFlash2) sind auf Hugging Face unter dem Account „curvedinf" verfügbar.
- W8A8 GEMM mit Gruppensize 128 (GS128): Das INT8-Quant nutzt aktivierungsgewichtete 8-Bit-GEMM mit 128er-Gruppen, was Präzisionsverluste minimiert.
- Zwei Modellvarianten auf HuggingFace: Qwen3.8-27B-GPTQ-INT8-W8A8-GS128 und eine DFlash2-Variante (curvedinf/Qwen3.8-27B-DFlash2-GPTQ-INT8-W8A8-GS128).
- INT8 Unified Attention via AITER ist laut Autor schneller als Flash Attention; Triton-Fallback läuft auf beliebiger Hardware ohne MI100-spezifische Optimierungen.
- Qualitätsprüfung per KLD auf Ebene jedes GEMMs, Attention-Blocks, KV-Lookups und Layers — Diagnose-Skripte sind im Fork öffentlich zugänglich.
- Das Projekt ist als Community-PR-Basis gedacht: Tuning für andere GPU-Architekturen und Modell-Architekturen wird ausdrücklich per Pull Request willkommen geheißen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.