Ling 3.0 Flash übertrifft Qwen-122B auf Strix Halo in Inferenzgeschwindigkeit
Der Reddit-Nutzer Badger-Purple berichtet aus eigenen Tests auf einem System mit AMD Strix Halo: Ling 3.0 Flash, betrieben via vLLM mit ROCm/HiP-Backend und 4-Bit Compressed-Tensors (int4), übertrifft Qwen-122B in der Inferenzgeschwindigkeit – selbst wenn Qwen im rocmFP4-Format läuft, das er als das für seine Hardware optimierteste Format bezeichnet. Strix Halo ist AMDs hochintegrierter APU-Chip, der durch seinen großen gemeinsamen LPDDR5X-Speicher besonders für lokale LLM-Ausführung interessant ist. Compressed-Tensors (int4) ist ein von Neural Magic entwickeltes Quantisierungsformat, das unter vLLM nativ unterstützt wird und auf sparsity-freundliche Kompression setzt. Das rocmFP4-Format hingegen ist AMDs nativer 4-Bit-Gleitkommastandard, der speziell für ROCm-Hardware optimiert ist und im Allgemeinen als besonders effizient auf AMD-GPUs gilt. Dass Ling 3.0 Flash im int4 Compressed-Tensors-Format dennoch schneller ist, deutet auf eine günstige Modellarchitektur hin, die die verfügbare Speicherbandbreite des Strix Halo besonders gut ausnutzt. Ein weiterer Befund aus dem Post: Tool-Call-Funktionalität ist in bestimmten Harnesses fehlerhaft, funktioniert jedoch gut mit sogenannten pi-type Harnesses wie omp und feynman. Der Nutzer verlinkt auf einen externen Tweet des Accounts @ciruai, der vermutlich weitere Benchmark-Details enthält.
- vLLM-Backend: Ling 3.0 Flash läuft unter vLLM mit ROCm/HiP-Unterstützung und int4 Compressed-Tensors-Quantisierung.
- Vergleichsmodell Qwen-122B wurde im rocmFP4-Format getestet – laut Nutzer das optimierteste ihm verfügbare Format für AMD-Hardware.
- Tool-Call-Unterstützung funktioniert laut Badger-Purple mit pi-type Harnesses (omp, feynman), ist aber in anderen Harnesses fehlerhaft.
- Externer Beleg: Nutzer verlinkt auf Tweet von @ciruai (X/Twitter) mit weiteren Details zum Geschwindigkeitsvergleich.
- Badger-Purple stuft den Vergleich explizit als nicht fair ein, da unterschiedliche Quantisierungsformate verglichen werden.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Ling 3.0 Flash übertrifft Qwen-122B auf Strix Halo in Inferenzgeschwindigkeit
Der Reddit-Nutzer Badger-Purple berichtet aus eigenen Tests auf einem System mit AMD Strix Halo: Ling 3.0 Flash, betrieben via vLLM mit ROCm/HiP-Backend und 4-Bit Compressed-Tensors (int4), übertrifft Qwen-122B in der Inferenzgeschwindigkeit – selbst wenn Qwen im rocmFP4-Format läuft, das er als das für seine Hardware optimierteste Format bezeichnet. Strix Halo ist AMDs hochintegrierter APU-Chip, der durch seinen großen gemeinsamen LPDDR5X-Speicher besonders für lokale LLM-Ausführung interessant ist. Compressed-Tensors (int4) ist ein von Neural Magic entwickeltes Quantisierungsformat, das unter vLLM nativ unterstützt wird und auf sparsity-freundliche Kompression setzt. Das rocmFP4-Format hingegen ist AMDs nativer 4-Bit-Gleitkommastandard, der speziell für ROCm-Hardware optimiert ist und im Allgemeinen als besonders effizient auf AMD-GPUs gilt. Dass Ling 3.0 Flash im int4 Compressed-Tensors-Format dennoch schneller ist, deutet auf eine günstige Modellarchitektur hin, die die verfügbare Speicherbandbreite des Strix Halo besonders gut ausnutzt. Ein weiterer Befund aus dem Post: Tool-Call-Funktionalität ist in bestimmten Harnesses fehlerhaft, funktioniert jedoch gut mit sogenannten pi-type Harnesses wie omp und feynman. Der Nutzer verlinkt auf einen externen Tweet des Accounts @ciruai, der vermutlich weitere Benchmark-Details enthält.
- vLLM-Backend: Ling 3.0 Flash läuft unter vLLM mit ROCm/HiP-Unterstützung und int4 Compressed-Tensors-Quantisierung.
- Vergleichsmodell Qwen-122B wurde im rocmFP4-Format getestet – laut Nutzer das optimierteste ihm verfügbare Format für AMD-Hardware.
- Tool-Call-Unterstützung funktioniert laut Badger-Purple mit pi-type Harnesses (omp, feynman), ist aber in anderen Harnesses fehlerhaft.
- Externer Beleg: Nutzer verlinkt auf Tweet von @ciruai (X/Twitter) mit weiteren Details zum Geschwindigkeitsvergleich.
- Badger-Purple stuft den Vergleich explizit als nicht fair ein, da unterschiedliche Quantisierungsformate verglichen werden.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.