Huawei Atlas 300I Duo: Qwen3.8-Flash-Next läuft mit 61 tok/s auf zwei Ascend-Karten
CompaniesNVIDIA
Warum es zählt
Die Karten sind günstig und passiv gekühlt, aber kein CUDA-Drop-in: Jedes der vier Ascend-310P3-Chips hat nur 48 GB lokalen Speicher, was explizites Modell-Parallelismus erfordert. Wer Non-NVIDIA-Hardware für lokale Inferenz evaluiert, findet hier einen detaillierten Software-Stack-Bericht inkl. vLLM-Ascend-Patches und Kühlungshinweisen.
— Lumeric Redaktion
Short Decode Benchmark (Qwen3.8-Flash-Next, Atlas 300I Duo) · Spitzenwert
30%
Single Request
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Huawei Atlas 300I Duo: Qwen3.8-Flash-Next läuft mit 61 tok/s auf zwei Ascend-Karten
CompaniesNVIDIA
Warum es zählt
Die Karten sind günstig und passiv gekühlt, aber kein CUDA-Drop-in: Jedes der vier Ascend-310P3-Chips hat nur 48 GB lokalen Speicher, was explizites Modell-Parallelismus erfordert. Wer Non-NVIDIA-Hardware für lokale Inferenz evaluiert, findet hier einen detaillierten Software-Stack-Bericht inkl. vLLM-Ascend-Patches und Kühlungshinweisen.
— Lumeric Redaktion
Short Decode Benchmark (Qwen3.8-Flash-Next, Atlas 300I Duo) · Spitzenwert
30%
Single Request
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.