Radeon 780m iGPU mit 64 GB DDR5 als Budget-Lösung für lokale LLMs unter 1000 EUR
Warum es zählt
Qwen3 35B-A3B Q8 erreicht ~21 t/s (tg) und ~287 t/s (pp), Gemma4 31B Q8 nur ~2,5 t/s (tg). MTP-Speculative-Decoding steigert bei Gemma4 auf ~5,76 t/s. Für AI-Builder mit knappem Budget zeigt das Setup einen konkreten, reproduzierbaren Pfad für 30–35B-Modelle ohne dedizierte GPU.
— Lumeric Redaktion
llama.cpp tg128 (Tokens/s, Vulkan, iGPU) · Spitzenwert
21.06%
Qwen3 35B-A3B Q8_0
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Radeon 780m iGPU mit 64 GB DDR5 als Budget-Lösung für lokale LLMs unter 1000 EUR
Warum es zählt
Qwen3 35B-A3B Q8 erreicht ~21 t/s (tg) und ~287 t/s (pp), Gemma4 31B Q8 nur ~2,5 t/s (tg). MTP-Speculative-Decoding steigert bei Gemma4 auf ~5,76 t/s. Für AI-Builder mit knappem Budget zeigt das Setup einen konkreten, reproduzierbaren Pfad für 30–35B-Modelle ohne dedizierte GPU.
— Lumeric Redaktion
llama.cpp tg128 (Tokens/s, Vulkan, iGPU) · Spitzenwert
21.06%
Qwen3 35B-A3B Q8_0
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.