DiffusionGemma 26B auf 4× AMD RX 7900 XTX: 100 t/s Generation via vllm
DiffusionGemma 26B (A4B-it) ist ein Mixture-of-Experts-Diffusions-Sprachmodell von Google, das im Gegensatz zu autogressiven LLMs Token iterativ durch einen Diffusionsprozess erzeugt. Der Reddit-Nutzer djdeniro betreibt das Modell auf vier AMD Radeon RX 7900 XTX (Consumer-Grafikkarten mit je 24 GB VRAM) unter ROCm via eines eigens gepatchten vllm-Branches namens „dgemma". Die Konfiguration nutzt Tensor-Parallelism über alle vier GPUs, was eine effektive Kontextlänge von bis zu 131.072 Tokens ermöglicht – bei maximal 1,16 gleichzeitigen Anfragen dieser Länge. Der KV-Cache fasst dabei 152.671 Tokens. Bemerkenswert ist die explizite Deaktivierung der ROCm-spezifischen AITER-Kernel (VLLM_ROCM_USE_AITER=0) zugunsten des TRITON_ATTN-Backends sowie der Einsatz des Entropy-Bound-Samplers mit einem Schwellenwert von 0,1 – eine Diffusions-spezifische Sampling-Strategie, die die Ausgabequalität steuert. Der GPU-Speicher wird nur zu 65 % (gpu-memory-utilization 0.65) ausgelastet, obwohl bereits ~23,6–23,7 GB pro Karte belegt sind. Die Leistungsaufnahme liegt während der Inferenz bei 154–183 W pro GPU, die Temperaturen bei 78–88 °C. Für den Aufbau des Docker-Images war laut Autor ein erheblicher Aufwand nötig: 2–3 Millionen Tokens eines externen Modells (DeepSeek V4 Pro) wurden für die Vorbereitung der Containerumgebung aufgewendet – ein Hinweis auf die noch nicht triviale Einrichtung dieses Setups.
- GPU-Speicherauslastung: 65 % Utilization-Limit konfiguriert, effektiv ~23,6–23,7 GB pro Karte belegt (von 24,0 GB verfügbar).
- Entropy-Bound-Sampler mit diffusion_entropy_bound=0.1 als Diffusions-spezifischer HF-Override übergeben — steuert, wann Token als 'sicher' fixiert gelten.
- MoE-Konfigurationsdatei für E=128, N=176 explizit per Volume-Mount für den AMD RX 7900 XTX eingebunden — deutet auf manuelle Tuning-Arbeit für die GPU-Architektur hin.
- Shared-Memory-Größe des Containers: 32 GB (--shm-size=32g); OMP_NUM_THREADS auf 8 gesetzt.
- Docker-Image basiert auf einem nicht-offiziellen vllm-dgemma-Branch (Tag: nocompile), kein Einsatz von torch.compile laut Image-Name.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
DiffusionGemma 26B auf 4× AMD RX 7900 XTX: 100 t/s Generation via vllm
DiffusionGemma 26B (A4B-it) ist ein Mixture-of-Experts-Diffusions-Sprachmodell von Google, das im Gegensatz zu autogressiven LLMs Token iterativ durch einen Diffusionsprozess erzeugt. Der Reddit-Nutzer djdeniro betreibt das Modell auf vier AMD Radeon RX 7900 XTX (Consumer-Grafikkarten mit je 24 GB VRAM) unter ROCm via eines eigens gepatchten vllm-Branches namens „dgemma". Die Konfiguration nutzt Tensor-Parallelism über alle vier GPUs, was eine effektive Kontextlänge von bis zu 131.072 Tokens ermöglicht – bei maximal 1,16 gleichzeitigen Anfragen dieser Länge. Der KV-Cache fasst dabei 152.671 Tokens. Bemerkenswert ist die explizite Deaktivierung der ROCm-spezifischen AITER-Kernel (VLLM_ROCM_USE_AITER=0) zugunsten des TRITON_ATTN-Backends sowie der Einsatz des Entropy-Bound-Samplers mit einem Schwellenwert von 0,1 – eine Diffusions-spezifische Sampling-Strategie, die die Ausgabequalität steuert. Der GPU-Speicher wird nur zu 65 % (gpu-memory-utilization 0.65) ausgelastet, obwohl bereits ~23,6–23,7 GB pro Karte belegt sind. Die Leistungsaufnahme liegt während der Inferenz bei 154–183 W pro GPU, die Temperaturen bei 78–88 °C. Für den Aufbau des Docker-Images war laut Autor ein erheblicher Aufwand nötig: 2–3 Millionen Tokens eines externen Modells (DeepSeek V4 Pro) wurden für die Vorbereitung der Containerumgebung aufgewendet – ein Hinweis auf die noch nicht triviale Einrichtung dieses Setups.
- GPU-Speicherauslastung: 65 % Utilization-Limit konfiguriert, effektiv ~23,6–23,7 GB pro Karte belegt (von 24,0 GB verfügbar).
- Entropy-Bound-Sampler mit diffusion_entropy_bound=0.1 als Diffusions-spezifischer HF-Override übergeben — steuert, wann Token als 'sicher' fixiert gelten.
- MoE-Konfigurationsdatei für E=128, N=176 explizit per Volume-Mount für den AMD RX 7900 XTX eingebunden — deutet auf manuelle Tuning-Arbeit für die GPU-Architektur hin.
- Shared-Memory-Größe des Containers: 32 GB (--shm-size=32g); OMP_NUM_THREADS auf 8 gesetzt.
- Docker-Image basiert auf einem nicht-offiziellen vllm-dgemma-Branch (Tag: nocompile), kein Einsatz von torch.compile laut Image-Name.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.