Muse-Glimmer-30B auf AMD v620: Tensor-Split-Benchmarks mit 1 und 2 GPUs
CompaniesAMD
Warum es zählt
Konkrete Throughput-Werte zeigen: Tensor-Split mit llama-server verdoppelt annähernd die Prompt-Processing-Rate (z.B. 16k: 372 → 553 tok/s bei Q6). Der Token-Generierungs-Speedup ist jedoch minimal (~35 vs. ~36 tok/s), was auf speichergebundene Engpässe beim Decoding hinweist.
— Lumeric Redaktion
Prompt Processing @ 16k Tokens (tok/s) · Spitzenwert
372.57%
Q6 – 1 GPU
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Muse-Glimmer-30B auf AMD v620: Tensor-Split-Benchmarks mit 1 und 2 GPUs
CompaniesAMD
Warum es zählt
Konkrete Throughput-Werte zeigen: Tensor-Split mit llama-server verdoppelt annähernd die Prompt-Processing-Rate (z.B. 16k: 372 → 553 tok/s bei Q6). Der Token-Generierungs-Speedup ist jedoch minimal (~35 vs. ~36 tok/s), was auf speichergebundene Engpässe beim Decoding hinweist.
— Lumeric Redaktion
Prompt Processing @ 16k Tokens (tok/s) · Spitzenwert
372.57%
Q6 – 1 GPU
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.