llama.cpp auf AMD RX 6700 XT: 30 tps mit Tiel-Coder-35B ohne Quant-Änderung
CompaniesAMD
Warum es zählt
Die geteilte Konfiguration zeigt praxisnahe Hebel für mehr Inferenzgeschwindigkeit auf AMD-GPUs: MTP-Spekulation (spec-draft-n-max=3), KV-Cache-Quantisierung (q8_0), Flash-Attention und CPU-MoE-Offloading (n-cpu-moe=28) ohne Quant-Verschlechterung. Nützlich für alle, die lokale LLMs auf RDNA2-Hardware optimieren.
— Lumeric Redaktion
30 tps
Token/s auf RX 6700 XT mit Q4_K_XL
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
llama.cpp auf AMD RX 6700 XT: 30 tps mit Tiel-Coder-35B ohne Quant-Änderung
CompaniesAMD
Warum es zählt
Die geteilte Konfiguration zeigt praxisnahe Hebel für mehr Inferenzgeschwindigkeit auf AMD-GPUs: MTP-Spekulation (spec-draft-n-max=3), KV-Cache-Quantisierung (q8_0), Flash-Attention und CPU-MoE-Offloading (n-cpu-moe=28) ohne Quant-Verschlechterung. Nützlich für alle, die lokale LLMs auf RDNA2-Hardware optimieren.
— Lumeric Redaktion
30 tps
Token/s auf RX 6700 XT mit Q4_K_XL
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.