Qwen3.8-27B auf RTX 5060 Ti 16GB: IQ4 vs. Q8, 64K-Kontext und Agent-Benchmarks
Der Test untersucht, ob Qwen3.8-27B als Ersatz für das bislang genutzte Qwen3.5-9B auf einer einzigen RTX 5060 Ti mit 16 GB VRAM praxistauglich ist – mit Fokus auf agentische Nutzung, also zuverlässiges Tool-Calling, lange Kontextfenster und Vision. Als Laufzeitumgebung dient llama.cpp Build 10520 auf Ubuntu mit aktiviertem Flash Attention und vollständigem GPU-Offload; der KV-Cache läuft im Q4_0-Format. Verglichen werden drei Quants des 27B-Modells (jpetrina IQ4_XS-pure, Unsloth UD-IQ4_XS und Unsloth Q8_0 als Qualitätsbasis) sowie das bisherige Qwen3.5-9B NVFP4. Beim Quantisierungsvergleich auf 16 WikiText-2-Samples zeigt das Unsloth UD-IQ4_XS mit einer mittleren KLD von 0,018 gegenüber Q8 und 93,06 % Top-Token-Übereinstimmung eine deutlich höhere Wiedergabetreue als die jpetrina-Variante. Im Multi-Turn-BFCL-Benchmark liegen beide 27B-Varianten mit 38–40 von 80 Punkten klar vor dem 9B-Modell (29/80), das jedoch beim isolierten Single-Turn-Test (56/100) noch die Nase vorn hat. Die Vision-Funktionalität über den F16-Projektor – inklusive OCR-artiger Zeitungsbild-Erkennung – funktioniert prinzipiell, beansprucht aber so viel VRAM, dass bei 64K-Kontext plus MTP-1 nur noch 136–208 MiB frei bleiben. Der Autor empfiehlt daher separate Profile für Text-Agenten und Vision-Aufgaben, da der gleichzeitige Betrieb aller Features zu nah an die 16-GB-Grenze heranreicht.
- Prompt-Processing bei ~55K gefüllten Kontext-Tokens: 738,7 tok/s; Generation nach Prefill: 31,3 tok/s – damit gilt 64K als interaktiv nutzbar.
- Das separate Laden eines zusätzlichen MTP-GGUFs ist bei Unsloth überflüssig, da die MTP-Tensoren bereits im Haupt-GGUF enthalten sind – ein Zusatz-GGUF kostet rund 768 MiB unnötig.
- jpetrina IQ4_XS-pure erreicht mit MTP-1 46,9 tok/s bei 15.188 MiB Idle-VRAM; Unsloth UD-IQ4_XS mit MTP-1 kommt auf 45,6 tok/s bei 14.918 MiB.
- Multi-Turn-Support-Szenarien umfassten u. a. Diagnose vor Mutation, autorisierten Neustart mit Verifikation, abhängige Tool-Calls, Klärung fehlender Parameter und Prompt-Injection-Resistenz bei ~55K Tokens Gesprächsverlauf.
- Alle drei getesteten Modelle bestanden zusätzlich einen 8/8-nativen Tool-Calling-Smoke-Test vollständig.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen3.8-27B auf RTX 5060 Ti 16GB: IQ4 vs. Q8, 64K-Kontext und Agent-Benchmarks
Der Test untersucht, ob Qwen3.8-27B als Ersatz für das bislang genutzte Qwen3.5-9B auf einer einzigen RTX 5060 Ti mit 16 GB VRAM praxistauglich ist – mit Fokus auf agentische Nutzung, also zuverlässiges Tool-Calling, lange Kontextfenster und Vision. Als Laufzeitumgebung dient llama.cpp Build 10520 auf Ubuntu mit aktiviertem Flash Attention und vollständigem GPU-Offload; der KV-Cache läuft im Q4_0-Format. Verglichen werden drei Quants des 27B-Modells (jpetrina IQ4_XS-pure, Unsloth UD-IQ4_XS und Unsloth Q8_0 als Qualitätsbasis) sowie das bisherige Qwen3.5-9B NVFP4. Beim Quantisierungsvergleich auf 16 WikiText-2-Samples zeigt das Unsloth UD-IQ4_XS mit einer mittleren KLD von 0,018 gegenüber Q8 und 93,06 % Top-Token-Übereinstimmung eine deutlich höhere Wiedergabetreue als die jpetrina-Variante. Im Multi-Turn-BFCL-Benchmark liegen beide 27B-Varianten mit 38–40 von 80 Punkten klar vor dem 9B-Modell (29/80), das jedoch beim isolierten Single-Turn-Test (56/100) noch die Nase vorn hat. Die Vision-Funktionalität über den F16-Projektor – inklusive OCR-artiger Zeitungsbild-Erkennung – funktioniert prinzipiell, beansprucht aber so viel VRAM, dass bei 64K-Kontext plus MTP-1 nur noch 136–208 MiB frei bleiben. Der Autor empfiehlt daher separate Profile für Text-Agenten und Vision-Aufgaben, da der gleichzeitige Betrieb aller Features zu nah an die 16-GB-Grenze heranreicht.
- Prompt-Processing bei ~55K gefüllten Kontext-Tokens: 738,7 tok/s; Generation nach Prefill: 31,3 tok/s – damit gilt 64K als interaktiv nutzbar.
- Das separate Laden eines zusätzlichen MTP-GGUFs ist bei Unsloth überflüssig, da die MTP-Tensoren bereits im Haupt-GGUF enthalten sind – ein Zusatz-GGUF kostet rund 768 MiB unnötig.
- jpetrina IQ4_XS-pure erreicht mit MTP-1 46,9 tok/s bei 15.188 MiB Idle-VRAM; Unsloth UD-IQ4_XS mit MTP-1 kommt auf 45,6 tok/s bei 14.918 MiB.
- Multi-Turn-Support-Szenarien umfassten u. a. Diagnose vor Mutation, autorisierten Neustart mit Verifikation, abhängige Tool-Calls, Klärung fehlender Parameter und Prompt-Injection-Resistenz bei ~55K Tokens Gesprächsverlauf.
- Alle drei getesteten Modelle bestanden zusätzlich einen 8/8-nativen Tool-Calling-Smoke-Test vollständig.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.