Qwen 3.8 27B UD-IQ3_XXS: 200k+ Kontext auf 16 GB VRAM mit eGPU
Der Reddit-Nutzer /u/abskvrm berichtet von einem Setup, das mit dem UD-IQ3_XXS-Quantisierungsformat von Qwen 3.8 27B auf einer RTX 5060 Ti mit 16 GB VRAM über 200.000 Token Kontext ermöglicht. Zuvor nutzte er das schwerere UD-Q3_K_XL-Quant, das auf demselben System immerhin knapp über 140.000 Token Kontext zuließ. Der Wechsel auf IQ3_XXS wurde durch positive Berichte anderer Community-Mitglieder im Subreddit angestoßen. Als Inference-Backend kommt llama.cpp zum Einsatz, kompiliert mit dem Flag DGGML_CUDA_FA_ALL_QUANTS=ON, das Flash-Attention für alle Quantisierungstypen aktiviert und so die Speichereffizienz verbessert. Der KV-Cache wurde in beiden Konfigurationen auf q5_1 quantisiert. Das Modell läuft ohne Multitoken-Prediction (MTP) und ohne Multimodal-Projektor (mmproj). Die Hardware-Basis ist ungewöhnlich: ein gewöhnlicher Laptop, der über Thunderbolt 4 mit einer Aorus 5060 Ti AI Box als externe GPU verbunden ist – Consumer-Hardware im besten Sinne. Als Betriebssystem kommt Windows 11 zum Einsatz, was der Nutzer mit der Nvidia-Treiber-Abhängigkeit begründet.
- Vorherige Konfiguration UD-Q3_K_XL erlaubte bis zu ~140.000 Token Kontext auf demselben System.
- llama.cpp wurde mit DGGML_CUDA_FA_ALL_QUANTS=ON kompiliert, um Flash Attention für alle Quant-Typen zu aktivieren.
- KV-Cache wurde in beiden Setups auf q5_1 quantisiert, nicht auf das Standard-Format belassen.
- Modell läuft ohne MTP (Multitoken Prediction) und ohne mmproj (Multimodal Projector) — rein textbasiert.
- Hardware: Laptop + Thunderbolt-4-Verbindung zur Aorus 5060 Ti AI Box als eGPU, Betriebssystem Windows 11.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Qwen 3.8 27B UD-IQ3_XXS: 200k+ Kontext auf 16 GB VRAM mit eGPU
Der Reddit-Nutzer /u/abskvrm berichtet von einem Setup, das mit dem UD-IQ3_XXS-Quantisierungsformat von Qwen 3.8 27B auf einer RTX 5060 Ti mit 16 GB VRAM über 200.000 Token Kontext ermöglicht. Zuvor nutzte er das schwerere UD-Q3_K_XL-Quant, das auf demselben System immerhin knapp über 140.000 Token Kontext zuließ. Der Wechsel auf IQ3_XXS wurde durch positive Berichte anderer Community-Mitglieder im Subreddit angestoßen. Als Inference-Backend kommt llama.cpp zum Einsatz, kompiliert mit dem Flag DGGML_CUDA_FA_ALL_QUANTS=ON, das Flash-Attention für alle Quantisierungstypen aktiviert und so die Speichereffizienz verbessert. Der KV-Cache wurde in beiden Konfigurationen auf q5_1 quantisiert. Das Modell läuft ohne Multitoken-Prediction (MTP) und ohne Multimodal-Projektor (mmproj). Die Hardware-Basis ist ungewöhnlich: ein gewöhnlicher Laptop, der über Thunderbolt 4 mit einer Aorus 5060 Ti AI Box als externe GPU verbunden ist – Consumer-Hardware im besten Sinne. Als Betriebssystem kommt Windows 11 zum Einsatz, was der Nutzer mit der Nvidia-Treiber-Abhängigkeit begründet.
- Vorherige Konfiguration UD-Q3_K_XL erlaubte bis zu ~140.000 Token Kontext auf demselben System.
- llama.cpp wurde mit DGGML_CUDA_FA_ALL_QUANTS=ON kompiliert, um Flash Attention für alle Quant-Typen zu aktivieren.
- KV-Cache wurde in beiden Setups auf q5_1 quantisiert, nicht auf das Standard-Format belassen.
- Modell läuft ohne MTP (Multitoken Prediction) und ohne mmproj (Multimodal Projector) — rein textbasiert.
- Hardware: Laptop + Thunderbolt-4-Verbindung zur Aorus 5060 Ti AI Box als eGPU, Betriebssystem Windows 11.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.