Qwen 3.6 27B lokal: Kontext-Vergessen bei Agentenaufgaben mit Opencode
Der Reddit-Nutzer milpster betreibt Qwen 3.6 27B (Quantisierungsstufe Q8_K_XL) lokal auf einer AMD-GPU-Konfiguration via ROCm 6.1 und llama.cpp. Als Agentenframework setzt er Opencode zusammen mit dem „oh my openagent"-Harness ein, das bereits beim Start 45–55k Tokens Kontext verbraucht. Bei einem Gesamt-Kontextfenster von 105.000 Tokens verbleiben für längere Runs entsprechend wenig Reserve. Das Kernproblem: Das Modell vergisst über längere Sitzungen hinweg explizite Instruktionen – etwa die Direktive, Prompts verlustfrei zu komprimieren – und wandelt diese eigenständig in numerische Zielwerte (konkret: 40 % Kompression) um. Zusätzlich sendet das Modell Aufgaben an den falschen Agenten und vergisst dabei auch noch die ursprüngliche Bedingung der bedeutungserhaltenden Kompression. Ein weiteres wiederkehrendes Muster: Das Modell übernimmt Aufgaben selbst, statt sie wie angewiesen zu delegieren. Der Nutzer hat bereits verschiedene Quantisierungsstufen (bis Q6) und größere Kontextfenster (bis 256k mit F16 KV-Cache) getestet, ohne das Problem zu beheben. Der llama.cpp-Befehl zeigt zudem experimentelle Flags wie ngram-basiertes Speculative Decoding und MTP-Draft-Modus, die zusätzliche Komplexität in den Inferenzpfad einbringen.
- Hardware-Setup: Zwei AMD-GPUs werden via ROCm 6.1 betrieben, Tensor-Split 44/22/34 – GPU 0 und 1 als rocm-Devices, ein drittes Device via Vulkan eingebunden.
- Speculative Decoding aktiv: Der Nutzer nutzt gleichzeitig ngram-mod (n-match 24, n-min 28, n-max 64) und draft-mtp mit bis zu 5 Draft-Tokens – ein ungewöhnlich experimenteller Stack.
- KV-Cache-Quantisierung: Sowohl Key- als auch Value-Cache laufen auf q8_0; zuvor wurde F16 KV-Cache getestet, ohne Verbesserung beim Kontextproblem.
- Context-Checkpoints gesetzt: Der llama.cpp-Parameter --ctx-checkpoints 60 ist aktiv, löst aber das Instruktionsverlust-Problem laut Nutzer nicht.
- Sampling-Parameter: Temperatur 0.6, Top-P 0.95, Top-K 20, Presence Penalty 0.4 – klassische Qwen-3-Empfehlungswerte, Repeat-Penalty auf neutral 1.0 belassen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com1mo
Nutzer kritisieren Qwen3.8 27B: Übermäßiges Thinking frisst Kontext
- MEINUNGreddit.com1w
Qwen3.8 27B Q8 halluziniert kompletten Plan in 120k-Token-Agentenrun
- MEINUNGreddit.com0mo
Qwen 3.8 27B lokal: Community-Erfahrungen mit agentischem Coding enttäuschend
- MEINUNGreddit.com3w
Opencode: Fix für zu frühe Kontext-Kompaktierung per Config
Qwen 3.6 27B lokal: Kontext-Vergessen bei Agentenaufgaben mit Opencode
Der Reddit-Nutzer milpster betreibt Qwen 3.6 27B (Quantisierungsstufe Q8_K_XL) lokal auf einer AMD-GPU-Konfiguration via ROCm 6.1 und llama.cpp. Als Agentenframework setzt er Opencode zusammen mit dem „oh my openagent"-Harness ein, das bereits beim Start 45–55k Tokens Kontext verbraucht. Bei einem Gesamt-Kontextfenster von 105.000 Tokens verbleiben für längere Runs entsprechend wenig Reserve. Das Kernproblem: Das Modell vergisst über längere Sitzungen hinweg explizite Instruktionen – etwa die Direktive, Prompts verlustfrei zu komprimieren – und wandelt diese eigenständig in numerische Zielwerte (konkret: 40 % Kompression) um. Zusätzlich sendet das Modell Aufgaben an den falschen Agenten und vergisst dabei auch noch die ursprüngliche Bedingung der bedeutungserhaltenden Kompression. Ein weiteres wiederkehrendes Muster: Das Modell übernimmt Aufgaben selbst, statt sie wie angewiesen zu delegieren. Der Nutzer hat bereits verschiedene Quantisierungsstufen (bis Q6) und größere Kontextfenster (bis 256k mit F16 KV-Cache) getestet, ohne das Problem zu beheben. Der llama.cpp-Befehl zeigt zudem experimentelle Flags wie ngram-basiertes Speculative Decoding und MTP-Draft-Modus, die zusätzliche Komplexität in den Inferenzpfad einbringen.
- Hardware-Setup: Zwei AMD-GPUs werden via ROCm 6.1 betrieben, Tensor-Split 44/22/34 – GPU 0 und 1 als rocm-Devices, ein drittes Device via Vulkan eingebunden.
- Speculative Decoding aktiv: Der Nutzer nutzt gleichzeitig ngram-mod (n-match 24, n-min 28, n-max 64) und draft-mtp mit bis zu 5 Draft-Tokens – ein ungewöhnlich experimenteller Stack.
- KV-Cache-Quantisierung: Sowohl Key- als auch Value-Cache laufen auf q8_0; zuvor wurde F16 KV-Cache getestet, ohne Verbesserung beim Kontextproblem.
- Context-Checkpoints gesetzt: Der llama.cpp-Parameter --ctx-checkpoints 60 ist aktiv, löst aber das Instruktionsverlust-Problem laut Nutzer nicht.
- Sampling-Parameter: Temperatur 0.6, Top-P 0.95, Top-K 20, Presence Penalty 0.4 – klassische Qwen-3-Empfehlungswerte, Repeat-Penalty auf neutral 1.0 belassen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- MEINUNGreddit.com1mo
Nutzer kritisieren Qwen3.8 27B: Übermäßiges Thinking frisst Kontext
- MEINUNGreddit.com1w
Qwen3.8 27B Q8 halluziniert kompletten Plan in 120k-Token-Agentenrun
- MEINUNGreddit.com0mo
Qwen 3.8 27B lokal: Community-Erfahrungen mit agentischem Coding enttäuschend
- MEINUNGreddit.com3w
Opencode: Fix für zu frühe Kontext-Kompaktierung per Config