Cline — Juli 2026
7 Beiträge im Juli 2026.
- LAUNCH25. JuliSlipstream streamt MoE-Expertengewichte von SSD für 36-GB-MacBookMac-Nutzer können damit LLMs weit jenseits des RAM-Limits lokal betreiben – Qwen3.6-35B erreicht ~19 tok/s bei 14 GiB Cache. Besonders relevant: Die Ablage der gestreamten Experten auf dem schnelleren Laufwerk brachte 2,7× Speedup – Speicherplatzierung schlägt Kernel-Optimierungen.
- MEINUNG25. JuliCommunity-Diskussion: Optimale LLM-Nutzung auf 2× RTX 3090 mit 48 GB VRAMFür AI-Builder mit Consumer-GPU-Setups relevant: Die Diskussion beleuchtet praktische Abwägungen zwischen vLLM, Ollama und llama.cpp sowie GGUF/AWQ/GPTQ/FP8-Quantisierung für 48 GB VRAM – ein realistisches Hobbyist- und Home-Lab-Szenario.
- LAUNCH21. JuliKimi K3 führt Open-Weight-Arena, Qwen 3.8 Max wird open-weightedZwei 2T+-Parameter-Modelle stehen kurz vor Open-Weight-Releases – relevant für Teams, die Frontier-Fähigkeiten selbst hosten wollen. Parallel verdichten sich US-Überlegungen zu Beschränkungen chinesischer Open-Models, was die Verfügbarkeit mittelfristig gefährden könnte.
- LAUNCH18. Julicache-hunter: Tool zur Erkennung von Cache-Invalidierungen in LLM-HarnessesUnnötige Prefill-Kosten durch Cache-Invalidierung sind ein häufiges, aber unsichtbares Problem in LLM-Harnesses. cache-hunter macht diese Schwachstellen ohne Code-Änderungen sichtbar – getestet u.a. mit OpenCode, Claude Code und Cline, die laut Autor alle Schwächen zeigten.
- FORSCHUNG11. JuliPrismaQuant: Neue Quantisierungsmethode für Blackwell-GPUs mit vLLMPrismaQuant ermöglicht layer-selektive Quantisierung für Blackwell-GPUs, was Qwen3.6-27B auf Consumer-Hardware mit 32 GB VRAM lauffähig macht. GGUF-Support fehlt noch; Nutzer mit GGUF-Workflow oder Non-Blackwell-GPUs können die Methode derzeit nicht verwenden.
- FORSCHUNG08. JuliHalluSquatting: LLM-Halluzinationen ermöglichen massenhafte Botnet-AngriffeCoding-Agenten und -Assistenten können ohne Zutun der Nutzer massenweise kompromittiert werden, indem Angreifer vorhergesagt-halluzinierte Paket- oder Repository-Pfade mit Reverse-Shells besetzen. Betroffen sind alle sechs getesteten Basis-LLMs (GPT-5.1/5.2, Gemini-2.5, Sonnet-4.5, Opus-4.5) — ein strukturelles, trainingsinhärentes Problem ohne einfache Abhilfe.
- MEINUNG06. JuliQwen 3.6 27B lokal: Nutzer scheitert an zuverlässigem Coding-EinsatzZeigt praktische Grenzen von quantisierten Mid-Size-Modellen beim lokalen Coding-Einsatz: Selbst mit hochwertiger Hardware und strukturierten Prompts bleibt die Verlässlichkeit hinter gehosteten Diensten wie Claude Code zurück.