Llama — Juli 2026
80 Beiträge im Juli 2026.
- LAUNCH31. JuliDeepSeek v4 Flash GGUF mit DSpark MTP Head für DS4 DwarfStar EngineWer DeepSeek v4 Flash lokal betreibt, kann mit DS4 DwarfStar und diesem Quant die Decode-Geschwindigkeit gegenüber llama.cpp verdoppeln und erhält zusätzlich persistenten KV-Cache auf SSD sowie einen OpenAI-kompatiblen API-Endpunkt – relevant für agentic Workflows auf Consumer-Hardware.
- MEINUNG31. JuliCommunity wünscht sich neue 70-80B MoE-Modelle für lokale InferenzFür lokale AI-Builder mit begrenztem GPU-Budget (hier: AMD V620 + ROCm) bleibt die 70-80B-Klasse eine Performancelücke – doppelte Token-Rate gegenüber 120B-Modellen wäre für agentische Coding-Tasks entscheidend. ROCm-spezifische Probleme mit Multi-GPU-Splitting (-sm tensor) zeigen praktische Infrastruktur-Hürden auf.
- LAUNCH31. JuliCommunity-Release: Vier uncensored LLMs mit MTP-Support in GGUF und SafetensorsErstmals werden LongCat-Flash-Lite und Jamba2-Mini uncensored verfügbar, inklusive eines llama.cpp-Forks mit Unterstützung für bisher nicht integrierte Architekturen. Refusal-Raten wurden teils von 97–100/100 auf 4–11/100 gesenkt.
- LAUNCH31. JuliDeepSeek-V4-Flash-0731 GGUF-Quantisierung verfügbarGGUF-Verfügbarkeit ermöglicht lokales Ausführen von DeepSeek-V4-Flash-0731 ohne Cloud-Abhängigkeit – relevant für Entwickler, die das Modell auf Consumer-Hardware betreiben wollen.
- GERÜCHT31. JuliCommunity diskutiert mögliche DeepSeek V4 Distillationen für kleinere ModelleSollte DeepSeek V4 Distillate veröffentlichen, würden leistungsstarke Modelle für lokale Nutzung zugänglich – ähnlich wie die R1-Distillate. Aktuell ist dies reine Spekulation ohne bestätigte Pläne.
- LAUNCH31. JuliTritium: Open-Source Ternary-LLM-Engine in Rust/CUDA für Consumer-GPUsEntwickler können Modelle per SALT-Algorithmus in Ternary-Gewichte überführen und so VRAM drastisch reduzieren – BitNet 2B4T ist 7,5× kleiner als fp16. Der OpenAI-kompatible Server mit paged KV und Speculative Decoding macht Tritium direkt produktionsnah einsetzbar.
- LAUNCH30. JuliThinkingmachines veröffentlicht Inkling-Small: 276B MoE-Modell mit 1M-KontextDas Modell kombiniert einen sehr langen Kontextfenster (1M Token) mit geringem Aktivierungsaufwand (12B aktive Parameter), was lokales Deployment auf Consumer-Hardware potenziell erleichtert. GGUF-Versionen via Unsloth ermöglichen direkten Einsatz mit llama.cpp.
- MEINUNG30. JuliCommunity-Diskussion: Wann kommen bezahlbare Heimroboter mit lokalem LLM?Reine Community-Spekulation ohne technische Belege. Konkreter Mehrwert für AI-Builder ohne vertiefte Diskussion im Auszug nicht beurteilbar.
- MEINUNG30. JuliNanbeige4.2-3B im Praxistest: Hohe VRAM-Last trotz kleiner GewichteDurch doppeltes Layer-Traversal verhält sich das 3B-Modell wie ein 6B-Modell bei Kontext und Geschwindigkeit; 128k-Kontext kostet bereits 5,2 GB VRAM. Für lokale Coding-Workloads auf 16 GB VRAM kaum praktikabel — Qwen3.6-35B-A3B liefert laut Test trotz größerer Gewichte schnellere und korrektere Ergebnisse.
- MEINUNG30. JuliHugging Face: Wie ein Open-Source-Ökosystem KI-Entwicklung demokratisierteEntwickler können Modelle, Datensätze und Demos über den Hub entdecken und mit einheitlicher API nutzen, statt jedes Mal neue Codebasen zu erlernen. Bibliotheken wie PEFT/LoRA und Accelerate decken dabei auch fortgeschrittene Anwendungsfälle wie effizientes Fine-Tuning und verteiltes Training ab.
- MEINUNG30. JuliLlama.cpp: n_ctx_train-Limit blockiert 64k-Kontextanfragen bei GGUF-ModellenWer llama.cpp mit Agents und Context-Compaction einsetzt, muss auf GGUF-Modelle achten, die 64k+ nativ im n_ctx_train verankert haben – externe Kontextflags reichen nicht aus, da llama.cpp den Wert aus den Modellmetadaten zieht.
- LAUNCH30. JuliCORTEX MODEL OBSERVATORY: Open-Source-Tool für Mechanistic Interpretability lokaler LLMsErmöglicht lokalen LLM-Nutzern und Forschern, Modellverhalten auf Aktivierungsebene zu inspizieren, ohne eigene Infrastruktur aufbauen zu müssen. Unterstützt aktuell GPT-2- und Llama-Architekturen; weitere Modelle sollen folgen.
- LAUNCH30. Julillama.cpp erhält CUDA-Support für Ternary-Bonsai-8B-Q2_0-ModellTernäre Quantisierung (Q2_0) ermöglicht extrem kompakte Modelle; der CUDA-Support in llama.cpp macht Ternary-Bonsai-8B nun GPU-beschleunigt lokal ausführbar – relevant für Nutzer mit begrenztem VRAM.
- BENCHMARK30. JuliMindControl für Llama.cpp: Geführte Reasoning-Budgets im BenchmarkWer lokale Reasoning-Modelle betreibt, kann mit MindControl den Token-Verbrauch um bis zu 50 % senken, ohne Genauigkeit auf Standard-Tasks einzubüßen. Für sehr schwere Aufgaben bleibt ein Rückgang bestehen – Budget-Steuerung ersetzt hier kein größeres Denkbudget.
- MEINUNG30. JuliCommunity diskutiert beste lokale Modelle für NVIDIA GB10/DGX SparkFür lokale Inferenz auf GB10/DGX Spark gilt Qwen 3.6 27B laut Community weiterhin als zuverlässiger Allrounder. DeepSeek V4 Flash und Laguna S 2.1 sind mögliche Alternativen, aber noch mit Einschränkungen bei Geschwindigkeit bzw. Qualität.
- MEINUNG30. JuliNutzer trainiert eigenes Micro-LLaMA-Modell auf Kinderstory-DatensatzDas Problem illustriert eine typische Falle beim Fine-Tuning: Diskrepanzen zwischen selbst implementiertem Inference-Code und Chat-Templates in Standard-Tools wie Unsloth. Besonders der korrekte Umgang mit Instruction-Masking und Jinja-Templates ist entscheidend für reproduzierbare Ergebnisse in Drittanwendungen.
- LAUNCH29. Julillama.cpp lädt MTP-Tensoren jetzt standardmäßig – auch ohne Speculative DecodingNutzer von Modellen wie GLM-5.2, Qwen3.5-MoE oder HY-V3 zahlen VRAM-Overhead, ohne MTP zu nutzen. Workaround: Explizit prüfen, ob Community-GGUFs MTP-Blöcke bündeln, und ggf. llama.cpp-Version oder Build-Flags anpassen.
- MEINUNG29. JulivLLM mit NVFP4 auf 4×RTX 5060 Ti: 70–80 t/s TG und 2000+ t/s PPDer OOM-Bug in vLLM bei NVFP4-Quants (GitHub Issue #46268) lässt sich mit zwei Umgebungsvariablen (MAX_JOBS=4, NVCC_THREADS=4) umgehen. Die veröffentlichte systemd-Konfiguration mit gpu-memory-utilization 0.60 und MTP-5 liefert auf Consumer-Hardware ~70–80 t/s Token-Generation bei stabilen Tool-Calls.
- FORSCHUNG29. JuliAbliteration verändert Modell-Haltung: Uncensored LLMs zeigen Optimismus-DriftWer uncensored Modelle einsetzt und davon ausgeht, dass nur Refusals entfernt werden, muss mit unbeabsichtigter Disposition-Drift rechnen. Das Verhalten ist modellarchitektur-abhängig und nicht vorhersehbar – relevant für jeden produktiven Einsatz abliterierter Modelle.
- LAUNCH29. JuliGBNF Grammar Compiler zwingt 8B-Modelle zu validen Tool-CallsDurch die Kombination aus Schema-zu-GBNF-Kompilierung und einem semantischen Router, der pro Turn nur 3 von 50 Tools freigibt, werden typische Fehler kleiner Modelle (Code-Fences, erfundene Toolnamen, fehlende Klammern) zuverlässig verhindert – direkt übertragbar auf eigene llama.cpp-Agenten-Projekte.
- LAUNCH28. JuliKimi-K3 läuft lokal: 0.23 tok/s auf RTX 6000 PRO Dual-GPUKimi-K3 lässt sich auf High-End-Consumer-Hardware lokal betreiben, allerdings mit sehr niedriger Geschwindigkeit (0,23 tok/s). Der benötigte Speicher und NVMe-RAID (~29 GB/s) zeigen, wie anspruchsvoll der Betrieb großer MoE-Modelle lokal noch ist.
- MEINUNG28. JuliLaguna S 2.1 GGUF Q4_K_M wächst von 68 GB auf 96 GB durch FP16-Layer-MixWer Laguna S 2.1 lokal betreibt, braucht deutlich mehr VRAM/RAM. Der Schritt deutet auf Qualitätsprobleme bei reiner 4-Bit-Quantisierung hin; alternative GGUF-Quellen (z. B. Unsloth) zeigen laut Community noch Loop-Bugs bei höherem Kontext.
- LAUNCH28. Julillama.cpp: CUDA-SSD-Matmul und Metal-FWHT-Kernel beschleunigen InferenzWer Mamba-2-Modelle lokal betreibt, profitiert bei längeren Kontexten (ab 256 Tokens) von bis zu 22% mehr Durchsatz. Apple-Silicon-Nutzer erhalten mit dem FWHT-Kernel bis zu 3,5% schnellere Inferenz für quantisierte Modelle ohne Konfigurationsaufwand.
- LAUNCH28. JuliDSpark Speculative Decoding landet in llama.cpp via Pull RequestNutzer von llama.cpp können DSpark-kompatible Modelle (z.B. DeepSeek-V4-Pro-DSpark) einsetzen, um durch spekulatives Dekodieren höhere pp/tg-Durchsatzraten zu erzielen. Der PR ist frisch gemergt – konkrete Speedup-Zahlen aus der Community stehen noch aus.
- LAUNCH28. Julillama.cpp: Chat-Template für DeepSeek-V4 manuell aktualisierenWer DeepSeek-V4 lokal als Coding-Agent betreibt, muss das Chat-Template manuell überschreiben – ohne Fix verhält sich das Modell in Agentenaufgaben deutlich schlechter.
- MEINUNG28. JuliThinkingCap-Qwen3.6-27B: Höherer Durchsatz bei gleichbleibender QualitätWer Qwen3-27B-Modelle lokal mit llama.cpp betreibt, kann durch den Wechsel auf ThinkingCap-Qwen3.6-27B mit reduziertem Token-Verbrauch und ~10–15 % höherem Durchsatz rechnen – ohne Qualitätseinbußen laut Praxisbericht.
- BENCHMARK27. Juli35B Agentic-Bakeoff: KAT-Coder-V2.5-Dev und Qwen3.5-35B teilen Pass-Rate-SpitzeKAT-Coder-V2.5-Dev liefert gleiche Pass-Rate wie das beste Stock-Modell bei deutlich geringerem Token-Verbrauch – relevant für lokale Agentic-Setups mit begrenztem Kontextbudget. Ornith (25/30) verliert trotz stärkerer Wissensbasis an Format-Fehlern und unkontrollierten File-Rewrites.
- LAUNCH27. JuliKimi K3 Text-only-Version für llama.cpp verfügbarWenn die Konvertierung funktioniert, können Nutzer Kimi K3 lokal über llama.cpp betreiben – ohne Cloud-API. Konkreter Mehrwert hängt von erfolgreicher Community-Validierung ab.
- LAUNCH27. JuliMeta AI jetzt in Threads-DMs verfügbar – globaler Rollout gestartetMeta AI ist nun auf allen großen Meta-Plattformen (Facebook, Instagram, WhatsApp, Threads) in DMs verfügbar – das stärkt den Lock-in-Effekt und erhöht den Wettbewerbsdruck auf ChatGPT und Google Gemini im Bereich der integrierten KI-Assistenten.
- MEINUNG27. JuliLing-3.0-flash: SGLang plant Day-0-Support, vLLM wartet auf Weights, llama.cpp unwahrscheinlichWer Ling-3.0-flash lokal betreiben will, sollte nicht auf GGUF hoffen: llama.cpp fehlt der Bailing-MoE-Konversionspfad und niemand schreibt aktiv daran. Dem bisherigen Muster folgend (Ling-2.6-flash: Weights ~6 Tage nach API-Launch) ist mit Open-Weights rund um den 3. August zu rechnen.
- LAUNCH27. Julillama.cpp erhält Support für Nanbeige4.2-3B-ModellWer llama.cpp lokal betreibt, kann nach Merge des PRs das Nanbeige4.2-3B-Modell direkt nutzen. Konkreter Mehrwert des Modells selbst ohne weiteren Quelltext nicht beurteilbar.
- BENCHMARK27. JuliQwen3.6-27B: Speculative Decoding profitiert stärker von schweren QuantsWer Qwen3.6-27B lokal betreibt, kann durch Kombination von schwerem Quant (Q6/Q8) und DFlash-Speculative-Decoding den höchsten Durchsatz erzielen. MTP ist solider zweiter Fallback; ngram und EAGLE3 lohnen sich kaum. Anomalie: llama.cpp MTP auf UD-Q4 ist pathologisch langsam.
- MEINUNG27. JuliNutzer sucht llama.cpp GUI für Windows mit Modell- und Prompt-VerwaltungZeigt eine anhaltende Lücke im lokalen LLM-Ökosystem: Tools wie LM Studio haben Performance-Probleme gegenüber nativem llama.cpp, während leichtgewichtige Alternativen wie llama-swap keine Prompt-Verwaltung bieten. Entwickler von Local-LLM-Frontends haben hier einen konkreten Bedarf.
- MEINUNG27. JuliCommunity-Diskussion: Kleinste nutzbare Coding-Modelle für 4 GB VRAMFür Entwickler mit limitierter GPU-Hardware zeigt die Diskussion, welche kleinen Modelle praxistauglich für Agentic-Coding sind – relevant für lokale Setups mit llama.cpp oder Alternativen.
- LAUNCH27. Julillmux: Open-Source-Tool verwaltet vLLM- und llama.cpp-Modellprofile zentralTeams, die häufig zwischen lokalen Modellen wechseln, sparen manuelle Konfigurationsarbeit und reduzieren Fehlerquellen. Voraussetzung sind Linux, NVIDIA-GPU und Docker – macOS und AMD/ROCm werden aktuell nicht unterstützt.
- LAUNCH27. Julillama.cpp zwingt zur Neugenerierung aller bestehenden GGUF-DateienAlle lokal gespeicherten GGUF-Modelle müssen neu erstellt oder neu heruntergeladen werden. Wer llama.cpp produktiv einsetzt oder eigene quantisierte Modelle hostet, muss nach dem Update seinen gesamten Modell-Bestand erneuern.
- MEINUNG26. JuliCommunity-Diskussion: SFT vs. RL vs. Continued Pre-Training bei Qwen3.6-27BMehrere aktuelle Paper (arXiv:2507.05386, 2510.18874, 2607.04364, 2605.20005) deuten darauf hin, dass RL-basiertes Fine-Tuning Fähigkeiten besser erhält als SFT, aber kein Allheilmittel ist. Für Practitioner, die Qwen3.6-27B domänenspezifisch anpassen wollen, fehlen noch direkte Vergleichsdaten mit Before/After-Benchmarks.
- LAUNCH26. JuliMinimax M3 mit MSA-Unterstützung in llama.cpp integriertNutzer von llama.cpp können das Minimax M3 Modell nun lokal ausführen. Die MSA-Architektur könnte effizientere Inferenz bei langen Kontexten ermöglichen.
- BENCHMARK26. Juli90 agentic Runs: ThinkingCap vs Fable Fusion vs Stock Qwen3.6-27B im VergleichFür Agentic-Workloads bleibt das Base-Modell nach diesem Test die zuverlässigste Wahl. ThinkingCap lohnt sich nur bei Latenz-Bottlenecks durch Thinking-Tokens; Fable Fusion birgt durch Faktenhalluzination echte Risiken in Produktionspipelines.
- LAUNCH26. JuliOpenSmith: Lokaler LLM-Pipeline-Tracer mit Dashboard ohne CloudEntwickler lokaler LLM-Pipelines (Ollama, llama.cpp) erhalten Observability ohne Datenweitergabe: Token-Budget-Alerts, OpenTelemetry-Export und Live-Updates via WebSocket sind direkt einsatzbereit.
- LAUNCH26. JuliPOCKET-35B: 35B-Agentenmodell läuft CPU-only mit 59 Tokens/s35B-Modelle mit 59 t/s auf der CPU ohne GPU-Anforderung senken die Einstiegshürde für lokale Agenten-Inferenz erheblich. Die Varianten für Android und iPhone (ab 5,1 GB) ermöglichen On-Device-AI ohne Cloud-Abhängigkeit.
- MEINUNG26. JuliGLM-5.2 Long-Context-Bug in ik_llama.cpp: NaN-Crash ab 32k TokenGLM-5.2 ist für 1M-Kontext trainiert, bleibt aber in der Praxis auf kurze Kontexte beschränkt. Bestehende Workarounds (FA off, KV-Cache auf CPU, reduzierter Batch) helfen nicht — GPU-seitige f16-Overflows im DSA/Indexer-Pfad sind der Verdacht. CPU-only als einziger stabiler Pfad wäre ein erheblicher Performance-Verlust.
- MEINUNG26. JuliCommunity-Diskussion: Konfigurationsmanagement für lokale LLMs mit llama.cppZeigt typische Herausforderungen beim lokalen LLM-Betrieb: Konfigurationsmanagement, Testmethodik und Parameteroptimierung ohne standardisierte Tooling-Lösung. Praxisnahe Community-Perspektive für Self-Hosted-LLM-Setups.
- BENCHMARK25. JuliMI50 Power-Throttling-Tests: 50W als optimaler Betriebspunkt für InferenzFür Inferenz-Deployments mit MI50-Hardware lässt sich durch Power-Capping auf 50W die Energieeffizienz massiv steigern (0,458 vs. 0,173 t/s/W) bei kaum spürbarem Gen-Speed-Verlust – relevant für Betriebskosten und Kühlung im Homelab- und Edge-Einsatz.
- LAUNCH25. JuliLlama.cpp erhält vollständige MCP-Unterstützung inklusive stdio-ServerLokale Modelle in llama.cpp können nun direkt mit MCP-Servern wie Serena interagieren, was agentenbasiertes Coding ohne externe Abhängigkeiten ermöglicht. Konfiguration ist per JSON-Datei oder Kommandozeile möglich.
- MEINUNG25. JuliLocalLLaMA-Community: Modell-Empfehlungen für lokales Qwen-Setup gesuchtZeigt praxisnahe Modell-Spezialisierung: verschiedene Qwen-Größen für Routing, Klassifikation, Coding und Qualität auf Consumer-Hardware. GPT-OSS enttäuschte bei Tool Use, Gemma 4 wurde von Qwen übertroffen — relevanter Erfahrungsbericht für lokale Agent-Setups.
- BENCHMARK25. JuliTriple-GPU-Setup mit 31 GB VRAM: Benchmark-Vergleich Qwen3 vs. Gemma4Zeigt, dass Consumer-Hardware mit gepooltem VRAM (31 GB) große MoE-Modelle (30–35 B Parameter) praktikabel betreiben kann. MoE-Architekturen sind dabei dichten Modellen gleicher Parameterzahl bei der Inferenzgeschwindigkeit deutlich überlegen.
- MEINUNG25. JuliLaguna S 2.1 (118B) auf Consumer-Hardware: RAM-Offloading mit 8+ TPS realistisch?Laguna S 2.1 soll laut Community Cloud-Modelle bei Reasoning und Coding übertreffen. Die Diskussion zeigt praxisnah, wo die Grenzen von Consumer-Hardware beim RAM-Offloading großer Modelle liegen – relevant für alle, die 100B+-Modelle lokal für autonome Aufgaben einsetzen wollen.
- MEINUNG25. JuliHeimnetz-LLM-Setup: 7800XT Desktop als headless Inferenz-Server für MacZeigt ein praxisnahes Heimnetz-Setup für lokale LLM-Inferenz mit AMD-GPU unter Windows HIP und Llama.cpp. Relevant für Builder, die GPU-Leistung vom Desktop auf mobile Geräte auslagern wollen, ohne Cloud-Abhängigkeit.
- MEINUNG25. JuliCommunity-Diskussion: Beste lokale Modelle für Video-AnalyseFür Entwickler lokaler Video-Pipelines relevant: Llama und Gemma unterstützen laut Nutzer keinen direkten Video-Upload; Qwen wird als lokale Alternative genannt. Konkrete Empfehlungen und Setups finden sich in den Kommentaren des Threads.
- LAUNCH25. JuliSlipstream streamt MoE-Expertengewichte von SSD für 36-GB-MacBookMac-Nutzer können damit LLMs weit jenseits des RAM-Limits lokal betreiben – Qwen3.6-35B erreicht ~19 tok/s bei 14 GiB Cache. Besonders relevant: Die Ablage der gestreamten Experten auf dem schnelleren Laufwerk brachte 2,7× Speedup – Speicherplatzierung schlägt Kernel-Optimierungen.
- BENCHMARK25. JuliTensorSharp vs. llama.cpp: Benchmark-Vergleich auf CUDA und VulkanFür lokale Inferenz bietet TensorSharp eine OpenAI/Ollama-kompatible Alternative zu llama.cpp mit CUDA-, Vulkan-, Metal- und MLX-Support sowie Features wie Paged KV Cache und Continuous Batching – relevant für Windows/macOS/Linux-Deployments ohne Python-Stack.
- MEINUNG25. JuliAsus GX10 nach Treiber-Bug und CMOS-Problemen unrettbar – RMA eingeleitetZeigt reale Stabilitätsrisiken beim Betrieb lokaler LLM-Setups (llama.cpp, vLLM, Dify, Mastra) auf Consumer-Mini-PCs: Treiber-Bugs unter Ubuntu können bei unbeaufsichtigten Updates zu Totalausfall führen. Snapshot- und Backup-Strategien für den OS-Datenträger sind essenziell.
- MEINUNG25. JuliCommunity-Diskussion: Optimale LLM-Nutzung auf 2× RTX 3090 mit 48 GB VRAMFür AI-Builder mit Consumer-GPU-Setups relevant: Die Diskussion beleuchtet praktische Abwägungen zwischen vLLM, Ollama und llama.cpp sowie GGUF/AWQ/GPTQ/FP8-Quantisierung für 48 GB VRAM – ein realistisches Hobbyist- und Home-Lab-Szenario.
- LAUNCH25. JuliDKV: Open-Source KV-Cache-Kompression für lokale LLM-InferenzGeringerer KV-Cache-Speicherbedarf ermöglicht längere Kontextfenster auf Consumer-Hardware. Das CLI-Interface erlaubt ersten Einsatz ohne eigene Integration; CUDA-Backend ist noch in Validierung.
- LAUNCH25. JuliInstructSAM als GGUF: Qwen3-VL-2B mit SAM3-Segmentierungskopf via llama.cppWer multimodale Datenpipelines mit Captioning und 2D-Segmentierung betreibt, kann mit instructSAM.cpp beide Schritte in einem quantisierten Modell via llama.cpp vereinen – weniger Overhead, schnellere Inferenz auf lokaler Hardware. Ein Dockerfile erleichtert Build und Konvertierung.
- LAUNCH24. JuliCachyLLama: llama.cpp-Fork mit persistentem SSD-KV-Cache für lange Agent-SessionsWer lokale Coding-Agents auf langsamerer Hardware betreibt, kann durch persistente KV-Checkpoints die Prompt-Reprocessing-Zeit massiv senken – auch nach Server-Restarts. Unterstützt Hybrid-Architekturen wie Qwen 3.5/3.6, Gemma 4 und GLM-4.7.
- BENCHMARK24. Julillama.cpp: E-Cores schneller als P-Cores bei MoE-Modell mit GPU+CPU-OffloadingBei speicherbandbreitengebundenen MoE-Inferenz-Setups mit CPU-Offloading kann das Pinning auf E-Cores statt P-Cores die Performance steigern – entgegen der verbreiteten Annahme, dass P-Cores immer vorzuziehen sind.
- FORSCHUNG24. JuliSLQ: Statistisch-verlustfreie LLM-Quantisierung mit 1,7–3,6× Inferenz-SpeedupSLQ ermöglicht aggressive Modellkompression ohne messbare Genauigkeitsverluste und liefert gleichzeitig echte Inferenzbeschleunigung – relevant für alle, die LLMs auf begrenzter Hardware produktiv einsetzen wollen. Die neue EAR-Metrik (≥0,99 = 99% Token-Übereinstimmung) bietet zudem ein interpretierbares Qualitätsmaß jenseits klassischer Benchmarks.
- LAUNCH24. JuliMeta AI erhält Produktivitäts-Update mit Kalender-Integration und Research-FunktionMeta AI konkurriert nun direkter mit Gemini, ChatGPT und Claude im Assistenten-Segment. Die Kalender- und Research-Funktionen könnten Meta AI als Alltagsassistenten für Milliarden Meta-Nutzer relevanter machen.
- MEINUNG24. JuliCommunity-Diskussion: AMD Kernel-Optimierungen in llama.cppFür lokale Inferenz auf AMD-Hardware ist die Kernel-Optimierung ein aktives Community-Thema. Wer llama.cpp auf AMD betreibt, könnte von Projekten wie kernel-anvil profitieren – konkreter Mehrwert ohne weiterführende Quellen jedoch schwer beurteilbar.
- LAUNCH24. JuliQwen3.5 35B A3B Float8 läuft mit 55 tok/s auf RTX 5060 TiConsumer-Hardware (RTX 5060 Ti) kann damit ein 35B-MoE-Modell mit praxistauglicher Geschwindigkeit betreiben. MTP-Support ist noch nicht aktiv und könnte die Inferenz weiter beschleunigen.
- BENCHMARK23. JuliGemma 4 26B lokal getestet: Gut für Backend, schwach bei UI/UXGemma 4 26B läuft auf Consumer-Hardware mit akzeptabler Geschwindigkeit, eignet sich aber laut Test nur für Backend-Coding. Entwickler sollten UI/UX-Aufgaben mit diesem Modell vorerst meiden.
- MEINUNG23. JuliLaguna-S-2.1: Thinking-Loops durch falsches Quantisierungsformat verursachtWer Laguna-S-2.1 lokal via llama.cpp betreibt, sollte auf MoE-bewusste Quantisierungsformate wie APEX-GGUF setzen (Q6_K für Shared Expert, Q4_K für Attention, ~54 GB) und Poolsides Default-Sampling nutzen, statt Symptome mit Prompt-Hacks zu kaschieren.
- LAUNCH23. JuliDeepSeek V4 Flash mit ~105 t/s auf zwei Nvidia 4090d 48G via vLLMDie Triton-Reimplementierung ermöglicht vLLM-Betrieb von DeepSeek V4 Flash auf Ada-Lovelace-Hardware (SM89) ohne Blackwell-Pflicht — 2–3× höherer Durchsatz gegenüber llama.cpp bei parallelen Agentic-Workflows und 262k Kontext.
- BENCHMARK23. JuliCPU-only LLM-Inference auf 100-Dollar-SBC: 6 Modelle von 0.6B bis 8B getestetFür Background-Tasks wie Klassifikation, Routing oder Summarization sind 0.6B-Modelle auf Sub-15W-x86-Hardware praktikabel – ein möglicher Ersatz für API-Calls. Das 8B-Limit liegt am Speicherbandbreitendurchsatz, nicht am RAM.
- FORSCHUNG23. JuliApple M5 INT8-Aktivierungen ungenutzt: Community zeigt 1,4× Prefill-SpeedupInference-Backends wie MLX und Llama.cpp lassen auf M5-Hardware erhebliche Performance ungenutzt. Sobald w4a8/w8a8 offiziell integriert wird, könnten lokale Modelle auf Apple Silicon deutlich schneller laufen – relevant für alle, die LLMs auf Mac deployen.
- FORSCHUNG23. JuliQwen3-0.6B via Knowledge Distillation von 36 % auf 100 % Genauigkeit gebrachtFew-Shot-Prompting verschlechterte das 0.6B-Modell aktiv (33 % Accuracy, Kontext-Leakage), während QLoRA-Distillation auf nur ~170 Dokumenten massiv half. Wichtige Warnung: Der Student kopiert Gewohnheiten des Teachers, nicht dessen Absicht – schlechte Teacher-Labels erzeugen schlechte Studenten.
- BENCHMARK23. JuliDFlash Speculative Decoding auf 2× RTX 5090: Tuning von 23 auf 64 tok/sSpeculative Decoding kann bei RAM-spillover-Setups stark kontraproduktiv wirken. Der entscheidende Hebel ist --spec-draft-p-min (Default 0.0), da zu große Verify-Batches bei fine-grained MoE teure CPU-Roundtrips erzwingen. Kategorie-spezifisches Benchmarking auf dem eigenen Workload ist Pflicht: Math/Translation +20%, RAG/Summarization bis −9%.
- MEINUNG23. Julillama.cpp erlaubt künftig KI-generierten Code im RepositoryOpen-Source-Projekte wie llama.cpp stehen vor der Frage, wie sie Codequalität sichern, wenn KI-generierter Code explizit erlaubt wird. Die Richtlinienänderung schafft Präzedenz für andere populäre Repos.
- MEINUNG23. JuliMulti-Node-Inferenz mit 3× RTX 4060 via USB-Ethernet für ~20 USDGroßes Sprachmodell-Inferenz über mehrere Consumer-GPUs ist ohne teure NVLink- oder InfiniBand-Hardware möglich. Wer llama.cpp mit GGML_RPC und GGML_CUDA_NCCL kompiliert, kann Multi-Node-Setups mit Standard-Ethernet betreiben – relevant für kostengünstige Heimserver-Setups.
- MEINUNG22. JuliBug in Laguna S 2.1 unterdrückt Reasoning-Phase beim DenkmodusWer Laguna S 2.1 lokal mit llama.cpp betreibt und Thinking Mode nutzen möchte, kann vorübergehend das Qwen3-27B-Chat-Template per --chat-template-file einbinden, bis Poolside das eigene Template korrigiert.
- LAUNCH22. JuliCactus Hybrid: Gemma 4 E2B erkennt eigene Fehler via Probe-LayerEntwickler können hybride On-Device/Cloud-Pipelines bauen, die nur bei niedrigem Confidence-Score an ein Frontier-Modell eskalieren – die Probe erreicht 0.814 AUROC vs. 0.549 für Token-Entropy und funktioniert ohne Audio-Training-Daten auch auf Audio-Benchmarks.
- LAUNCH22. JuliMindControl: llama.cpp-Fork steuert Reasoning per Token-InjectionWer lokale Reasoning-Modelle mit begrenztem Thinking-Budget betreibt, kann mit diesem Fork endlose „But, wait"-Schleifen unterbrechen, ohne das Modell neu zu trainieren. Ein vorgefertigtes Docker-Image für AMD64+CUDA senkt die Einstiegshürde.
- LAUNCH22. JuliUS Army erschöpft Jahres-KI-Token-Budget in wenigen WochenUnkontrollierte KI-Rollouts ohne klares Token-Budget-Management führen selbst bei Großkunden wie dem US-Militär zu abrupten Nutzungseinschränkungen. AI-Builder sollten bei Enterprise-Deployments von Anfang an Verbrauchsmonitoring und Governance-Regeln einplanen.
- LAUNCH22. Julillama.cpp erhält Support für poolside Laguna XS.2 und M.1 MoE-ModelleLaguna XS.2 läuft dank Sliding Window Attention mit per-head Gating in 30/40 Layern besonders schnell und mit kleinem KV-Cache lokal – sobald der PR gemergt ist, können llama.cpp-Nutzer beide Modelle direkt einsetzen.
- BENCHMARK22. JuliVRAM-Disk-Cache-Strategie erreicht 340 pp/s für Kimi K2.7 auf DGX SparkDamit lassen sich 1T-MoE-Modelle (204 GB) auf einem einzelnen DGX Spark mit 340 pp/s und 9,6 tg/s betreiben. Die Technik ist direkt auf llama.cpp übertragbar und ermöglicht praxistaugliche Inferenz großer MoE-Modelle ohne Multi-Node-Setup.
- BENCHMARK22. Juli550B Nemotron Ultra Q3_S auf alten P40- und MI50-GPUs via RPCZeigt, dass sich ein 550B-Modell mit alter Consumer- und Datacenter-Hardware (P40/MI50) über RPC sinnvoll betreiben lässt. Token-Generation sinkt bei 126k Context auf ~5,59 t/s — für Experimente mit großen MoE-Modellen ohne neue Hardware relevant.
- FORSCHUNG21. JuliPoLar: LLM-Schichten dynamisch überspringen oder wiederholen für bessere InferenzLokale Inference-Stacks könnten PoLar integrieren, um zur Laufzeit zwischen Geschwindigkeit und Genauigkeit zu wählen – ohne Retraining. Getestet auf Llama-3.2, Qwen1.5, Qwen2.5 und Qwen3 mit Verbesserungen auf mathematischen Reasoning-Benchmarks.
- LAUNCH21. Julipoolside veröffentlicht Laguna-S-2.1 als 120B Open-Weight-ModellEin 120B-Modell mit GGUF-Support erleichtert den lokalen Einsatz via llama.cpp erheblich. Für AI-Builder könnte Laguna-S-2.1 eine ernstzunehmende Open-Weight-Alternative zu anderen großen Modellen in dieser Gewichtsklasse sein.