Ollama — August 2026
24 Beiträge im August 2026.
- LAUNCH29. Aug.ShimQuant ermöglicht Nemotron-3.5-Lightning mit 11,77 GiB auf 16-GB-KarteWer Nemotron-3.5-Lightning auf einer 16-GB-GPU betreiben will, hatte bisher keine nutzbare Option unter ~18 GiB. ShimQuant schließt diese Lücke, erfordert aber einen gepatchten llama.cpp-Build – LM Studio und Ollama werden nicht unterstützt.
- LAUNCH28. Aug.ISTA-DASLab veröffentlicht SOTA-GGUFs für Qwen3.8-27B mit GSQ+RCOGSQ+RCO-Quants ermöglichen Qwen3.8-27B auf Consumer-Hardware mit unter 10 GB VRAM bei teils überlegener Benchmark-Qualität gegenüber BF16. Die Modelle laufen ohne Modifikationen in llama.cpp, Ollama und LM Studio.
- LAUNCH24. Aug.Neue Reddit-Community r/LowEndLocalAI für LLMs auf schwacher HardwareDie Community bündelt praxisnahe Infos zu Quantisierung, Modellauswahl, CPU-only-Inferenz und Tools wie llama.cpp oder Ollama für Hardware-limitierte Setups – nützlich für alle, die lokale KI ohne High-End-GPU betreiben wollen.
- LAUNCH23. Aug.Apogee: Lokaler Firefox- und Chrome-Ersatz für Mozillas eingestellten Orbit-SummarizerApogee ermöglicht vollständig lokale Webseitenzusammenfassungen (Artikel, YouTube, Reddit, Wikipedia) ohne Cloud-Abhängigkeit – direkt über eine bestehende Ollama-Instanz oder WebGPU im Browser. Interessant für Entwickler, die datenschutzkonformes KI-Browsing lokal deployen wollen.
- LAUNCH23. Aug.Ollama LFM2.5-2.6B auf Linux-iGPU ausführenZeigt, dass LFM2.5-2.6B auch ohne dedizierte GPU auf iGPU-Hardware läuft – relevant für Entwickler, die lokal LLMs auf Low-End-Hardware oder eingebetteten Systemen einsetzen wollen. Konkreter Mehrwert ohne Volltext nur begrenzt beurteilbar.
- BENCHMARK23. Aug.Community-Finetuning von Gemma 4 12B erzielt 2,7× besseres Tool CallingWer mit 16 GB VRAM auf Gemma 4 12B angewiesen ist, bekommt damit ein deutlich agentic-tauglicheres Modell ohne Hardware-Upgrade. Die Q4_K_M-Quantisierung macht es direkt mit llama.cpp und Ollama einsetzbar.
- MEINUNG22. Aug.Warum lokale LLMs schlechter wirken als sie sind: Inferenz-Fallstricke erklärtWer lokale Modelle betreibt, sollte Sampler-Settings aus den Modellkarten übernehmen, KV-Cache-Präzision und Attention-Backend bewusst wählen und KLD-Werte nur im Kontext der vollständigen Laufzeitumgebung interpretieren. Niedrige KLD-Angaben auf Quant-Modellkarten ohne Methodenangabe sind nicht aussagekräftig.
- FORSCHUNG22. Aug.Community-Fix für Ornith1.5 35B A3B: MTP-Head-Patch bringt 33% ZeitersparnisDer Fix zeigt, dass untrainierte MTP-Heads in veröffentlichten Quants erhebliche Wall-Clock-Ineffizienz verursachen können — ein Swap lohnt sich auch bei minimalem t/s-Gewinn. Das Modell und die Testergebnisse sind öffentlich auf Ollama und GitHub verfügbar.
- LAUNCH21. Aug.FIM-Autocomplete: VS-Code-Fork bietet Tab-Completion ohne Abo und TelemetrieEntwickler, die lokale Modelle (Ollama, llama.cpp, LM Studio, vLLM) nutzen, erhalten eine schlanke Tab-Completion ohne Abo-Zwang, Agenten-Overhead oder Telemetrie – inklusive Cross-File-Kontext via Tree-sitter und LSP.
- LAUNCH20. Aug.Vomit: Go-Tool übersetzt Claude-Token-Output via lokalem LLMEntwickler, die Claude-Agenten einsetzen, können damit rohe Token-Ausgaben lesbar machen, ohne Daten an externe Dienste zu senden. Der Hook-Mechanismus erlaubt eine nicht-invasive Integration direkt in den Claude-Workflow.
- LAUNCH16. Aug.Local Coding Agent: Hybrid-Setup für kleine Modelle auf Consumer-GPUsEntwickler mit Consumer-GPUs können kleine Modelle (2B–8B) für echte tägliche Coding-Tasks nutzen: Context-Bloat wird durch isolierte Mikro-Aufgaben vermieden, Schema-Fehler durch eine deterministische Fehlerkorrektur-Engine abgefangen. Cloud-Tokens werden nur für High-Level-Planung verbraucht.
- GERÜCHT14. Aug.Qwen 3.8 27B soll mit Claude Opus 4.6 mithalten könnenFalls die Leaderboard-Daten belastbar sind, könnten kompakte 27B-Modelle viele alltägliche Aufgaben lokal übernehmen – mit direkten Auswirkungen auf AI-Abo-Modelle und den Bedarf an Cloud-Inferenz.
- LAUNCH14. Aug.Cursor für 60 Mrd. USD von SpaceXai übernommenCursors Übernahme für 60 Mrd. USD zeigt die extreme Bewertungsdynamik bei KI-Coding-Tools. Gleichzeitig verdichten sich Hinweise, dass Performance-Gewinne zunehmend aus verbesserten Agent-Harnesses und Post-Training stammen – nicht aus größeren Basismodellen.
- FORSCHUNG12. Aug.Multimodale Workflows mit Gemma 4 und Ollama lokal aufbauenEntwickler können datenschutzsensible Bildanalyse-Pipelines vollständig lokal betreiben – ohne Cloud-API. Die Kombination aus Ollama, Pydantic-Schemas und strukturiertem Output ermöglicht typsichere Downstream-Verarbeitung direkt in Python.
- FORSCHUNG11. Aug.Apple Silicon VMs: 11–16× schnellere LLM-Inferenz mit Metal-Capability-ShimWer LLMs in macOS-VMs (Virtualization.framework) betreibt, kann mit dem Open-Source-Shim ohne Kernel-Änderungen nahezu Bare-Metal-Geschwindigkeit erreichen – relevant für Cloud- und Fleet-Setups auf Apple Silicon. Die Ergebnisse gelten bisher für M1 Ultra; andere Chips und macOS-Versionen müssen separat validiert werden.
- LAUNCH10. Aug.Ante 0.2: 15 MB Coding-Agent betreibt llama.cpp vollständig offlineEntwickler können Coding-Agenten vollständig offline gegen beliebige GGUF-Modelle betreiben; der Agent verwaltet llama.cpp-Builds hardware-spezifisch (Metal/CUDA/Vulkan) und schätzt RAM/VRAM-Bedarf vor dem Laden. Wechsel zwischen lokalen und Frontier-Modellen ist mid-session möglich.
- LAUNCH10. Aug.Meta veröffentlicht Muse Glimmer: 30B Open-Weight-Modell für lokale Agent-WorkflowsDurch 4-Bit-Quantisierung läuft das Modell unter 20 GB und passt damit in 24/32-GB-Consumer-Hardware. Integrierter Speculative-Decoding-Drafter und Failure-Recovery-Training machen es direkt nutzbar für produktive Agentic Loops ohne Cloud-Anbindung.
- MEINUNG10. Aug.Rust-basierte ML-Lehrsprache sucht Community-Feedback zu Real-World-ProblemenDas Projekt kombiniert eine eigene ML-Lehrsprache mit ICL/ICRL-Ansätzen, um lokale Coding-Agenten zu verbessern. Interessant für Entwickler, die alternative ML-Toolchains abseits von Python/Colab erkunden oder lokale Modelle mit eigenen Workflows trainieren wollen.
- MEINUNG09. Aug.Structured Output mit lokalen LLMs: Anleitung mit Gemma 4, Ollama und PydanticEntwickler können sensitive Daten lokal vorverarbeiten und strukturiert an Cloud-LLMs weitergeben, ohne Rohdaten preiszugeben. Die Kombination aus Ollama-format-Parameter und Pydantic-Validierung macht das in wenigen Zeilen Code umsetzbar.
- LAUNCH08. Aug.Lokaler Realtime-Voice-Stack: Parakeet STT → Qwen 2.5 7B → Qwen3-TTS für OllamaZeigt eine funktionsfähige End-to-End-Voice-Pipeline komplett lokal und ohne Cloud-Abhängigkeit auf Basis von Ollama – relevant für Entwickler, die datenschutzkonforme Sprachassistenten bauen wollen. Konkreter Mehrwert der Implementierung ohne Volltext schwer beurteilbar.
- LAUNCH05. Aug.GraphARC: Open-Source-Tool plant Agenten-Graphen mit deterministischem Admission-GateDas Admission-Gate verhindert verbotene Aktionen bereits vor der Ausführung – ein 8B-Modell wurde in drei Runden von einer Policy-verletzenden Aktion zu einer erlaubten Alternative gelenkt. Kosten werden vor Ausführung berechnet, jeder Schritt in einer append-only JSONL-Datei protokolliert.
- MEINUNG03. Aug.CLI-Agent mit Python und Ollama lokal aufbauen – Schritt-für-SchrittEntwickler können damit einen funktionsfähigen lokalen AI-Agenten auf Basis von Qwen2.5 und Ollama aufsetzen, der direkt im Terminal Shell-Befehle ausführt – ohne API-Kosten oder Datenweitergabe an die Cloud.
- BENCHMARK03. Aug.Benchmark: Classic Vector RAG vs. Google OKF vs. Kombination auf lokalem SetupOKF verbessert strukturierte Abfragen, versagt aber bei Long-tail-Fragen über unstrukturierte Dokumente. Ein kritischer Befund: Veraltete Chunks schlagen aktuelle durch reine Chunk-Häufigkeit – ohne Datum im Chunk hilft auch Reranking nicht.
- LAUNCH02. Aug.llama.cpp launcht llama.app: native Mac-App und vereinfachte InstallationMit DMG-Install, Menübar-Integration und argumentlosem `llama serve` senkt llama.cpp die Einstiegshürde deutlich — Entwickler können lokale Inferenz auf neuen Maschinen oder für Einsteiger jetzt ohne Homebrew oder manuelle Konfiguration aufsetzen.