Ollama — Juli 2026
34 Beiträge im Juli 2026.
- LAUNCH30. JuliGray Box: Lokales KI-Notiztool mit LLM-gestützter SelbstorganisationEntwickler erhalten eine dateibasierte Langzeitwissensbasis (Markdown + YAML) ohne Vendor-Lock-in, die mit jedem lokalen Modell via Ollama oder Cloud-APIs funktioniert. Der Immutable-Inbox-Ansatz verhindert Datenverlust durch LLM-Fehler.
- LAUNCH27. JuliLokaler Agentic-DJ mit Ollama und Qwen3.5 9B betreibt vollständige RadiostationZeigt, dass ein 9B-Modell mit Tool-Calling für agentic Workflows produktiv genug ist. Session-Memory erweist sich dabei als kritischer Faktor als Modellgröße – relevante Erkenntnis für alle, die lokale Agents mit kleinen Modellen bauen. MIT-lizenzierter Code verfügbar.
- LAUNCH26. JuliOpenSmith: Lokaler LLM-Pipeline-Tracer mit Dashboard ohne CloudEntwickler lokaler LLM-Pipelines (Ollama, llama.cpp) erhalten Observability ohne Datenweitergabe: Token-Budget-Alerts, OpenTelemetry-Export und Live-Updates via WebSocket sind direkt einsatzbereit.
- BENCHMARK25. JuliVollständiger Agent-Workspace auf 4GB-Laptop-GPU: Praxisbericht mit Qwen3.5qwen3.5:2b-q4_K_M erweist sich als Sweet Spot für 4GB: 96 tok/s, passt ins VRAM mit 1,3 GB Reserve. RAG erzwingt Model-Swaps (Embedder vs. Chat-Modell), kleine Modelle versagen bei Artifact-Generierung und Tool-Routing – praktische Grenzen für lokale Agent-Setups.
- BENCHMARK25. JuliTensorSharp vs. llama.cpp: Benchmark-Vergleich auf CUDA und VulkanFür lokale Inferenz bietet TensorSharp eine OpenAI/Ollama-kompatible Alternative zu llama.cpp mit CUDA-, Vulkan-, Metal- und MLX-Support sowie Features wie Paged KV Cache und Continuous Batching – relevant für Windows/macOS/Linux-Deployments ohne Python-Stack.
- MEINUNG25. JuliOllama Qwen3.6 35B stoppt zufällig Token-Ausgabe auf RTX 4070Das Problem betrifft typische Local-LLM-Setups mit großen Modellen und 65k-Kontext auf Consumer-GPUs. Betroffen sind Entwickler, die Ollama als Backend für Coding-Assistenten nutzen – ein reproduzierbarer Fix ist bislang nicht bekannt.
- MEINUNG25. JuliCommunity-Diskussion: Optimale LLM-Nutzung auf 2× RTX 3090 mit 48 GB VRAMFür AI-Builder mit Consumer-GPU-Setups relevant: Die Diskussion beleuchtet praktische Abwägungen zwischen vLLM, Ollama und llama.cpp sowie GGUF/AWQ/GPTQ/FP8-Quantisierung für 48 GB VRAM – ein realistisches Hobbyist- und Home-Lab-Szenario.
- BENCHMARK23. JuliCPU-only LLM-Inference auf 100-Dollar-SBC: 6 Modelle von 0.6B bis 8B getestetFür Background-Tasks wie Klassifikation, Routing oder Summarization sind 0.6B-Modelle auf Sub-15W-x86-Hardware praktikabel – ein möglicher Ersatz für API-Calls. Das 8B-Limit liegt am Speicherbandbreitendurchsatz, nicht am RAM.
- LAUNCH22. JuliCactus Hybrid: Gemma 4 E2B erkennt eigene Fehler via Probe-LayerEntwickler können hybride On-Device/Cloud-Pipelines bauen, die nur bei niedrigem Confidence-Score an ein Frontier-Modell eskalieren – die Probe erreicht 0.814 AUROC vs. 0.549 für Token-Entropy und funktioniert ohne Audio-Training-Daten auch auf Audio-Benchmarks.
- LAUNCH20. JuliGhost: macOS-App bringt 60+ Tools und lokales RAG für Ollama und LM StudioLokale Modelle erhalten dieselbe Werkzeuginfrastruktur wie Cloud-Modelle – inklusive Dateioperationen, Dokumentenerstellung, Kalender und Screen-OCR – ohne dass Daten das Gerät verlassen. Die automatische Probing-Logik löst das häufige Problem inkompatibler Tool-Calling-Formate bei verschiedenen Modellen.
- LAUNCH19. Juli0,57-MB-Router senkt LLM-API-Kosten um bis zu 96 % in ~5 msFür Entwickler, die LLM-APIs kosteneffizient nutzen wollen: Das Tool kombiniert Routing, PII-Filter und Jailbreak-Detection in einem winzigen Modell ohne GPU-Anforderung. Verfügbar als npm-SDK (vollständig on-device), VS Code/Cursor-Extension und Hosted API mit kostenlosem Tier.
- LAUNCH18. Julipromptchain: Python-Library und MCP-Server für lokales LLM-Swapping auf einer GPUWer mehrere lokale Modelle auf einer Consumer-GPU betreibt, spart sich eigenes Swap-Scripting: Die Policy-Engine übernimmt Laden/Entladen automatisch. Der MCP-Server ermöglicht Agenten wie Claude Code, Modelle im laufenden Turn selbst zu wechseln.
- BENCHMARK18. JuliCustom Q8-Quant für AMD R9700 bringt 5,8 % Decode-SpeedupWer AMD R9700s (gfx1201) lokal betreibt, kann mit dem ROCmFPX-Fork und dem custom Quant messbare Inferenz-Gewinne erzielen – allerdings nur nach manuellem Build; Standard-Tools wie llama.cpp, Ollama oder vLLM sind inkompatibel.
- LAUNCH17. JuliObserver: Open-Source Screen-Monitoring-App nach einem Jahr komplett überarbeitetDas Tool läuft vollständig lokal (transformers.js im Browser, llama.cpp oder Ollama) ohne Screen-Daten-Upload. Der neue konversationelle Agent-Builder senkt die Einstiegshürde erheblich – nützlich für alle, die lokale LLMs in Monitoring-Workflows einsetzen wollen.
- LAUNCH16. JuliObsidian-Plugin ermöglicht lokales KI-Chat mit dem eigenen VaultFür Entwickler, die private Notizen nicht an Cloud-Dienste senden wollen, bietet das Plugin eine vollständig lokale RAG-Lösung mit Fine-Tuning auf eigene Vault-Inhalte. Aktuell nur macOS, aber quelloffen und forkbar.
- LAUNCH15. JuliAudient: Open-Source Audio-Wahrnehmungsschicht für LLM-Agenten mit wachsendem KonzeptspeicherAgenten und Roboter können damit auf Umgebungsgeräusche reagieren (Rauchmelder, Glasbruch, Maschinenausfälle), ohne rohe Audiodaten ans LLM zu schicken. Das Framework ist lokal lauffähig und erweiterbar, allerdings bisher nur informell evaluiert.
- MEINUNG11. JuliDual-GPU-Setup mit zwei RTX 3060 verhindert MoE-Modell-LoadingMulti-GPU-Setups mit Consumer-Hardware können bei MoE-Architekturen zu unerwarteten Ladefehlern führen. Wer lokale Inferenz mit mehreren GPUs plant, sollte GPU-Layer-Verteilung und VRAM-Splitting-Konfiguration in llama.cpp oder Ollama prüfen.
- LAUNCH11. JuliEverFern: Open-Source Desktop-Agent als lokale Alternative zu Claude CoworkEntwickler erhalten eine kostenlose, auditierbare Alternative zu kostenpflichtigen Agenten-Diensten. Die dynamische Tool-Synthese zur Laufzeit ist interessant, gilt aber auf 8B-Modellen noch als experimentell und erfordert menschliche Freigabe vor Ausführung.
- LAUNCH10. JuliMetallama: Open-Source Web-UI zur Verwaltung von llama.cpp-InstanzenWer lokal mehrere llama.cpp-Instanzen betreibt, kann damit Modelle, Server-Konfigurationen und Ressourcen zentral über den Browser steuern – ohne Terminal-Jonglage. Die Ollama-Proxy-Kompatibilität erlaubt die Einbindung in bestehende Toolchains.
- FUNDING09. JuliGradium sammelt 100 Mio. USD Seed-Runde ein – Nvidia beteiligtGradium entwickelt Audio-Modelle mit ultra-niedriger Latenz für Voice-AI-Anwendungen und hat bereits Kunden wie Renault gewonnen. Die Nvidia-Beteiligung und Bay-Area-Expansion signalisieren den direkten Wettbewerb mit ElevenLabs und Google Gemini Voice.
- FUNDING09. JuliOllama sammelt 65 Mio. Dollar Series B ein und erreicht 8,9 Mio. NutzerOllama ist in 85 % der Fortune-500-Unternehmen im Einsatz und wächst mit nur 14 Mitarbeitern stark – ein Signal, dass Open-Weight-Modelle im Enterprise-Alltag ankommen. Der Cloud-Dienst ermöglicht auch größere Modelle, die lokal nicht laufen, via Subskription ab kostenlos bis 100 $/Monat.
- MEINUNG07. JuliCommunity-Diskussion: Open-Source-Modelle hinter OpenAI-kompatibler API hostenWer Community-Finetuned-Modelle (Roleplay, Coding, spezielle GGUFs) in Apps einsetzen will, muss weiterhin selbst hosten – via Modal, RunPod, Baseten oder Replicate. Dienste wie OpenRouter oder Together decken nur populäre Modelle ab.
- LAUNCH07. JuliRowboat: Open-Source Local-First-Alternative zu Claude DesktopEntwickler können eigene „Work Surfaces" als Web-Apps mit eigenem UI und Hintergrund-Agent bauen, die auf Rowboats Knowledge Graph, Tools und Integrationen zugreifen. Das ACP-Client-Feature erlaubt die Orchestrierung mehrerer Claude-Code- oder Codex-Instanzen aus einer Oberfläche heraus.
- LAUNCH07. JuliPromptChain: Tool kettet lokales Prompter-Modell mit großem Coder-Modell und verwaltet VRAM automatischFür Entwickler mit 8–16 GB VRAM ermöglicht das Tool sequenzielle Nutzung zweier Modelle ohne manuelles Swapping. Der Hybrid-Ansatz – lokaler Prompter, Cloud-Modell als Coder – reduziert kostenpflichtige API-Aufrufe, da der Prompt vor dem teuren Schritt optimiert wird.
- LAUNCH05. JuliAthanor Lite: Kostenlose Desktop-App für einfaches Ausführen lokaler LLMsDie App erkennt automatisch kompatible Modelle anhand der Hardware, verwaltet Ollama-Installs und zeigt Echtzeit-Metriken (tok/s, VRAM, GPU-Auslastung). Nützlich für Entwickler und nicht-technische Nutzer, die lokale Modelle ohne CLI-Aufwand betreiben wollen.
- MEINUNG05. JuliNutzer sucht starken lokalen Coding-Assistenten via Ollama und OpenCodeZeigt praxisrelevante Grenzen lokaler Coding-Agenten: Selbst auf leistungsstarker Hardware (M3 Ultra, ~65 GB Modellgröße) liefern lokale Modelle im Agentic-Modus unzuverlässige Ergebnisse. Wer ähnliche Setups plant, sollte Tool-Use-Stärke der Modelle gezielt evaluieren.
- MEINUNG04. JuliQwen 3 8B lokal auf MacBook Air: Schritt-für-Schritt-Anleitung mit OllamaEntwickler können LLMs mit wenigen Terminalkommandos vollständig lokal betreiben – relevant für datenschutzsensible Workloads. Ollama abstrahiert Compiler-Komplexität und nutzt Apples Metal-GPU-Beschleunigung; 8B-Modelle laufen komfortabel auf 24-GB-Macs, kleinere Varianten auch auf 8-GB-Geräten.
- MEINUNG03. JuliClaude Desktop mit lokaler LLM-API verbinden – Community-FrageWer Claude Desktops UI-Features (MCP, Code-Preview) mit lokalen Modellen wie ollama oder vllm kombinieren will, sucht nach einer API-Endpoint-Konfiguration – eine konkrete Lösung wird im Post nicht gegeben, die Community-Antworten könnten aber praxisrelevante Workarounds liefern.
- MEINUNG02. JuliCommunity-Guide: Lokale LLMs mit Tools verbinden für EinsteigerDer Thread sammelt praxisnahe Community-Empfehlungen für lokale LLM-Stacks ohne Coding-Aufwand – nützlich für alle, die mit LM Studio-API, Ollama oder ähnlichen Backends eigene Workflows ohne Python-Kenntnisse aufbauen wollen.
- MEINUNG02. JuliAnalyse von 2.300 lokalen AI-Apps für Mac: Verzeichnis nach KategorienDas Verzeichnis gibt AI-Buildern einen strukturierten Überblick über den Local-AI-App-Markt auf macOS – nützlich zur Wettbewerbsanalyse und zur Entdeckung von Nischenbereichen wie Garderobe oder Tiergesundheit, die mit On-Device-Modellen bereits abgedeckt werden.
- LAUNCH02. Julijarvis-code: Terminal-Agent übersteht 10.000 Turns mit 2.000-Token-SpeicherDer Ansatz hält den gespeicherten Zustand konstant bei ~2.000 Token – unabhängig von der Sessionlänge – und vermeidet so exponentiell steigende Token-Kosten pro Turn. Entwickler, die lange Coding-Sessions ohne /clear oder /compact benötigen, können das Tool mit Claude, ChatGPT oder lokalen Modellen via llama.cpp/Ollama nutzen.
- LAUNCH01. JuliEWE: Windows-Tool pinnt lokale KI-Modelle per VirtualLock dauerhaft im RAMWer mehrere lokale Modelle parallel betreibt, verliert durch Nachladezeiten erheblich Zeit. EWE eliminiert diesen Overhead auf Windows, indem Seiten nicht mehr auf Disk ausgelagert werden – besonders relevant für Multi-Modell-Workflows und ComfyUI-Pipelines.
- LAUNCH01. JuliAWS Strands und AgentCore: AI-Agenten in der Cloud deployenStrands übernimmt die Agent-Logik (LLM, Tools, Gesprächskontext, Agent-Loop), während AgentCore die Infrastrukturseite löst (Hosting, Memory, Gateway, Observability) – beides zusammen reduziert Boilerplate erheblich für Teams, die Agenten auf AWS produktiv betreiben wollen.
- LAUNCH01. JuliLokalBot: macOS-App für Meetings, Autocomplete und Tagesprotokoll – komplett lokalEntwickler auf Apple Silicon können Meeting-Transkription (Parakeet ~190× Realtime), LLM-Autocomplete und semantische Suche in einer App vereinen, ohne Inference-Kosten oder Datenweitergabe. Als Drop-in-Ersatz für Tools wie Granola oder Cotypist mit eigenem GGUF/Ollama-Endpoint nutzbar.