
Lokaler KI-Coding-Agent mit Gemma 4 und OpenCode selbst aufsetzen
Der Artikel von Shuai Guo beschreibt detailliert, wie man mit drei Open-Source-Komponenten einen vollständig lokal laufenden Coding-Agenten aufbaut. Ollama übernimmt dabei die Rolle des Model-Servers und exponiert einen lokalen API-Endpunkt, über den andere Tools wie OpenCode mit dem Modell kommunizieren können. Als LLM kommt Gemma 4 zum Einsatz, das Google am 2. April 2026 veröffentlichte und das speziell für Reasoning, Coding, multimodale Aufgaben und agentische Workflows ausgelegt ist. Der Autor setzt das E4B-Variant (4-Bit-quantisiert, GGUF-Format, 9,6 GB) auf einem Laptop mit Intel i7-13800H, 32 GB RAM und einer NVIDIA RTX 2000 Ada Laptop GPU (8 GB VRAM) ein. Um das volle 128K-Kontextfenster zu aktivieren, erstellt er ein Ollama Modelfile mit dem Parameter `num_ctx 131072` und leitet daraus einen neuen Ollama-Tag ab – ohne das Modell erneut herunterzuladen. OpenCode fungiert als agent-seitiges Interface ähnlich wie Claude Code oder Codex, ist jedoch Open-Source und provider-agnostisch, sodass es sowohl an lokale Ollama-Modelle als auch an Cloud-Anbieter angebunden werden kann. Die Anleitung deckt Windows (via winget und PowerShell) sowie Linux ab und endet mit der Verknüpfung von OpenCode und dem lokal laufenden Gemma-4-Modell über eine JSON-Konfigurationsdatei.
- Gemma 4 E4B belegt auf dem Testlaptop 9,6 GB Speicher; alternativ steht das kleinere E2B-Variant (gemma4:e2b) für leistungsschwächere Maschinen zur Verfügung.
- Das Ollama Modelfile mit 'PARAMETER num_ctx 131072' aktiviert explizit das volle 128K-Kontextfenster von Gemma 4 E4B, da Ollama dieses nicht automatisch ausschöpft.
- OpenCode wird als globales npm-Paket (npm install -g opencode-ai) installiert und per CLI-Befehl 'opencode' als Terminal-UI (TUI) direkt aus dem Projektverzeichnis gestartet.
- Für Windows setzt OpenCode eine vorherige Node.js-Installation voraus (winget install OpenJS.NodeJS.LTS), bevor das npm-Paket verfügbar ist.
- Der erste Modell-Aufruf via Ollama ist laut Autor bewusst langsam, da das Modell zunächst in den Speicher geladen wird; Folge-Prompts reagieren dann deutlich schneller.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com15h
Coding Agent im Browser: Pi + MiniCPM5-2B via WebGPU
- LAUNCHreddit.com1d
Marmel 0.9.0: Autonomer Coding-Agent mit Unterstützung lokaler Modelle
- LAUNCHreddit.com0mo
Local Coding Agent: Hybrid-Setup für kleine Modelle auf Consumer-GPUs
- MEINUNGreddit.com3w
Community-Diskussion: Beste lokale AI-Harness für Coding und Agenten

Lokaler KI-Coding-Agent mit Gemma 4 und OpenCode selbst aufsetzen
Der Artikel von Shuai Guo beschreibt detailliert, wie man mit drei Open-Source-Komponenten einen vollständig lokal laufenden Coding-Agenten aufbaut. Ollama übernimmt dabei die Rolle des Model-Servers und exponiert einen lokalen API-Endpunkt, über den andere Tools wie OpenCode mit dem Modell kommunizieren können. Als LLM kommt Gemma 4 zum Einsatz, das Google am 2. April 2026 veröffentlichte und das speziell für Reasoning, Coding, multimodale Aufgaben und agentische Workflows ausgelegt ist. Der Autor setzt das E4B-Variant (4-Bit-quantisiert, GGUF-Format, 9,6 GB) auf einem Laptop mit Intel i7-13800H, 32 GB RAM und einer NVIDIA RTX 2000 Ada Laptop GPU (8 GB VRAM) ein. Um das volle 128K-Kontextfenster zu aktivieren, erstellt er ein Ollama Modelfile mit dem Parameter `num_ctx 131072` und leitet daraus einen neuen Ollama-Tag ab – ohne das Modell erneut herunterzuladen. OpenCode fungiert als agent-seitiges Interface ähnlich wie Claude Code oder Codex, ist jedoch Open-Source und provider-agnostisch, sodass es sowohl an lokale Ollama-Modelle als auch an Cloud-Anbieter angebunden werden kann. Die Anleitung deckt Windows (via winget und PowerShell) sowie Linux ab und endet mit der Verknüpfung von OpenCode und dem lokal laufenden Gemma-4-Modell über eine JSON-Konfigurationsdatei.
- Gemma 4 E4B belegt auf dem Testlaptop 9,6 GB Speicher; alternativ steht das kleinere E2B-Variant (gemma4:e2b) für leistungsschwächere Maschinen zur Verfügung.
- Das Ollama Modelfile mit 'PARAMETER num_ctx 131072' aktiviert explizit das volle 128K-Kontextfenster von Gemma 4 E4B, da Ollama dieses nicht automatisch ausschöpft.
- OpenCode wird als globales npm-Paket (npm install -g opencode-ai) installiert und per CLI-Befehl 'opencode' als Terminal-UI (TUI) direkt aus dem Projektverzeichnis gestartet.
- Für Windows setzt OpenCode eine vorherige Node.js-Installation voraus (winget install OpenJS.NodeJS.LTS), bevor das npm-Paket verfügbar ist.
- Der erste Modell-Aufruf via Ollama ist laut Autor bewusst langsam, da das Modell zunächst in den Speicher geladen wird; Folge-Prompts reagieren dann deutlich schneller.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- LAUNCHreddit.com15h
Coding Agent im Browser: Pi + MiniCPM5-2B via WebGPU
- LAUNCHreddit.com1d
Marmel 0.9.0: Autonomer Coding-Agent mit Unterstützung lokaler Modelle
- LAUNCHreddit.com0mo
Local Coding Agent: Hybrid-Setup für kleine Modelle auf Consumer-GPUs
- MEINUNGreddit.com3w
Community-Diskussion: Beste lokale AI-Harness für Coding und Agenten