Model Context Protocol — Juli 2026
61 Beiträge im Juli 2026.
- LAUNCH31. JuliSimon Willison: Stateless MCP 2.0 vereinfacht Protokoll – zwei neue Tools veröffentlichtStateless MCP reduziert Implementierungsaufwand auf Client- und Serverseite erheblich und ermöglicht zustandslose, skalierbare Deployments. Kleinere Modelle können MCP-Tools zuverlässig ansteuern – das senkt die Einstiegshürde für eigene MCP-Server deutlich.
- LAUNCH31. JuliSimon Willison baut Slack-Emoji-Editor mit FableZeigt, wie AI-Builder kleine Spezialwerkzeuge schnell per KI-gestütztem Coding-Tool (Fable) nach konkreten Anforderungen generieren können – ohne aufwändige manuelle Implementierung.
- LAUNCH31. JuliDropbox verbindet MCP und Dash für KI-gestütztes Security Code ReviewTeams können damit prüfen, ob Implementierungen dem ursprünglichen Security-Design entsprechen – ein praktisches Muster für Unternehmen, die MCP als Brücke zwischen Dokumentationssystemen und Code-Review-Workflows nutzen wollen.
- LAUNCH31. JuliLing 3.0 Flash generiert per Blender MCP komplette 3D-Stadt mit LuftvideoLing-3.0-Flash demonstriert starkes räumliches Denken und Long-Horizon-Tool-Use direkt aus einem Prompt – relevant für Entwickler, die LLMs in 3D- oder Kreativ-Pipelines einsetzen wollen. Der kostenlose Zugang via OpenRouter senkt die Einstiegshürde sofort.
- LAUNCH31. Julidatasette-agent 0.4a0 ermöglicht JavaScript-Ausführung im BrowserDatasette-Agent-Plugins können künftig browserbasierte Tools anbieten, die JavaScript clientseitig ausführen – das erweitert die Interaktionsmöglichkeiten von LLM-gestützten Datenbank-Agenten erheblich.
- LAUNCH31. JuliVercel MCP unterstützt MCP-Spezifikation 2026-07-28Bestehende 2025-Clients laufen unverändert weiter, neue Clients nutzen die aktualisierte Spec automatisch – beide Versionen über denselben Endpoint via MCP SDK v2. Kein Setup-Aufwand für Teams, die Vercel MCP bereits einsetzen.
- MEINUNG30. JuliCoding-Agent-Workflows: Aufgabenverwaltung mit parallelen AgentenWer mehrere Coding-Agents parallel betreibt, braucht klare Worktree-Trennung und automatisierte Task-Sync via MCP/API – manuelle Statusupdates sind laut Autor ein vermeidbarer Produktivitätsverlust.
- LAUNCH30. JuliNeues MCP-Spec macht Protokoll zustandslos für Enterprise-SkalierungFür AI-Builder bedeutet der Wechsel zu einem stateless Request/Response-Modell, dass MCP-Server nun ohne sitzungsgebundene Abhängigkeiten betrieben werden können – ein kritischer Schritt für skalierbare, produktionsreife Agentic-Deployments in Unternehmensumgebungen.
- LAUNCH30. JuliVercel veröffentlicht mcp-handler 2.0 mit aktuellem MCP-Spec-SupportEntwickler von MCP-Servern auf Next.js, Nuxt oder Svelte müssen auf Node.js 20+ und zod4 migrieren sowie `@modelcontextprotocol/sdk` durch `@modelcontextprotocol/server` ersetzen. Clients, die noch auf HTTP+SSE basieren, erhalten künftig HTTP 410 und müssen vor dem Upgrade auf Streamable HTTP umgestellt werden.
- MEINUNG29. JuliMCP in Produktion absichern: Defense-in-Depth jenseits des GatewaysTeams, die MCP-basierte Agenten in Produktion betreiben, erhalten einen konkreten Architekturrahmen mit vier Kontrollschichten. Reine Gateway-Absicherung reicht laut Autor nicht aus – Enforcement muss tiefer im Stack ansetzen.
- MEINUNG29. JuliMCP-Server in Claude und ChatGPT einbinden – Schritt-für-SchrittWer eigene Tools per MCP in Claude oder ChatGPT integrieren will, findet hier eine praktische Anleitung für die Web-UIs, da die Einrichtung nicht intuitiv dokumentiert ist.
- FUNDING29. JuliCyera übernimmt Oasis Security für 1 Mrd. $ zur Absicherung von AI AgentsCyera integriert Oasis-Technologie in eine einheitliche Identity- und Data-Security-Plattform – relevant für AI-Builder, die Agents in Unternehmensumgebungen mit Zugriff auf andere Software betreiben und absichern müssen.
- FUNDING28. JuliBot-Detection-Startup Spur Intelligence erhält 200 Mio. Dollar von Insight PartnersLaut Cloudflare übersteigt Bot-Traffic Mitte 2026 erstmals den menschlichen Traffic im Internet – Bot-Erkennung wird damit zur kritischen Infrastruktur für alle AI-Builder, die ihre Systeme gegen agentenbasierten Missbrauch absichern müssen.
- MEINUNG28. JuliRunlayer klagt gegen Rippling wegen angeblichem Klau des MCP-Gateway-ProduktsAI-Infrastruktur-Startups riskieren beim Enterprise-Sales, dass prospektive Kunden mit großen Ingenieursteams die geteilten Produktdetails intern nachbauen. Der Fall zeigt: NDAs und Trial-Agreements schützen nur bedingt – besonders wenn der Vertragspartner selbst ein Techunternehmen ist.
- MEINUNG28. JuliMCP erklärt: Wie AI-Agents sich mit der realen Welt verbindenEntwickler, die Agenten mit mehreren Tools betreiben, können mit MCP den Integrationsaufwand drastisch reduzieren. Das offizielle Python-SDK (FastMCP) ermöglicht einen schnellen Einstieg; Tools, Resources und Prompts sind klar typisierte Fähigkeiten des Servers.
- LAUNCH28. JuliAWS startet GuardDuty Investigation Agent zur automatisierten BedrohungsanalyseSecurity-Teams können Bedrohungs-Triage automatisieren und den Agenten über den AWS MCP Server direkt in agentic Workflows einbinden. Das Preview-Kontingent ist auf 10 Untersuchungen pro Account pro Tag limitiert.
- LAUNCH28. JuliCursor startet Indien-Abo für ₹649/Monat vor SpaceX-ÜbernahmeCoding-Tool-Anbieter müssen lokalisierte Preismodelle für Wachstumsmärkte wie Indien einkalkulieren. Cursor zeigt, dass eigenentwickelte Modelle mit niedrigeren Betriebskosten solche Niedrigpreispläne tragfähig machen können – ein Muster, das auf andere Märkte ausgeweitet werden könnte.
- MEINUNG26. JuliBrowser-Agent mit OpenAI Agents SDK und Playwright MCP bauenEntwickler können damit Agenten bauen, die reale Web-UIs bedienen – ohne Screenshot-basiertes Computer-Use. Playwright MCPs Accessibility-Snapshots liefern stabile Element-IDs für zuverlässigere Aktionen in Admin-Konsolen, CRMs und Dashboards.
- LAUNCH25. JuliLlama.cpp erhält vollständige MCP-Unterstützung inklusive stdio-ServerLokale Modelle in llama.cpp können nun direkt mit MCP-Servern wie Serena interagieren, was agentenbasiertes Coding ohne externe Abhängigkeiten ermöglicht. Konfiguration ist per JSON-Datei oder Kommandozeile möglich.
- MEINUNG25. JuliCommunity-Debatte: Lokaler MCP-Server als Alternative zu SaaS-Abo und API-KeysZeigt reale Nutzerreibung bei MCP-Adoption: Lokale Server bieten Datenkontrolle und Kostenersparnis, doch die Setup-Hürde könnte breite Casual-Nutzung verhindern. Relevant für Tool-Entwickler, die MCP als Zugangsstrategie erwägen.
- MEINUNG24. JuliAutonome Datenprodukte als Architektur-Grundlage für GenAIFür AI-Builder relevant: Das Container-Konzept für Datenprodukte adressiert Skalierbarkeit und Governance-Probleme in GenAI-Pipelines. MCP-basierte Tool Discovery reduziert unkontrolliertes Kontextwachstum in Agenten-Systemen.
- LAUNCH23. JuliOneCLI: Open-Source-Credential-Gateway hält Secrets aus AI-Agents herausAI-Agents speichern Credentials oft im Klartext in Memory oder Dateien und sind anfällig für Prompt Injection. OneCLI erzwingt Zugriffspolicies auf Netzwerkebene (unabhängig von MCP, CLI oder Code) und unterstützt Human-in-the-Loop für sensible Aktionen – relevant für alle, die Agents mit echten API-Keys betreiben.
- LAUNCH23. JuliPalmier Pro: Open-Source-macOS-Videoeditor mit KI und lokalem MCP-ServerEntwickler können ihren Agenten-Workflow über MCP direkt mit dem Videoeditor verbinden und so Massenprozesse wie die Replikation eines Podcast-Schnittstils auf beliebige Footage automatisieren – ohne manuelle Import-Export-Schleifen zwischen KI-Plattform und Editor.
- FORSCHUNG23. JuliMulti-Agent-AI für Security Operations: A2A- und MCP-Architektur im 5G-CoreSecurity-Teams können mit dieser Architektur ihr Regelwerk schneller an eine sich wandelnde Bedrohungslage anpassen, ohne proportional mehr Analysten einzusetzen – besonders relevant für 5G-Core-Umgebungen mit hohem Event-Volumen.
- LAUNCH23. JuliPoolside AI stellt Laguna S 2.1 vor: 118B MoE schlägt ~1T-Modell von Thinking MachinesPoolside zeigt, dass ein kleines Team mit konsequenter Infrastruktur (streaming Data-Pipelines, reproduzierbare Experimente, acht-Wochen-Release-Zyklen) frontier-nahe Modelle bauen kann. Für AI-Builder relevant: RL soll laut Kant künftig früher ins Pre-Training verlagert werden, und MCP/Tool-Calls hält er für grundlegend falsch konzipiert.
- LAUNCH23. JuliVercel MCP Server kann Code jetzt direkt deployenAI-Builder können damit den gesamten Entwicklungs- und Deploy-Zyklus ohne Kontextwechsel im Chat abschließen. Das Tool `deploy_to_vercel` übernimmt Framework-Erkennung, Dependency-Installation und Build automatisch.
- LAUNCH22. Juliarchex: Deterministisches Code-Kontext-Tool für Coding Agents, 26 Sprachen, Apache 2.0Bei einem 19-Aufgaben-Benchmark erreicht archex 0,95 Required-File-Recall gegenüber 0,32 (cocoindex-code) und 0,70 (Graphify) bei gleichzeitig drastisch geringeren Completion-Penalty-Tokens (922 vs. 11.188). Das macht es zu einem ernsthaften Drop-in für agentenbasierte Coding-Pipelines ohne externe Abhängigkeiten.
- BENCHMARK22. JuliUpstage Solar Open 2 erscheint: MoE-Modell auf Augenhöhe mit DeepSeek V4 FlashSolar Open 2 bietet bei nur 15B aktiven Parametern MMLU-Pro 86.2, SWE-Bench Verified 70.4 und AIME2026 95.7 — lokal lauffähige MoE-Architektur auf Top-Tier-Niveau, relevant für kostengünstige Inferenz-Deployments.
- LAUNCH21. JuliVercel Connect erhält 90+ vorkonfigurierte KonnektorenEntwickler können MCP- und API-Integrationen deutlich schneller aufsetzen, da Authentifizierung und Discovery-URLs vorkonfiguriert sind. Token-Handling bleibt über das bestehende Connect-Modell einheitlich – kein separates App-Registrierungsverfahren beim Drittanbieter nötig.
- LAUNCH21. JuliVercel MCP unterstützt jetzt direkte Käufe im AI-AssistentenAI-Builder können Vercel-Produkte künftig ohne Umweg über das Dashboard buchen. Die Integration erfordert eine Teamrolle mit Billing-Zugriff und setzt eine Bestätigung vor der Transaktion voraus – nützlich für agentenbasierte Infrastruktur-Workflows.
- LAUNCH20. JuliModel Context Protocol MCP wird benutzerfreundlicherMCP-Verbesserungen senken den Integrationsaufwand für Entwickler, die KI-Modelle mit Kalendern, Datenbanken oder internen Tools verbinden – weniger Custom-Plumbing, mehr standardisierte Anbindung.
- MEINUNG19. JuliAndroid Studio: 10-Minuten-Timeout blockiert lokale LLM-AgentenWer lokale LLMs (Gemma, Qwen etc.) als Coding-Agenten in Android Studio nutzt, stößt bei komplexen Aufgaben hart gegen ein internes Timeout-Limit. Eine konfigurierbare Lösung – etwa über MCP.json – ist bisher nicht dokumentiert, was den Einsatz für länger laufende Agenten-Tasks blockiert.
- LAUNCH18. Julipromptchain: Python-Library und MCP-Server für lokales LLM-Swapping auf einer GPUWer mehrere lokale Modelle auf einer Consumer-GPU betreibt, spart sich eigenes Swap-Scripting: Die Policy-Engine übernimmt Laden/Entladen automatisch. Der MCP-Server ermöglicht Agenten wie Claude Code, Modelle im laufenden Turn selbst zu wechseln.
- LAUNCH18. JuliOpenHire: MCP-Server für lokale Jobsuche ohne Lebenslauf-UploadEntwickler können KI-Agenten datenschutzkonform für Jobsuche nutzen, ohne Lebensläufe an externe Server zu senden. Der ghost_score entlarvt veraltete Stellenanzeigen direkt an der Quelle und spart Bewerbungsaufwand auf tote Stellen.
- MEINUNG15. JuliContext Engineering: HumanLayer-CEO Dex Horthy über zuverlässige LLM-AnwendungenCoding-Modelle optimieren auf SWE-Bench-ähnliche Benchmarks und verschlechtern dabei langfristig die Codebase-Architektur – unreviewed AI-Code führt nachweislich binnen Monaten zu unkontrollierbaren Systemen. Context-Compaction via Markdown-Dokumente und das Einhalten von Kontext-Heuristiken (300–400K Token für 1M-Fenster) sind konkrete Techniken, die Builder heute einsetzen können.
- FORSCHUNG15. JuliPrompt-Injection über Web-Browsing: Forscher exfiltriert Claude-MemorydatenClaude.ai speichert hochsensible Nutzerprofile in einem Memory-System – ein Angreifer kann durch manipulierte Webseiten mit Hyperlink-Keyboards Daten zeichenweise über GET-Requests exfiltrieren. AI-Builder, die Agenten mit Web-Browsing und persistentem Speicher kombinieren, müssen strenge Exfiltrations-Guards einbauen.
- LAUNCH14. JuliLokalBot v0.2.0: Agent Mode, MCP-Server und systemweite Diktierfunktion vollständig on-deviceEntwickler erhalten eine vollständig offline-fähige, GPLv3-lizenzierte Mac-App, die lokale LLMs (GGUF) mit MCP-Integration, Coding-Agent und Meeting-Suche kombiniert – ohne dass Sprach- oder Meeting-Daten das Gerät verlassen. Als MCP-Server lässt sie sich direkt in Claude Desktop oder eigene Agent-Setups einbinden.
- LAUNCH14. JuliGoogle und Partner stellen Agentic Resource Discovery Spezifikation vorARD ermöglicht KI-Agenten, Tools und APIs dynamisch zur Laufzeit zu entdecken, statt sie statisch zu konfigurieren. Für AI-Builder bedeutet das potenziell weniger Integrationsaufwand und bessere Interoperabilität zwischen Agenten-Ökosystemen.
- LAUNCH14. JuliSurfSense: Open-Source-Alternative zu NotebookLM mit Live-Daten und MCP-SupportEntwickler können SurfSense als natives Tool in Claude, Cursor oder eigene Agent-Frameworks einbinden und Recherche-Workflows vollständig automatisieren – ohne Vendor-Lock-in und ohne Datenlimits.
- LAUNCH13. JuliDoorDash baut KI-Shoppingassistent mit 24 % höherer Checkout-ConversionDie Kombination aus persistentem Memory, Live-Backend-Daten und spezialisierten Agenten statt reinem LLM-Einsatz liefert messbar bessere Conversion – ein konkretes Architekturmodell für produktive AI-Shopping-Systeme.
- MEINUNG13. JuliReddit-Debatte: Ist MCP als Service-Architektur überhaupt sinnvoll?Wer eigene AI-Agenten mit MCP baut, sollte den Overhead durch Token-basierte Zugriffskontrolle pro Client einkalkulieren. Die Community-Diskussion zeigt: Für einfache lokale Setups kann eine direkte Library-Integration pragmatischer sein als ein dedizierter MCP-Server.
- LAUNCH12. JuliZer0Fit: MCP-Server für Google TabFM & TimesFM als lokale Zero-Shot-ML-LösungEntwickler können Googles tabellare und Zeitreihen-Foundation-Models ohne eigenes Training oder Hyperparameter-Tuning über eine Chat-Oberfläche (Open WebUI, Claude Code, Codex) nutzen – vorausgesetzt, eine Nvidia-GPU mit 16 GB VRAM ist vorhanden. Zero-Shot-Ergebnisse (94,7 % auf Iris, R² 0,87 auf California Housing) zeigen praktische Einsatzfähigkeit für klassische ML-Aufgaben.
- LAUNCH11. JuliMesh LLM: Verteiltes KI-Computing über iroh-NetzwerkTeams können große Modelle (bis 235B MoE) ohne neue Hardware betreiben, indem sie bestehende GPUs im Büro oder Homelab poolen. Die OpenAI-kompatible API erfordert keine Codeänderungen – ein direkter Ersatz für Cloud-Inference mit voller Datenkontrolle und ohne laufende API-Kosten.
- LAUNCH10. Julibarebrowse: Browser-Tool für lokale LLM-Agents ohne PlaywrightWer lokale Modelle mit kleinen Kontextfenstern als Web-Agents betreibt, profitiert direkt: Weniger Tokens pro Seite bedeutet mehr Seiten pro Kontext. Die Cookie-Wiederverwendung aus echten Browser-Profilen spart zudem Aufwand für Login-Scripting.
- MEINUNG09. JuliLokale Embeddings und Reranker als sinnvollere Alternative zu lokalen LLMsEmbedding- und Reranker-Modelle sind über kommerzielle API-Dienste meist kostenpflichtig und nicht kostenlos verfügbar – lokaler Betrieb via llama.cpp mit pgvector-Stack schafft dort echten Mehrwert, z.B. für persistente LLM-Memory-Systeme via MCP.
- LAUNCH08. JuliGoogle DeepMind erweitert Gemini API Managed Agents um MCP und HintergrundausführungEntwickler können Gemini-Agenten nun asynchron betreiben und direkt an MCP-Server anbinden, was komplexere, langlebige Workflows ohne Zustandsverlust ermöglicht und die Integration in bestehende Tool-Ökosysteme vereinfacht.
- MEINUNG07. JuliCLI vs. MCP: Debatte über optimale Tool-Integration für AI-AgentenDie Wahl zwischen CLI- und API-basierter Tool-Integration beeinflusst direkt die Zuverlässigkeit und Fehleranfälligkeit von Agenten-Systemen. Entwickler, die Agenten auf externe Dienste loslassen, sollten die Designentscheidung bewusst treffen.
- LAUNCH07. JuliKoder: Open-Source Coding-Agent mit Browser-UI für lokale Linux-NutzungEntwickler erhalten einen vollständigen lokalen Coding-Agenten als einzelne Go-Binary ohne Cloud-Zwang. Die OpenAI-API-Kompatibilität erlaubt freie Modellwahl; getesteter Sweet-Spot ist Qwen 3.6 27B Q8 unter llama.cpp.
- MEINUNG06. JuliGLM 5.2: Open-Weights-Modell als Drop-in-Ersatz für Frontier-LabsGLM 5.2 ist über OpenAI- und Anthropic-kompatible Endpunkte direkt in Claude Code oder Codex nutzbar — Wechsel erfordert nur neue Base-URL. Für nicht-interaktive Agentic-Workloads ist es laut Autor praktisch nicht von Opus zu unterscheiden, was Inferenz-Margen der Frontier-Labs strukturell unter Druck setzt.
- MEINUNG06. JuliEnd-to-End-Tests mit Claude Code und Playwright MCP automatisierenDa Coding-Agents wie Claude Code das Implementieren von Code stark beschleunigen, verlagert sich der Engpass auf das Testen. E2E-Tests per Agent ermöglichen One-Shot-Implementierungen ohne manuellen Testaufwand – ein konkreter Produktivitätsgewinn für AI-Builder.
- LAUNCH06. JuliModel Context Protocol erhält stabiles Enterprise-Auth-ExtensionEntwickler in Enterprise-Umgebungen können MCP-Server-Zugriff künftig per Single-Sign-On verwalten, statt jeden Server separat freizuschalten. Das vereinfacht den Rollout von MCP-basierten Agenten in sicherheitskritischen Unternehmensumgebungen erheblich.
- LAUNCH06. JuliWatch Skill: Lokale Video-Indexing-Pipeline für LLMs mit MCP-SupportEntwickler lokaler AI-Stacks können Videos einmalig offline indexieren und via MCP, CLI oder REST API mit beliebigen lokalen Modellen abfragen – ohne Cloud-Abhängigkeit und ohne wiederholte multimodale Inferenz auf Rohdaten.
- LAUNCH04. Julibasemind: Lokaler Repo-Index für Coding-Agents via MCP, Rust, MITQueries liefern Signaturen und Zeilennummern statt ganzer Dateien, was Token-Kosten bei engem Kontextbudget deutlich senkt. Funktioniert als MCP-Server, CLI oder Claude-Code-Plugin über einen lokalen Index.
- MEINUNG03. JuliClaude Desktop mit lokaler LLM-API verbinden – Community-FrageWer Claude Desktops UI-Features (MCP, Code-Preview) mit lokalen Modellen wie ollama oder vllm kombinieren will, sucht nach einer API-Endpoint-Konfiguration – eine konkrete Lösung wird im Post nicht gegeben, die Community-Antworten könnten aber praxisrelevante Workarounds liefern.
- LAUNCH03. JuliWikiMoth: Deterministisches Memory-Tool mit 1.00 Recall ohne LLM-AbrufFür AI-Builder, die zuverlässige und auditierbare Memory-Schichten brauchen, bietet WikiMoth eine reproduzierbare Alternative zu LLM- oder Vektor-basiertem RAG. Über MCP-Server lässt sich recall() direkt in Agenten-Pipelines einbinden – lokal, ohne GPU und ohne API-Abhängigkeit.
- LAUNCH03. JuliToolport: MCP-Server-Manager ohne Kontext-Overhead für 20+ AI-AgentsEntwickler können 15+ MCP-Server bereithalten, ohne Kontext-Token zu verschwenden, und dieselbe Konfiguration nahtlos in Claude, Cursor und 20 weiteren Agents nutzen – einmaliges Einrichten statt dauerhaftes Umkonfigurieren.
- LAUNCH03. JuliVercel MCP und CLI unterstützen jetzt eve Agent Runs InspektionCoding-Agents können ihre eigenen Runs direkt über CLI oder MCP debuggen – inklusive maschinenlesbarer JSON-Ausgabe und Markdown-Traces. Das vereinfacht das Monitoring und die Fehlersuche in agentischen Workflows erheblich.
- LAUNCH01. JuliPlurality: Quelloffene KI-Agenten- und Chatbot-Plattform für lokale AIEntwickler erhalten eine einheitliche UI für Hintergrundautomatisierung und interaktive Chats mit lokalen Modellen – inklusive Ordner-Integration für Coding- und Dokumentationsprojekte, ohne Cloud-Abhängigkeit.
- MEINUNG01. JuliVollständig lokaler Agentic-Web-Research-Stack ohne Cloud-APIsDer Stack löst konkrete Anti-Bot-Probleme (Cloudflare, Reddit 403s) ohne Cloud-Abhängigkeit. Der Cache-Layer erweist sich als kritischste Komponente, da er konsistente Snapshots liefert auch wenn Seiten sich ändern oder verschwinden – relevant für alle, die Agenten mit echtem Web-Zugriff bauen.
- LAUNCH01. JuliGemini Spark: Googles agentischer Assistent jetzt als macOS-App verfügbarGemini Spark tritt auf dem Desktop direkt gegen Claude Desktop und Microsoft Copilot an und bietet durch MCP-Unterstützung flexible App-Integrationen. Für AI-Builder relevant: Custom MCP-Anbindungen erlauben maßgeschneiderte Workflows direkt im Agenten.
- LAUNCH01. JuliHister: Self-hosted Suchmaschine mit MCP-Endpoint für lokale LLM-WorkflowsLokale LLM-Workflows können über den MCP-Endpoint direkt auf privat indizierte Inhalte zugreifen, ohne Live-Webabfragen oder separate Integrationen. Das erleichtert datenschutzkonforme RAG-Setups für selbst gehostete Modelle erheblich.