v0 — Juli 2026
20 Beiträge im Juli 2026.
- LAUNCH29. JuliSign in with ChatGPT als Authentifizierungsoption auf Vercel verfügbarEntwickler können innerhalb von ChatGPT direkt Vercel-Team- und Projektberechtigungen vergeben, ohne den Kontext zu wechseln. Die Integration vereinfacht Auth-Flows in ChatGPT-Plugin-Workflows, bestehende 2FA- und SSO-Pflichten bleiben jedoch erhalten.
- FORSCHUNG26. JuliTriton-Backend für Falcon3-10B 1.58bit erreicht 97,5 tok/s auf RTX 5070Das Backend kombiniert K-contiguous packed Ternary Weights, DP4A-Decode-Pfad, Triton-Kerneln und CUDA Graph Replay. Wer 1.58-Bit-Modelle lokal betreibt, kann damit erheblich höhere Decode-Raten erzielen – bisher aber nur auf einer GPU/Stack getestet, unabhängige Reproduktionen stehen aus.
- LAUNCH25. JuliRuff v0.16.0 aktiviert 413 Lint-Regeln als Standard – sieben Mal mehr als zuvorUnpinned Ruff-Abhängigkeiten brechen bestehende CI-Pipelines sofort, wie Willison an drei eigenen Projekten mit hunderten neu gemeldeter Fehler zeigt. Mit `uvx ruff@latest check . --fix --unsafe-fixes` lassen sich die meisten Probleme automatisch beheben.
- LAUNCH24. Juliaudio.cpp Release 0.4: Higgs Audio v3 TTS 4B mit 10× Echtzeit-Speed in C++/GGMLLokale TTS/ASR-Inferenz wird mit Q8-GGUF deutlich effizienter: Higgs Audio läuft bis zu 10×, Voxtral ASR 15,7× schneller als Echtzeit. Das macht hochwertige Sprachmodelle auf Consumer-Hardware praktisch nutzbar.
- LAUNCH21. JuliVercel MCP unterstützt jetzt direkte Käufe im AI-AssistentenAI-Builder können Vercel-Produkte künftig ohne Umweg über das Dashboard buchen. Die Integration erfordert eine Teamrolle mit Billing-Zugriff und setzt eine Bestätigung vor der Transaktion voraus – nützlich für agentenbasierte Infrastruktur-Workflows.
- LAUNCH19. JuliBeeLlama.cpp v0.4.0: Erweiterte KV-Cache-Quantisierung mit KVarN und Precision TailKVarN bietet bessere Präzision pro Bit bei minimalem VRAM-Overhead; der Precision Tail erlaubt es, aktuelle Tokens verlustfrei in BF16/F16 zu halten, ohne den gesamten Cache zu vergrößern — relevant für lange Kontexte mit kritischen Aufgabeninhalten wie Code oder Daten.
- LAUNCH18. JuliArandu v0.6.5: Open-Source-GUI für llama.cpp-ModellverwaltungWer lokal mit llama.cpp arbeitet, bekommt eine All-in-one-Oberfläche für Modell-Download, Versionsverwaltung und Konfiguration – ohne manuelle CLI-Arbeit. Das Tool wird primär vom Autor selbst genutzt und erhält hauptsächlich Kompatibilitätsfixes.
- LAUNCH18. JuliOpenHire: MCP-Server für lokale Jobsuche ohne Lebenslauf-UploadEntwickler können KI-Agenten datenschutzkonform für Jobsuche nutzen, ohne Lebensläufe an externe Server zu senden. Der ghost_score entlarvt veraltete Stellenanzeigen direkt an der Quelle und spart Bewerbungsaufwand auf tote Stellen.
- LAUNCH15. JuliBrainless: shadcn-Komponenten im Stil von Claude Code, Codex und GrokEntwickler können Terminal- und Agent-UI-Muster der populären Coding-Assistenten direkt als shadcn-Komponenten in eigene Apps einbetten, ohne das Design von Grund auf nachzubauen.
- LAUNCH14. JuliLokalBot v0.2.0: Agent Mode, MCP-Server und systemweite Diktierfunktion vollständig on-deviceEntwickler erhalten eine vollständig offline-fähige, GPLv3-lizenzierte Mac-App, die lokale LLMs (GGUF) mit MCP-Integration, Coding-Agent und Meeting-Suche kombiniert – ohne dass Sprach- oder Meeting-Daten das Gerät verlassen. Als MCP-Server lässt sie sich direkt in Claude Desktop oder eigene Agent-Setups einbinden.
- FORSCHUNG12. Julillama.cpp-Bug: Tesla P100 rechnete jahrelang in falscher PräzisionNutzer mit P100-GPUs (aktuell ~80 USD, 16 GB HBM2) erhalten durch den Patch in turboquant v0.3.0 sofort korrektere Inferenz: Median KL-Divergenz sinkt ~2300×, Top-Token-Übereinstimmung steigt von 96,5 % auf 99,9 % – ohne Geschwindigkeitsverlust.
- FORSCHUNG11. JuliPrismaQuant: Neue Quantisierungsmethode für Blackwell-GPUs mit vLLMPrismaQuant ermöglicht layer-selektive Quantisierung für Blackwell-GPUs, was Qwen3.6-27B auf Consumer-Hardware mit 32 GB VRAM lauffähig macht. GGUF-Support fehlt noch; Nutzer mit GGUF-Workflow oder Non-Blackwell-GPUs können die Methode derzeit nicht verwenden.
- MEINUNG11. JuliGrok Build CLI überträgt gesamtes Repo inkl. .env-Secrets an xAI-CloudWer Grok Build CLI in Projekten mit Secrets oder proprietärem Code einsetzt, riskiert unkontrollierte Datenweitergabe an xAI. Der Opt-out steuert nur Training, nicht den Upload — betroffene Teams sollten das Tool bis zur Klärung nicht in sensiblen Repos verwenden.
- BENCHMARK07. JuliGLM-5.2 auf 8×B200: 2× TP=4 NVFP4-Replicas schlagen TP=8 um Faktor 2Wer GLM-5.2 auf B200-Hardware betreibt, kann durch NVFP4 + Split-TP-Layout den Node-Durchsatz verdoppeln und die Inferenzkosten gegenüber H200 FP8 um ~3,5× senken. Kritisch: SGLang ≤v0.5.9 erzeugt auf B200 silent-wrong-outputs – Upgrade auf v0.5.13.post1+ ist Pflicht für NVFP4.
- LAUNCH07. Julimistral.rs v0.9.0: bis zu 1,8× schnellerer CPU-Decode als llama.cppWer LLMs lokal auf CPU betreibt, kann mit mistral.rs v0.9.0 spürbar höhere Token-Raten erzielen – ohne GPU. Der direkte Modell-Load von Hugging Face via ISQ senkt zudem die Einstiegshürde für eigene Deployments.
- LAUNCH07. JuliLeRobot v0.6.0 mit neuen Features für Evaluation und VerbesserungKonkreter Mehrwert ohne vollständigen Artikeltext nicht vollständig beurteilbar. Das Update adressiert laut Titel Evaluation und Verbesserung von Roboter-Lernsystemen — relevant für Teams, die mit LeRobot Robotik-Policies trainieren.
- LAUNCH05. JuliAthanor Lite: Kostenlose Desktop-App für einfaches Ausführen lokaler LLMsDie App erkennt automatisch kompatible Modelle anhand der Hardware, verwaltet Ollama-Installs und zeigt Echtzeit-Metriken (tok/s, VRAM, GPU-Auslastung). Nützlich für Entwickler und nicht-technische Nutzer, die lokale Modelle ohne CLI-Aufwand betreiben wollen.
- LAUNCH05. JuliKivarro: Open-Source Rust/Tauri Workbench für lokale LLM-InferenzEntwickler, die lokal mit GGUF-Modellen arbeiten, erhalten eine zentrale Oberfläche für Modellverwaltung, Profil-Switching und Runtime-Tuning – als Alternative zu CLI-Tools oder weniger konfigurierbaren GUIs. Noch frühe Alpha, macOS/Linux-Support in Arbeit.
- LAUNCH03. JuliCurrent AI veröffentlicht Open Source AI Gap Map mit 421 ProduktenDie Rohdaten (MIT-Lizenz, GitHub) ermöglichen es Entwicklern, systematisch Lücken im Open-Source-KI-Stack zu identifizieren. Simon Willison verweist zudem auf eine Datasette-Lite-Ansicht von 16.185 getrackten GitHub-Repos als direkt nutzbaren Einstiegspunkt.
- FORSCHUNG03. JuliHierarchos: 232M-Parameter-Hybridmodell mit rekurrenter Architektur vorgestelltZeigt konkret lösbare Train/Inference-Parity-Probleme bei nicht-Transformer-Architekturen (LTM-Mismatch, RWKV-Aktivierungsspikes, Drift-State-Fehler) – relevant für Teams, die effiziente rekurrente Kleinmodelle abseits klassischer Attention erforschen.