Neon — August 2026
7 Beiträge im August 2026.
- MEINUNG29. Aug.llama.cpp: Über 50 offene PRs für CPU/RAM/Disk-Inferenz-OptimierungFür GPU-arme Setups werden zahlreiche Optimierungen wie Hot-Expert-Pinning, Work-Stealing-Scheduling und neue Quant-Typen (MXFP8, FP8) entwickelt, die CPU-only- und Hybrid-Inferenz spürbar beschleunigen könnten – Zusammenführung bis Jahresende angestrebt.
- MEINUNG28. Aug.GLM 5.3 Flash überzeugt bei Bildanalyse laut Community-TestGLM 5.3 Flash bringt erstmals starke Vision-Fähigkeiten in die GLM-Reihe und soll laut Tester lokale Vision-Modelle in qualitativer Bildanalyse deutlich übertreffen. Für Entwickler, die multimodale lokale Modelle evaluieren, ist das ein konkreter Hinweis zum Nachtesten.
- LAUNCH27. Aug.Qwen3.8-Flash-Next lokal: 20 tok/s auf RTX 3090 mit 3,49M Token SessionQwen3.8-Flash-Next läuft mit 131k-Kontext und MoE-CPU-Offloading auf Consumer-Hardware mit brauchbarer Geschwindigkeit. Der benötigte llama.cpp-Build kommt noch aus einem offenen PR (#27742), ist also noch nicht im Stable-Release enthalten – wer das Modell jetzt nutzen will, muss selbst kompilieren.
- LAUNCH18. Aug.Übersicht: 1-bit & Ternary LLM-Modelle – Tracking-Thread August 2026Extrem komprimierte Modelle (1–2 bit) laufen zunehmend auf Consumer-Hardware ohne dedizierte GPU – die gelisteten Custom-Forks von llama.cpp ermöglichen bereits heute produktionsnahe Inferenz auf Apple Silicon und Mobilgeräten.
- LAUNCH08. Aug.Zero-Dependency C-Inference-Engine für BitNet erreicht 36 tok/s auf Xeon CPUDie Engine nutzt AVX2/AVX-512-VNNI-Routinen für direkte Integer-Akkumulation und läuft bei ~95 % der theoretischen Speicherbandbreite – zeigt, dass bei Batch-Size-1-Inferenz DRAM der Flaschenhals ist, nicht Rechenleistung. Relevant für alle, die lokale LLM-Inferenz auf CPU ohne Runtime-Overhead betreiben wollen.
- LAUNCH05. Aug.Castform + Neon: 4B-Open-Source-Modell erreicht GPT-5.6-Sol-Qualität für 100× wenigerTeams können proprietäre Daten aus ihrer Postgres-Datenbank direkt als Trainingsgrundlage nutzen und ein kleines Open-Weights-Modell auf Frontier-Niveau bringen – bei drastisch geringeren Inferenzkosten (~$0,03 vs. Bruchteile davon) und niedrigerer Latenz für Multi-Hop-Suche.
- LAUNCH04. Aug.QuarkStar: Vulkan/Metal-Inference-Engine für Qwen3.6-35B auf 16-GB-MaschinenEntwickler mit günstiger Hardware (ab ~150 $ AMD BC-250 oder M2 Pro 16 GB) können ein 35B-MoE-Modell lokal mit brauchbaren Geschwindigkeiten betreiben (bis zu 81 tok/s Dekodierung). Das SSD-Streaming-Pfad öffnet die Nutzung sogar für 8-GB-Systeme.