AMD — August 2026
80 Beiträge im August 2026.
- LAUNCH31. Aug.Circleback führt kostenlosen Tarif ein um Nutzerbasis zu erweiternIm hart umkämpften Meeting-Notetaker-Markt (Granola, Fireflies, Read AI) setzt Circleback auf Freemium als Marketing-Kanal statt auf bezahlte Werbung. Mit ~8 Mio. $ Run-Rate-Revenue und 8 Mitarbeitern zeigt das Modell, dass schlanke AI-Tools profitabel skalieren können.
- LAUNCH31. Aug.ROCm 10 + llama.cpp: Qwen3.8 27B Q8 mit MTP auf 2× RX 9700ROCm 10 mit dem offiziellen Docker-Image ermöglicht unkomplizierten Betrieb großer Quantisierungen auf Consumer-AMD-GPUs. MTP beschleunigt Code-Generierung spürbar; 5–10 % Mehrleistung gegenüber dem Standard-ROCm-Docker-Image bestätigt.
- LAUNCH31. Aug.R9V: Custom RDNA4-Kernels bringen 3× TG- und 30× PP-Speed für Qwen3.8Für lokale Inferenz auf AMD-Hardware liefert R9V drastische Speedups durch native Wave32-Nutzung, MTP-Optimierung und expertengruppierten Prefill — relevant für alle, die Dual-R9700-Setups für MoE- oder Dense-Modelle betreiben.
- MEINUNG29. Aug.Praxis-Tipp: Qwen3.8-Flash-Next Q4 mit tensor-read-lazy nur via mmap ladenWer große GGUF-Modelle mit --tensor-read-lazy auf Multi-GPU-Vulkan-Setups ausführt, muss --load-mode mmap manuell setzen, sonst schlägt das Laden wegen Speichermangels fehl. Direkt anwendbarer Fix für ähnliche OOM-Probleme mit großen quantisierten Modellen.
- LAUNCH29. Aug.Community-imatrix-Quants für Qwen3.8-Flash-Next: 20–30 GB kleiner als Unsloth/AesSedai Q4Wer Qwen3.8-Flash-Next lokal betreibt, kann mit diesen Quants RAM/VRAM sparen ohne Qualitätsverlust. Für AMD-Strix-Halo-Hardware gibt es zusätzlich einen dedizierten ROCmFP4-Build mit besserer Performance.
- MEINUNG29. Aug.Chinesische LLMs nähern sich Anthropics Spitzenmodell Opus 4.8Wenn chinesische Open-Source-Modelle das Niveau westlicher Frontier-Modelle erreichen, verschiebt sich die Preisverhandlungsmacht deutlich – Enterprise-Builder könnten auf kostengünstigere Alternativen migrieren statt teure API-Token zu kaufen.
- MEINUNG29. Aug.Ubuntu 26.04 LTS: Community-Diskussion zu Inferenz-Verbesserungen mit Kernel 7.0Für lokale LLM-Nutzer mit AMD-Hardware könnten Kernel 7.0 und ROCm 10.0 relevante Performance-Gewinne bringen – konkrete Messwerte fehlen im Post, die Community-Antworten können jedoch praktische Hinweise für Upgrade-Entscheidungen liefern.
- LAUNCH28. Aug.AMD ROCm 10.0 released – llama.cpp-Integration in ArbeitROCm 10.0 könnte die Inferenz-Performance auf AMD-GPUs verbessern. Die llama.cpp-Integration (PR #27803) ist noch ausstehend – bis zur Verfügbarkeit für lokale Nutzer bleibt abzuwarten, ob der PR zeitnah gemergt wird.
- LAUNCH28. Aug.Meta MTIA 300: Custom-Chip integriert Netzwerk direkt in KI-BeschleunigerMTIA 300 reduziert den Kommunikations-Overhead bei einem 150-Mrd.-Parameter-Empfehlungsmodell um den Faktor 3,9× gegenüber einem GPU-Cluster und begrenzt den Compute-Durchsatz-Verlust durch parallele Kommunikation auf unter 0,5 % – relevant für alle, die große Embedding-basierte Modelle skalieren.
- MEINUNG27. Aug.Enterprise-Agent-Governance: Komplexität zwischen Agenten ist das eigentliche RisikoWer Agent-Flotten betreibt, braucht mehr als Audit-Logs: Jeder Agent benötigt eigene Identität, definierten Scope und einen namentlichen Verantwortlichen. Entscheidend ist Enforcement in Echtzeit – also das Stoppen regelwidriger Aufrufe vor der Ausführung, nicht erst die nachträgliche Analyse.
- MEINUNG27. Aug.Llama.cpp mit ROCm 7.14 auf Radeon 780m: Workaround für StabilitätsproblemeFür lokale LLM-Nutzer mit AMD-iGPUs ist ROCm trotz Instabilität via Workaround deutlich schneller als Vulkan (100 t/s vs. ~60 t/s). Die Umgebungsvariable AMD_SERIALIZE_KERNEL=3 kann sofort eingesetzt werden, bis ein offizieller Fix verfügbar ist.
- MEINUNG27. Aug.AI-Agent-Governance muss auf Datenbankebene durchgesetzt werdenFür AI-Builder bedeutet das: Agenten brauchen eine eigene Identität als First-Class-Principal im Datenbankystem, mit gebundenem Verwendungszweck je Session. Bestehende Mechanismen wie RBAC, Row-Level-Security und Policy-as-Code müssen explizit auf Agenten ausgeweitet werden.
- LAUNCH27. Aug.OpenCode Senses: Lokales Vision-Plugin mit 13 Bild-Tools und 84 ms LatenzText-only Coding-Modelle wie DeepSeek V4 Flash erhalten damit eine dedizierte, lokal laufende Vision-Schicht. Für AI-Builder bedeutet das: vollständige Datenprivacy, keine API-Kosten und eine 3,6× schnellere Verarbeitung gegenüber der früheren Baseline von ~300 ms.
- LAUNCH26. Aug.Amazon verdreifacht Nvidia-GPU-Bestellung auf 2 Mio. Chips für AWSAWS integriert Nvidias gesamten Stack – Networking, CPUs, Robotik-Plattform und offene Modelle – parallel zu eigenen Chips wie Trainium. Der Deal zeigt, dass Nvidia trotz zunehmender Konkurrenz durch Cloud-eigene Chips die dominierende KI-Infrastrukturrolle behält.
- LAUNCH26. Aug.Anthropic sichert sich Compute im Wert von 45 Mrd. USD von NscaleAnthropic baut seinen Compute-Stack aggressiv aus – nach Deals mit Volta (10 Mrd. USD), AMD (5 Mrd. USD), SpaceX und Amazon innerhalb weniger Monate. Für AI-Builder signalisiert das eine weiter steigende Nachfrage nach GPU-Kapazitäten und höhere Zugangsbarrieren zu State-of-the-Art-Chips wie Vera Rubin.
- LAUNCH26. Aug.INT8-vLLM-Fork: Qwen3.8 27B erreicht 972 tok/s auf 4x MI100 für 6.500 $Ältere INT8-zentrische GPUs (AMD MI100, MI50, MI210, ältere Nvidia-Karten ohne native FP8) laufen in Stock vLLM ineffizient auf BF16/FP16. Dieser Fork ermöglicht mit W8A8 GEMM, INT8 KV-Cache und fusionierten Kerneln einen ~65-fachen TG-Speed-up und macht günstiges High-Concurrency-Serving für technisch versierte Nutzer realistisch.
- BENCHMARK26. Aug.2× Speedup mit Strix Halo + R9700: Heterogenes GPU-Setup für Qwen3.5-122BDie Methode zeigt, dass heterogene Setups aus CPU-nahem Unified Memory und dedizierter GPU funktionieren, wenn Tensor-Parallelismus vermieden und stattdessen selektives Layer-Routing genutzt wird – relevant für alle, die lokale LLM-Inferenz mit Consumer-Hardware skalieren wollen. Der gesamte Stack inklusive llama.cpp-Patches und Modell-Variante ist auf GitHub/HuggingFace verfügbar.
- MEINUNG26. Aug.Geminis Branding-Chaos: KI-Industrie überfordert Nutzer mit internen ArchitekturenKI-Apps zwingen Nutzer, interne Architekturentscheidungen zu verstehen, statt Anfragen einfach zu tippen. Das begünstigt schlankere Ansätze – Apple Siri-Integration und SMS-basierte KI-Assistenten – die ohne neue UI-Lernkurve auskommen.
- LAUNCH26. Aug.Lemonade SDK unterstützt jetzt 15 Engines mit Cross-Plattform-BackendWer lokale AI-Anwendungen oder Agents baut, bekommt einen einheitlichen Installationspunkt für viele Engines und Modalitäten (inkl. Musik, 3D) mit intelligentem Router – ohne eigene Infrastruktur aufbauen zu müssen. Ein neues GUI und Plugin-Interface sind in Kürze in der Beta.
- MEINUNG26. Aug.Agentic AI vs. Automation: Warum die meisten Agents nur Flowcharts sindWer Agenten-Systeme baut, sollte prüfen, ob der Prozess vorab als Flowchart spezifizierbar wäre – wenn ja, ist ein Workflow-Engine günstiger und zuverlässiger. Echter Agenten-Nutzen entsteht nur bei offenen Aufgaben, bei denen Entdeckungen die Richtung nicht vorhersehbar verändern.
- BENCHMARK26. Aug.Open-Source-Kernel für AMD MI350X erreicht 78.498 tok/s mit Qwen3-35B-A3BEntwickler, die AMD MI350X statt NVIDIA einsetzen, können mit diesem Open-Source-Kernel signifikant höhere Inferenz-Durchsätze erzielen. Der Kernel adressiert die bekannte Lücke im ROCm-Software-Stack und macht AMD-Hardware als kostengünstigere Alternative praktisch nutzbar.
- FUNDING25. Aug.Stability AI sichert sich 76 Mio. Dollar Series-B-FinanzierungDas Investorenfeld aus Musik- und Gaming-Konzernen signalisiert, dass Stability AI künftig stark auf Content-Lizenzierung und Co-Entwicklung mit Entertainmentpartnern setzt statt auf klassisches Venture-Wachstum. Für AI-Builder im Kreativbereich könnte dies den Zugang zu lizenzierten Trainingsdaten und Vertriebskanälen über diese Partner beschleunigen.
- MEINUNG25. Aug.Qwen3 35B-A3B: AMD 7900 XTX langsamer als Nvidia 3060 Ti unter llama.cppAMD-GPUs zeigen unter llama.cpp mit Vulkan bei MoE-Modellen wie Qwen3 35B-A3B erhebliche Performance-Defizite gegenüber Nvidia. Wer lokal MoE-Modelle betreibt, sollte auf vollständiges VRAM-Fitting achten und ROCm statt Vulkan bevorzugen – selbst dann bleibt die AMD-Leistung hinter günstigeren Nvidia-Karten.
- MEINUNG25. Aug.Fix: AMD 7900 XTX eGPU-Abstürze durch amdgpu.runpm=0 behebenWer große Modelle (18 GB+) auf einer AMD-GPU unter Linux mit wenig System-RAM betreibt, sollte Runtime Power Management via `amdgpu.runpm=0` im GRUB deaktivieren, um OOM-Crashes durch unerwartetes GPU-Suspend zu verhindern.
- MEINUNG25. Aug.Community-Erfahrungen mit chinesischen AI-Acceleratoren im PraxistestFür AI-Builder, die auf lokale Inferenz setzen, sind chinesische ASICs (z.B. von Cambricon, Biren oder ähnlichen) potenziell kosteneffizient – der Thread bündelt Community-Erfahrungen zu Kompatibilität, Treibern und Framework-Support, die vor einem Kauf relevant sind.
- MEINUNG24. Aug.Instinct AI-Assistent: Beeindruckende Fähigkeiten, aber massive DatenschutzbedenkenInstinct darf laut AGB Nutzerinhalte „perpetual and irrevocable" verwenden, eigenmächtig Transaktionen abschließen und bleibt auch nach Verbindungstrennung aktiv – ein Warnzeichen für alle, die KI-Agenten mit echtem Postfach- und Gerätezugriff evaluieren.
- BENCHMARK24. Aug.PCIe Gen5 x8/x8 vs. Gen4 x16/x4: 18–32% mehr vLLM-Throughput bei Dual-R9700Für Dual-GPU-Setups mit Tensor Parallelism lohnt sich symmetrische PCIe-Anbindung messbar: Symmetrisches Gen5 x8/x8 liefert gegenüber asymmetrischem Gen4 x16/x4 konsistent höheren Durchsatz und niedrigere Latenz – ein konkreter Datenpunkt für die Plattformwahl bei lokalen LLM-Rigs.
- MEINUNG23. Aug.Community fragt: PowerColor R9700 + Qwen3-27B bei 64K Kontext – echte Tokens/s?AMD-Marketing-Zahlen (51,8 tok/s) gelten wohl für kurze Kontexte; Community-Berichte zeigen starken Einbruch auf ~26 tok/s bei 64K Kontext. Wer den R9700 für Long-Context-Workloads plant, sollte reale Benchmarks abwarten – MTP/Speculative Decoding unter Vulkan gilt noch als instabil.
- MEINUNG23. Aug.User-Debatte: Wechsel von NVIDIA 5060 Ti zu AMD RX 7900 XT für lokale LLMsFür lokale LLM-Setups mit oobabooga TextGen oder Open-WebUI ist der CUDA-zu-ROCm/Vulkan-Wechsel mit Kompatibilitätsrisiken verbunden. Community-Erfahrungen können helfen, Toolchain-Tücken bei AMD-GPUs einzuschätzen.
- BENCHMARK23. Aug.AMD-Ecosystem llama.cpp Branch bietet bis zu 2× schnelleres Prompt ProcessingAMD-Nutzer mit ROCm-Setup können durch den AMD-Ecosystem-Fork erheblich schnelleres Prompt Processing erreichen. Tradeoff: Text Generation ist ca. 15% langsamer als mit Vulkan. MoE-Modelle zeigen keine Verbesserung.
- MEINUNG23. Aug.Überblick KI-Chip-Architekturen: GPUs, TPUs, LPUs und Wafer-ScaleWer KI-Infrastruktur plant, muss die Unterschiede zwischen GEMM-optimierten und GEMV-Szenarien (Training vs. Decode) kennen. Der Artikel erklärt das Memory-Wall-Problem und wie verschiedene Architekturen es lösen – relevant für Chip-Auswahl und Systemdesign.
- LAUNCH22. Aug.llama.cpp-Fork optimiert für AMD GFX906 (Mi50, Mi60, Radeon VII)Nutzer älterer AMD-GPUs (GCN-Generation) werden von offiziellen llama.cpp-Builds oft schlechter unterstützt. Dieser Fork könnte Inferenz auf günstiger verfügbarer AMD-Hardware deutlich praxistauglicher machen.
- LAUNCH22. Aug.Inherent: DeepMind-Spin-off behauptet, Claude und GPT-5.5 bei Paper-Replikation zu schlagenFaraday basiert auf Qwen 3.6 (27B Parameter) und schlägt laut Eigenangabe deutlich größere Frontier-Modelle durch RL-Training mit Fokus auf wissenschaftlichem Urteilsvermögen – relevant für Teams, die kostengünstige spezialisierte Forschungsagenten bauen wollen.
- LAUNCH22. Aug.energygraph 1.3: Terminal-Tool für Live-Stromverbrauch von CPU und dGPUsWer lokale LLMs auf Consumer-Hardware betreibt, kann mit energygraph 1.3 den Stromverbrauch einzelner Komponenten in Echtzeit im Terminal überwachen – nützlich zur Optimierung von Inferenz-Setups und zur Kostenschätzung beim Multi-GPU-Betrieb.
- MEINUNG22. Aug.Community-Diskussion: AMD- und Intel-GPUs für lokale LLM-InferenzWer Multi-GPU-Server für lokale Inferenz ausbaut, steht vor der Frage: AMD/Intel bieten mehr VRAM pro Dollar, aber der CUDA-Stack gilt als deutlich reifer. Community-Erfahrungen zu ROCm- und Intel-Treibern sind hier entscheidend für die Kaufentscheidung.
- MEINUNG22. Aug.Qwen3-27B via llama.cpp und OpenCode: Modell reagiert trotz korrekter Konfiguration nichtWer Qwen3-27B lokal mit llama.cpp und OpenCode betreibt, sollte die Kombination aus MTP-Spekulation, ctx-size 131072 und den genutzten Sampling-Parametern prüfen – offenbar gibt es Kompatibilitätsprobleme, die beim größeren MTP-Modell nicht auftreten.
- LAUNCH21. Aug.Optimierungsguide: Qwen3-8-27B auf Strix Halo mit bis zu 256K KontextDas Repo liefert fertige Rezepte (Q8/Q6/Q5/Vision) mit Unsloth Dynamic Quants 3.0 und systemd-Integration, die auch autonom von Agenten ausgeführt werden können – nützlich für vollständig lokale LLM-Deployments auf AMD-APU-Hardware.
- MEINUNG21. Aug.Community sucht schnellste Qwen3-8/27B GGUF-Variante für AMD GPUsAMD-GPU-Nutzer stoßen beim Tensor-Parallelismus mit ungleichen Karten auf Inkompatibilitäten in gängigen Inferenz-Stacks. Wer ähnliche Multi-GPU-Setups mit ROCm betreibt, findet hier praxisnahe Community-Erfahrungen zu GGUF-Quantisierungen (Q6/Q8) für Qwen3.
- BENCHMARK20. Aug.Qwen3.8-27B auf MI300X: 311 auf 495 tok/s mit dstack Open-Source-ToolkitAI-Builder auf AMD-Hardware können mit dstack-Presets reproduzierbare Inferenz-Optimierungen auf MI300X deployen – portabel für AMD Cloud, Kubernetes und Bare-Metal, ohne eigene Low-Level-Patches entwickeln zu müssen.
- MEINUNG20. Aug.DeepSeek V4 Flash auf 4× R9700: Skalierungsprobleme bei 128 GB VRAMMulti-GPU-Setups mit llama.cpp skalieren bei großen Modellen wie DeepSeek V4 Flash nicht linear. Wer ähnliche Hardware einsetzt, sollte Tensor-Parallelisierung, Batch-Strategien und Quant-Wahl (kleineres Modell vs. Qualitätsverlust) sorgfältig abwägen.
- BENCHMARK20. Aug.llama.cpp PR: AVX2-Optimierung beschleunigt IQ-Quants auf CPU um bis zu 1278%Wer IQ-Quants auf CPU für imatrix-Berechnungen oder Perplexitäts-Evaluierungen nutzt, könnte durch diesen PR drastisch kürzere Laufzeiten erzielen. Der Patch ist noch Draft/Open, aber die Benchmark-Daten auf AMD EPYC 9654 sind reproduzierbar und überzeugend.
- MEINUNG20. Aug.KV-Cache F16 vs Q8_0: Qwen3.8-27B zeigt messbare QualitätsunterschiedeWer Qwen3.8-27B lokal mit langen Kontexten betreibt, sollte KV-Cache-Quantisierung nicht als qualitätsneutral betrachten. F16 KV-Cache zeigt laut diesem Praxisbericht besonders bei >120k Tokens messbare Vorteile gegenüber Q8_0 – Q4_0 KV-Cache gilt als deutlich schlechter.
- MEINUNG19. Aug.Community-Diskussion: Lohnen sich alte Datacenter-GPUs wie P40 oder MI50 noch?Für budgetbewusste AI-Builder bleibt die Frage relevant, ob günstige Gebraucht-GPUs wie P40 oder MI50 für lokale Inferenz kleiner Modelle praktikabel sind – die Community-Antworten können konkrete Kaufentscheidungen leiten.
- MEINUNG18. Aug.GPU-Preise steigen: AMD RX 9060 XT für 8.300 AUD weiterverkauftSteigende Sekundärmarktpreise für Consumer-GPUs erschweren den Aufbau lokaler Inference-Hardware erheblich. Wer auf günstige AMD-Karten für Local-LLM-Setups setzt, muss mit deutlich höheren Kosten oder Lieferengpässen rechnen.
- BENCHMARK16. Aug.Llama.cpp ROCm 7.14 vs. Vulkan: Benchmarks auf Radeon 780m iGPUFür lokale AMD-iGPU-Nutzer lohnt sich der ROCm-Build bei dichten Modellen (z. B. Qwen 3.8 27B: +47 % pp-Speed). Bei MoE-Modellen und Token-Generierung bleibt Vulkan konkurrenzfähig oder überlegen. ROCm erfordert manuellen Build und andere Kernel-Parameter.
- MEINUNG16. Aug.Community-Hilfe: 4× AMD RX 6900 XT auf ASUS Z10PA-U8 nicht erkanntWer lokale LLMs auf Multi-GPU-AMD-Setups betreibt, sollte PCIe-Slot-Kompatibilität und Riser-Kabel-Unterstützung des Mainboards vorab prüfen. Mit nur 3 GPUs erreichte der Nutzer ~30 t/s bei einem 40B-Modell, mit 4 GPUs wäre ein weiterer Schub zu erwarten – sofern Board und Riser harmonieren.
- FORSCHUNG15. Aug.EU-GPU-Preise steigen um 19,2 % in einem Monat – Daten aus 176 ModellenWer Hardware für lokale LLM-Setups oder AI-Infrastruktur in der EU plant, muss mit deutlich höheren GPU-Kosten rechnen. Der Preisanstieg begann um den 24./25. Juli und ist stabil, nicht ein Einmalausschlag – Abwarten dürfte sich kaum lohnen.
- BENCHMARK15. Aug.Qwen 3 27B auf AMD-Hardware: bis zu 51 t/s auf Radeon AI PRO R9700Für Entwickler, die lokal große Dense-Modelle betreiben, zeigen diese Werte, dass AMD-Hardware (Strix Halo APU und dedizierte Radeon-GPU) kompetitive Inferenzgeschwindigkeiten bei Qwen 3 27B erreicht. Optimale llama.cpp-Befehle für Q8, 256K Kontext und MTP werden noch gesucht.
- LAUNCH14. Aug.Kog will 30× schnellere LLM-Inferenz auf Standard-GPUs liefernTeams, die auf schnelle AI-Workflows angewiesen sind (z. B. Coding-Agents, App-Generierung), könnten mit vorhandener GPU-Hardware deutlich höhere Throughputs erzielen – ohne neue Chips kaufen zu müssen. Erste LLM-Implementierung mit 10× Speed ist für September geplant.
- MEINUNG14. Aug.Community diskutiert optimalen Software-Stack für Qwen 3.8 auf Strix Halo und Apple SiliconDa Qwen 3.8 dieselbe Architektur wie 3.6 nutzen soll, können bestehende MTP-Optimierungen direkt übertragen werden. Wer auf Strix Halo oder Apple Silicon lokal inferiert, sollte den verlinkten Artikel und Thread-Empfehlungen zum Software-Stack prüfen, bevor er das neue Modell deployed.
- MEINUNG14. Aug.Vulkan vs. ROCm: 2× Performance-Unterschied auf AMD 7900 XTX unter LinuxFür lokale LLM-Nutzer auf AMD-Hardware zeigt der Fall, dass ROCm unter Linux deutlich bessere Inferenzleistung liefern kann als Vulkan. Die Wahl des Backends in LM Studio hat messbare Auswirkungen auf den Durchsatz.
- MEINUNG13. Aug.DIY-KI-Server aus eBay-Schrott: Vier AMD V620 GPUs im EigenbauZeigt einen konkreten, kostengünstigen Ansatz für lokales LLM-Inference mit 4× 32 GB VRAM ohne Cloud-Abhängigkeit. AMD-ROCm-Kompatibilitätsprobleme und Kühlungslösungen für fanlose Serverkarten werden praxisnah dokumentiert.
- LAUNCH13. Aug.AMD-FP8-Training in TorchTitan und TorchAO upstream gemergtEntwickler können FP8-Training auf AMD Instinct GPUs direkt über TorchTitan und TorchAO nutzen, ohne proprietäre Forks. Lineare Skalierung jenseits von 1.000 GPUs ist damit out-of-the-box verfügbar.
- GERÜCHT13. Aug.Intel Razor Lake AX für 2027 erwartet – doppelte Speicherbandbreite vs. Strix HaloFür lokale LLM-Inferenz ist Speicherbandbreite der kritische Flaschenhals. Sollten die 512 GB/s bestätigt werden, wäre Razor Lake AX 2027 eine deutlich leistungsfähigere Consumer-Plattform für große Modelle als heutige APUs.
- MEINUNG12. Aug.Agentic AI könnte CPU-zu-GPU-Verhältnis von 1:4 auf 1:1 verschiebenWer Agentic-AI-Infrastruktur plant, muss CPUs, Arbeitsspeicher, Storage und Networking gleichwertig zu GPUs skalieren. Microsofts Cobalt 200 verspricht 33 % weniger Agent-Call-Latenz und 23 % mehr Throughput als konkreten Anhaltspunkt für CPU-Auswahl.
- LAUNCH12. Aug.Discovered Materials (YC P26) setzt AI Agents für Halbleiter-Materialforschung ein7 getestete Modelle (Anthropic, OpenAI, Kimi) finden in 8-Stunden-Runs Materialien, für die ein PhD-Student mehrere Wochen benötigt. Für AI-Builder relevant: Das Team veröffentlicht Benchmark-Daten und berichtet von modellspezifischem Verhalten wie Reward-Hacking bei Claude und Kontextverlust bei GPT-5.6 ab ~50M Tokens.
- FUNDING11. Aug.General Catalyst führt 1,1-Mrd.-Dollar-Runde in zwei Monate altes Startup River AIEnterprises können laut River komplexe RL-Runs in 15–20 Minuten ohne Infrastruktur-Team abschließen – zu 2–4× Kostenersparnis gegenüber Closed-Source-Alternativen. Das adressiert direkt den wachsenden Bedarf an kontrollierbarem Post-Training ohne eigene ML-Infrastruktur.
- BENCHMARK11. Aug.DeepSeek V4 Flash 0731: 27 t/s auf Strix Halo mit Vulkan und DSparkVulkan schlägt ROCm auf gfx1151 deutlich (22+ vs. 12,5 t/s Decode); q8_0 KV-Cache ist schneller als f16 bei langen Generierungen und verdoppelt den Kontext auf 131k. Konkrete Configs und Boot-Parameter machen den Aufbau reproduzierbar für Strix-Halo-Nutzer.
- LAUNCH11. Aug.Unsloth Desktop: Open-Source-App für lokales Trainieren und Ausführen von LLMsEntwickler können Claude Code und Codex an lokale LLMs koppeln, Multi-GPU-Setups (NVIDIA, AMD, Intel, Mac) nutzen und Modelle via Cloudflare HTTPS sicher remote deployen – ohne Telemetrie oder Datenweitergabe.
- LAUNCH11. Aug.llama.cpp ergänzt CI-Support für ROCm 7.14 unter Linux und WindowsAMD-GPU-Nutzer können llama.cpp ab Build b10356 offiziell mit ROCm 7.14 nutzen. Der Wechsel auf TheRock als Build-System könnte langfristig Installations- und Kompatibilitätsvorteile für lokale LLM-Inferenz auf AMD-Hardware bringen.
- BENCHMARK10. Aug.Muse-Glimmer-30B auf AMD v620: Tensor-Split-Benchmarks mit 1 und 2 GPUsKonkrete Throughput-Werte zeigen: Tensor-Split mit llama-server verdoppelt annähernd die Prompt-Processing-Rate (z.B. 16k: 372 → 553 tok/s bei Q6). Der Token-Generierungs-Speedup ist jedoch minimal (~35 vs. ~36 tok/s), was auf speichergebundene Engpässe beim Decoding hinweist.
- MEINUNG10. Aug.Ling 3.0 Flash übertrifft Qwen-122B auf Strix Halo in InferenzgeschwindigkeitFür lokale LLM-Betreiber auf AMD-Hardware zeigt der Vergleich, dass Ling 3.0 Flash selbst kleinere Quantisierungsformate effizient nutzt und Qwen-122B in der Geschwindigkeit übertrifft. Tool-Call-Unterstützung ist in bestimmten Harnesses noch fehlerhaft.
- MEINUNG10. Aug.DeepSeek V4 Flash 0731 als Treiber für NVIDIA DGX Spark NachfrageFür lokale LLM-Betreiber interessant: NVFP4-Support auf DGX Spark ermöglicht laut Bericht 60 tk/s mit DeepSeek V4 Flash bei 1M Kontext – ein konkreter Setup-Anhaltspunkt für agentic Workloads auf Consumer-naher Hardware.
- LAUNCH10. Aug.Meta veröffentlicht Muse Glimmer: 30B Open-Weight-Modell für lokale Agent-WorkflowsDurch 4-Bit-Quantisierung läuft das Modell unter 20 GB und passt damit in 24/32-GB-Consumer-Hardware. Integrierter Speculative-Decoding-Drafter und Failure-Recovery-Training machen es direkt nutzbar für produktive Agentic Loops ohne Cloud-Anbindung.
- BENCHMARK10. Aug.Qwen 3.5 35B A3B auf Radeon RX 7600 mit 18 Token/s unter llama.cppDas MoE-Modell läuft via --n-cpu-moe-Offloading auf Consumer-Hardware flüssig: 18 Token/s mit 9000-Token-Kontext zeigt, dass leistungsfähige MoE-Modelle ohne teure GPU realisierbar sind – relevant für lokale Deployments mit begrenztem Budget.
- MEINUNG09. Aug.Community-Debatte: AMD AI Pro NPU vs. 5070Ti als 4. GPU in 3×RTX-5090-SystemZeigt praxisrelevante Grenzen gemischter CUDA/ROCm-Setups: Der RPC-Loopback-Trick ermöglicht 128 GB VRAM, beschränkt aber auf llama.cpp. Bei MoE-Modellen wie DeepSeek bringt RPC laut Erfahrungsbericht kaum Speed-Vorteile; VRAM-Kapazität allein reicht nicht, wenn Bandbreite uneinheitlich ist.
- BENCHMARK09. Aug.Radeon 780m iGPU mit 64 GB DDR5 als Budget-Lösung für lokale LLMs unter 1000 EURQwen3 35B-A3B Q8 erreicht ~21 t/s (tg) und ~287 t/s (pp), Gemma4 31B Q8 nur ~2,5 t/s (tg). MTP-Speculative-Decoding steigert bei Gemma4 auf ~5,76 t/s. Für AI-Builder mit knappem Budget zeigt das Setup einen konkreten, reproduzierbaren Pfad für 30–35B-Modelle ohne dedizierte GPU.
- FORSCHUNG09. Aug.llama.cpp-Patch verdoppelt Context-Länge für Qwen 27B auf AMD-GPUsNutzer von AMD-GPUs (ROCm/Vulkan) können mit demselben VRAM deutlich längere Kontextfenster betreiben — besonders relevant für Dual-GPU-Setups, bei denen der Kontextgewinn fast eine Verdopplung bringt. Der Patch ist noch nicht im Upstream von llama.cpp enthalten.
- BENCHMARK08. Aug.PCIe P2P auf Consumer-Nvidia-GPUs steigert vLLM Prefill-Speed um ~40%Wer vLLM mit ≥2 Consumer-Nvidia-GPUs betreibt, kann durch ReBAR-Aktivierung im BIOS, gepatchte Open-GPU-Kernel-Module und drei Umgebungsvariablen (NCCL_P2P_DISABLE=0, VLLM_SKIP_P2P_CHECK=1, NCCL_P2P_LEVEL=SYS) den Prefill-Throughput deutlich steigern – ohne Hardware-Upgrade.
- LAUNCH08. Aug.Zero-Dependency C-Inference-Engine für BitNet erreicht 36 tok/s auf Xeon CPUDie Engine nutzt AVX2/AVX-512-VNNI-Routinen für direkte Integer-Akkumulation und läuft bei ~95 % der theoretischen Speicherbandbreite – zeigt, dass bei Batch-Size-1-Inferenz DRAM der Flaschenhals ist, nicht Rechenleistung. Relevant für alle, die lokale LLM-Inferenz auf CPU ohne Runtime-Overhead betreiben wollen.
- MEINUNG08. Aug.Lokaler AI-Cluster: Mehnjährige Progression von Gaming-PC zu 4× RTX 6000 ProDer Bericht zeigt praxisnah, welche Hardware-Fallstricke (PCIe-Bus-Drops, schlechte Netzteile, Brandgefahr) beim Aufbau lokaler Multi-GPU-Cluster entstehen – und belegt mit 30 Mio. generierten Tokens (seit Jan 2026), dass lokale Inferenz für produktive Dev-Workloads skalierbar ist, aber kostspielig bleibt.
- LAUNCH08. Aug.Lokaler Code-Index für Coding-Agents löst Imports ohne Language Server aufAgents können damit in teilweise kaputten Repos navigieren, die nicht kompilieren – ohne Build-Schritt oder per-Sprache-Daemon. Callers werden mit Konfidenz-Annotation zurückgegeben, um stille Unter-Approximation (2 statt 172 Treffer) zu vermeiden.
- BENCHMARK08. Aug.Qwen3.6 27B & 35B auf einer AMD R9700 mit vLLM: Benchmark-Ergebnisse27B- und 35B-Modelle laufen praxistauglich auf einer einzigen Consumer-AMD-GPU mit 32 GB VRAM – inklusive langer Kontextfenster (bis 262k Token). Die veröffentlichte vLLM-Radiance-Docker-Config senkt die Einstiegshürde für ROCm-basierte Setups erheblich.
- MEINUNG08. Aug.llama.cpp Tensor Split Fix für gfx1030-GPUs: -ub 384 löst AbsturzproblemNutzer mit mehreren AMD V620- oder anderen gfx1030-Karten können Tensor Split in llama.cpp nun stabil nutzen, indem sie -ub 384 und -b als Vielfaches davon setzen. Damit werden Modelle wie Qwen3 27B Q8_0 mit 40–50 t/s Generation auf zwei Karten über ROCm oder Vulkan lauffähig.
- BENCHMARK07. Aug.llama.cpp PR beschleunigt Q2_0 auf x86-CPUs um Faktor 3,0–3,6×Lokale Inferenz mit Q2_0-Modellen (z. B. Bonsai-GGUFs) wird auf x86-Hardware drastisch schneller, ohne GPU. Wichtig: Der PR ist noch nicht gemergt, und der Gewinn gilt nur für Q2_0 – nicht für Q4/Q5-Quants.
- MEINUNG07. Aug.DeepSeek-V4-Flash-0731 auf AMD MI325X mit vLLM: Tool-Calling stark fehlerhaftWer DeepSeek-V4-Flash auf AMD-GPUs mit vLLM und Tool-Calling betreiben möchte, muss mit tiefgreifenden Problemen rechnen – möglicherweise liegt ein Bug im ROCm-Backend, Chat-Template oder DeepSeek-V4-spezifischen Parser vor. Produktiver Einsatz von Agenten-Workflows ist unter dieser Konfiguration aktuell nicht zuverlässig möglich.
- MEINUNG07. Aug.Custom-Wasserkühlungs-Build mit vier Radeon 7900 XTX und 96 GB VRAM96 GB vereinter VRAM ermöglicht das Ausführen sehr großer Modelle lokal ohne Cloud-Abhängigkeit. Der Build zeigt eine kosteneffiziente AMD-Alternative zu NVIDIA-Profi-Hardware für anspruchsvolle Local-LLM-Workloads.
- FUNDING07. Aug.AMD übernimmt Taalas zur Stärkung im KI-Inferenz-MarktAMD setzt mit der Taalas-Übernahme auf Enterprise-Inferenz und lässt consumer-nahe Hardware-Konzepte fallen. Für Builder, die auf AMD-Hardware für lokale Inferenz setzen, sinkt die Chance auf dedizierte Consumer-Modell-Chips weiter.
- BENCHMARK07. Aug.EschaLabs Qwen3-35B-A3B W2-Quant: 2× schneller als Q5 bei ähnlicher QualitätFür VRAM-limitierte Nutzer (unter 13 GiB) ermöglicht die W2-Variante das lokale Ausführen eines 35B-MoE-Modells ohne CPU-Offload bei deutlich höherem Durchsatz. Die Perplexität ist ~22 % schlechter als Q5, praktische Benchmarks (GSM8K, IFEval, HumanEval) zeigen jedoch kaum Unterschiede.
- MEINUNG07. Aug.Community-Diskussion: RTX 3090 gegen zwei AMD Pro R9700 für 64 GB VRAM64 GB VRAM für ~2.900 USD sind für lokale LLM-Nutzer attraktiv, aber CUDA-zu-ROCm-Wechsel, unsichere Power-Limits und proprietäre Lenovo-Stromkabel-Probleme können den praktischen Nutzen erheblich einschränken.