AMD — Juli 2026
77 Beiträge im Juli 2026.
- MEINUNG31. JuliCommunity wünscht sich neue 70-80B MoE-Modelle für lokale InferenzFür lokale AI-Builder mit begrenztem GPU-Budget (hier: AMD V620 + ROCm) bleibt die 70-80B-Klasse eine Performancelücke – doppelte Token-Rate gegenüber 120B-Modellen wäre für agentische Coding-Tasks entscheidend. ROCm-spezifische Probleme mit Multi-GPU-Splitting (-sm tensor) zeigen praktische Infrastruktur-Hürden auf.
- BENCHMARK30. JuliAMD Lucebox schlägt Nvidia DGX Spark um 3,63× bei DeepSeek V4 Flash DecodeFür AI-Builder zeigt das Setup, dass heterogene Consumer-Hardware (GPU + APU mit großem Unified Memory) proprietäre Hochleistungssysteme bei Inferenz großer MoE-Modelle deutlich übertreffen kann. Aktuell noch experimentell (Q2, 16k Kontext); KVFlash für 64k–128k Kontext ist in Arbeit.
- LAUNCH29. JuliAndrew Ng gründet LearnVector mit 100 Mio. Dollar Coursera-InvestitionLearnVector setzt auf agentische KI, die individuelle Lernpfade plant und anpasst – als bewusste Abgrenzung zu unkontrollierten Chatbots, die laut Forschung das Lernen hemmen. Relevant für alle, die KI-gestützte Bildungsprodukte mit pädagogischen Guardrails entwickeln wollen.
- BENCHMARK28. JuliDeepSeek V4 Flash erreicht 32 tok/s auf AMD Ryzen AI MAX+ 395Mit dem eigens entwickelten ROCmFPX-Mixed-Precision-Format (2,88 bit/Parameter, 102,3 GB) lässt sich ein 284B-Modell auf Consumer-Hardware mit 128 GB Unified Memory betreiben. Das zeigt einen konkreten Weg für On-Device-Inference großer MoE-Modelle auf AMD-Systemen ohne dedizierte GPU.
- MEINUNG27. JuliCommunity-Check: AMD AI PRO R9700 Performance für lokale LLMsNutzer mit 4× R9700 könnten laut Post in den Bereich von DeepSeek-4-Flash-Inferenz vordringen – konkrete PP/TG-Zahlen aus der Community helfen, das reale Preis-Leistungs-Verhältnis dieser Budget-Karten für lokale Inferenz einzuschätzen.
- BENCHMARK27. JuliOrnith-397B auf einer RTX PRO 6000 Blackwell: 2.354 tok/s Prefill, ~20–24 tok/s DecodeSehr große MoE-Modelle lassen sich mit Krasis ohne Multi-GPU-Setup interaktiv betreiben – relevant für alle, die frontier-scale Inferenz auf einzelner Workstation-GPU ausprobieren wollen. Mit 256 GB DDR5-RAM und einer RTX 5090 sind sogar ~7,9 tok/s Decode möglich.
- LAUNCH27. Julillmux: Open-Source-Tool verwaltet vLLM- und llama.cpp-Modellprofile zentralTeams, die häufig zwischen lokalen Modellen wechseln, sparen manuelle Konfigurationsarbeit und reduzieren Fehlerquellen. Voraussetzung sind Linux, NVIDIA-GPU und Docker – macOS und AMD/ROCm werden aktuell nicht unterstützt.
- FORSCHUNG26. JuliLTT Labs testet AMD Ryzen AI Halo Dual-Cluster mit RPCPraxiserfahrung mit AMD Ryzen AI Halo Clustering via RPC zeigt, dass Skalierung auf zwei Geräte keine klaren Performancegewinne liefert. Für Entwickler, die lokale LLM-Inferenz auf AMD-Hardware skalieren wollen, lohnt sich ein Blick auf die geteilten Rohergebnisse.
- MEINUNG26. JuliReddit-Debatte: Wer gewinnt die Pro-vs.-Anti-Open-Source-AI-Schlacht?Die Einschätzung zeigt, dass OSS-AI trotz starker Tech-Unterstützung durch skeptische Haltungen in Finanz-, Verteidigungs- und Regierungssektoren gebremst wird – relevant für alle, die regulatorische Rahmenbedingungen für Open-Source-Modelle einschätzen wollen.
- BENCHMARK25. JuliMI50 Power-Throttling-Tests: 50W als optimaler Betriebspunkt für InferenzFür Inferenz-Deployments mit MI50-Hardware lässt sich durch Power-Capping auf 50W die Energieeffizienz massiv steigern (0,458 vs. 0,173 t/s/W) bei kaum spürbarem Gen-Speed-Verlust – relevant für Betriebskosten und Kühlung im Homelab- und Edge-Einsatz.
- LAUNCH25. JuliCloudflare führt neue AI-Traffic-Optionen für Website-Betreiber einWebsite-Betreiber erhalten granularere Kontrolle darüber, welche AI-Crawler ihre Inhalte indexieren oder für Training nutzen dürfen – relevant für alle, die Inhalte vor unerwünschtem AI-Scraping schützen oder gezielt freigeben wollen.
- MEINUNG25. JuliHeimnetz-LLM-Setup: 7800XT Desktop als headless Inferenz-Server für MacZeigt ein praxisnahes Heimnetz-Setup für lokale LLM-Inferenz mit AMD-GPU unter Windows HIP und Llama.cpp. Relevant für Builder, die GPU-Leistung vom Desktop auf mobile Geräte auslagern wollen, ohne Cloud-Abhängigkeit.
- BENCHMARK25. JuliTensorSharp vs. llama.cpp: Benchmark-Vergleich auf CUDA und VulkanFür lokale Inferenz bietet TensorSharp eine OpenAI/Ollama-kompatible Alternative zu llama.cpp mit CUDA-, Vulkan-, Metal- und MLX-Support sowie Features wie Paged KV Cache und Continuous Batching – relevant für Windows/macOS/Linux-Deployments ohne Python-Stack.
- MEINUNG25. JuliIntel Z890/Arrow Lake: PCIe P2P für Multi-GPU-KI-Workloads defektWer Multi-GPU-Setups für Inferenz oder Training (z.B. mit vLLM und Tensor Parallelism) plant, muss auf AMD- oder Intel-Workstation/Server-Plattformen mit funktionierendem PCIe P2P ausweichen — Z890-Boards sind für diesen Use-Case unbrauchbar, auch mit gepatchten NVIDIA-Treibern.
- LAUNCH24. JuliAMD veröffentlicht Instella-MoE-16B-A3B als Open-Source-ModellAMD betritt mit einem eigenen Open-Source-MoE-Modell den Bereich der Foundation Models. Für Local-LLM-Nutzer ist es interessant, da die aktive Parameterzahl von 3B bei moderaten Hardwareanforderungen eine gute Inferenzeffizienz verspricht.
- LAUNCH24. JuliOpenAI bringt ChatGPT Voice in die Desktop-App zur AgentensteuerungEntwickler können nun komplexe mehrstufige Aufgaben – wie Pull Requests erstellen oder Bug-Ursachen finden – per Sprachbefehl an Codex delegieren. Die Integration von GPT-Live ermöglicht gleichzeitiges Sprechen, Zuhören und Koordinieren von Workflows im Desktop-Kontext.
- MEINUNG24. JuliCommunity-Diskussion: AMD Kernel-Optimierungen in llama.cppFür lokale Inferenz auf AMD-Hardware ist die Kernel-Optimierung ein aktives Community-Thema. Wer llama.cpp auf AMD betreibt, könnte von Projekten wie kernel-anvil profitieren – konkreter Mehrwert ohne weiterführende Quellen jedoch schwer beurteilbar.
- LAUNCH23. JuliAMD stellt Helios Rack-Scale-System vor – Konkurrenz für NvidiaHelios soll Nvidias Vera Rubin in mehreren Performance-Metriken übertreffen und bietet AI-Labs erstmals eine skalierbare Alternative auf Rack-Ebene. Anthropic und AMD vereinbarten bereits eine strategische Partnerschaft für bis zu zwei Gigawatt GPU-Kapazität über das neue System.
- MEINUNG23. JuliGoogle als einziger Full-Stack-Rivale zu NVIDIA – eine TheseFür AI-Builder relevant, weil die These erklärt, warum Chip-Specs allein kein verlässliches Entscheidungskriterium für Infrastrukturwahl sind – vertikale Integration des Anbieters (Compiler, Frameworks, Cloud-Ops) bestimmt maßgeblich die praktische Einsetzbarkeit.
- FUNDING22. JuliAMD investiert bis zu 5 Mrd. USD in Anthropic und liefert 2 GW AI-GPUsAnthropic baut sein Compute-Fundament massiv aus und diversifiziert Hardware-Lieferanten über Nvidia hinaus. Für AI-Builder signalisiert die MI450-Helios-Kombination einen ernstzunehmenden Alternativ-Stack zu CUDA – relevant für zukünftige Infrastrukturentscheidungen.
- BENCHMARK22. JuliPoolside Laguna S 2.1 läuft lokal auf 3× AMD V620 mit 96 GB VRAMZeigt, dass Laguna S 2.1 mit Consumer-naher Hardware (3× AMD V620 à ~350 USD) bei 256K Kontext lokal lauffähig ist. Ohne dflash-Optimierung werden bereits brauchbare Inferenzgeschwindigkeiten erreicht – relevant für Selbsthosting-Setups mit AMD-GPUs.
- LAUNCH21. Julillama.cpp PR steigert Prompt-Processing via ROCm um 15%, Q2_K 28× schnellerAMD-GPU-Nutzer mit extremen Quantisierungen (Q2_K) profitieren direkt: Der Bug-Fix macht vorher kaum nutzbare Quant-Setups praxistauglich. Der allgemeine 15%-Boost verbessert die Inferenz-Effizienz bei lokalen Deployments auf ROCm-Hardware spürbar.
- GERÜCHT20. JuliMicrosoft setzt auf AMD Helios, Anthropic testet ebenfalls AMD-HardwareNvidias Preissetzungsmacht im KI-Chip-Markt gerät unter Druck, wenn große Hyperscaler und führende KI-Labs aktiv AMD-Alternativen evaluieren. Für AI-Builder könnte das mittelfristig günstigere Infrastrukturkosten bedeuten.
- LAUNCH20. JuliUnsloth unterstützt jetzt AMD-Hardware für Training und InferenzAMD-Nutzer können Unsloth nun nativ für Fine-Tuning, RL und Inferenz einsetzen – inkl. automatisch installierter ROCm/Triton/bitsandbytes-Builds. Besonders relevant für Strix-Halo/Ryzen-AI-Max-Systeme ohne dedizierte GPU.
- LAUNCH20. JuliLinux-Patches führen KNOD für In-Kernel-Netzwerk-Offloading zu AMD-GPUs einKNOD könnte Latenz und CPU-Overhead bei netzwerkverteiltem GPU-Inferenz-Betrieb deutlich reduzieren – relevant für Multi-Node-Setups, die lokale Modelle über mehrere Maschinen hinweg ausführen.
- MEINUNG19. JuliQwen 3.6 27B lokal: Kontext-Vergessen bei Agentenaufgaben mit OpencodeBeim Einsatz großer lokaler Modelle in Agenten-Pipelines zeigt sich, dass hoher initialer Kontextverbrauch (45–55k Tokens) und lange Runs auch bei 105k CTX zu Instruktionsverlust führen können – unabhängig von Quantisierungsstufe oder KV-Cache-Format. Wer ähnliche Setups plant, sollte Kontext-Checkpointing und Prompt-Kompression frühzeitig einplanen.
- MEINUNG19. JuliNutzer berichtet von Abstürzen beim lokalen LLM-Training mit RTX 5090Für AI-Builder zeigt der Fall typische Hardware-Stolperfallen beim Aufbau lokaler GPU-Workstations: RTX-5090-Systeme erfordern optimierte Gehäusebelüftung, ausreichend dimensionierte Netzteile und ggf. Raumklimatisierung – besonders in warmen Klimazonen.
- GERÜCHT18. JuliFastFlowLM wird Teil von AMD zur Stärkung der AI-InferenzAMD verstärkt seine Inferenz-Kompetenz durch die Übernahme des FLM-Teams. Konkrete technische Details oder Produkt-Roadmaps sind aus dem Post nicht ableitbar.
- LAUNCH18. JuliGepatchter NVIDIA-Treiber schaltet CMP 170HX auf 64 GB HBM2e und 173 TFLOPS freiDie CMP 170HX ist gebraucht günstig verfügbar; mit diesem Patch wird sie zu einer ernstzunehmenden lokalen Inferenz-GPU mit 64 GB HBM2e. PCIe x4 bleibt Hardware-Limitation, limitiert aber nur den Host-Transfer, nicht die On-Device-Rechenleistung.
- MEINUNG18. JuliGLM-5.2 CPU-Inferenz auf EPYC 9654: Nutzer teilt llama.cpp Launch-SkriptDas Skript zeigt praxisnahe llama.cpp-Parameter für große CPU-only-Deployments mit NUMA, MLA, DSA und Q8_0-KV-Cache. Die niedrige Decode-Rate verdeutlicht die Speicherbandbreiten-Grenzen von DDR5 bei großen Modellen – relevant für alle, die LLMs ohne ausreichend VRAM auf Server-CPUs betreiben.
- MEINUNG18. JuliAMD Ryzen 9 9900X vs. Intel Ultra 7 270K: CPU-Wahl für lokalen 2×RTX-3090-ServerFür lokale Inferenz mit mehreren Consumer-GPUs ist die CPU-Wahl bei Prompt-Processing-Geschwindigkeit relevant: AMDs Infinity Fabric kann bei hoher PCIe-Last zum Flaschenhals werden, Intel Ultra CPUs fehlt aktuell AVX512 – beides wirkt sich direkt auf Token-Durchsatz aus.
- BENCHMARK18. JuliCustom Q8-Quant für AMD R9700 bringt 5,8 % Decode-SpeedupWer AMD R9700s (gfx1201) lokal betreibt, kann mit dem ROCmFPX-Fork und dem custom Quant messbare Inferenz-Gewinne erzielen – allerdings nur nach manuellem Build; Standard-Tools wie llama.cpp, Ollama oder vLLM sind inkompatibel.
- GERÜCHT18. JuliAMD Instinct MI350P: HBM-PCIe-KI-Beschleuniger aufgetauchtKonkreter Mehrwert ohne Volltext nicht beurteilbar. Der PCIe-Formfaktor deutet auf eine breitere Kompatibilität mit bestehender Server-Hardware hin, was den Einsatz im lokalen/Enterprise-Bereich erleichtern könnte.
- MEINUNG17. JuliPraxisbericht: Bonsai-Ternary-27B auf RTX 4060Ti 16GB für Agenten-WorkflowsFür lokale Agenten-Setups zeigt der Bericht, dass 27B-Ternary-Modelle auf Consumer-Hardware (16GB VRAM) praxistauglich sind, aber bei Prefill-Geschwindigkeit und Instruktionstreue hinter Cloud-Alternativen wie Gemma 4 26B QAT oder Qwen 3.6 35B zurückbleiben. dspark-Spekulation ist im PrismML-Fork aktuell gebrochen.
- FUNDING17. JuliGeneral Compute sichert sich $400-Mio.-Kredit für Inferenz-Chip-InfrastrukturInferenz-spezialisierte Non-Nvidia-Chips werden erstmals als bankfähige Sicherheiten akzeptiert – ein Signal, dass sich Kapital gezielt um kostengünstige Open-Source-Inferenzinfrastruktur organisiert und Nvidias Dominanz im Compute-Markt unter Druck gerät.
- MEINUNG17. JuliCommunity-Debatte: Sind 700B+ Open-Weight-Modelle noch wirklich "lokal"?Für selbst-hostende AI-Builder verschiebt sich der praktische Nutzen von Open-Weight-Releases: Modelle mit 700B+ Parametern erfordern Enterprise-Hardware und sind damit für die Mehrzahl der Community de facto so geschlossen wie proprietäre Modelle.
- BENCHMARK16. Julillama.cpp Speculative Decoding: N-Gram-Stack erreicht 6x Speed-up bei CodingFür lokale Coding-Workflows mit llama.cpp ist die kostenlose N-Gram-Schicht auf DFlash ein sofortiger Gewinn: 321 vs. 53 tok/s bei 18-Turn-Coding-Sessions, lossless (verifiziert via MATH-500 & LiveCodeBench). Der Speed-up wächst mit der Session-Länge, da mehr Kontext mehr Kopiervorlagen bietet.
- BENCHMARK16. Julillama.cpp-Update beschleunigt DeepSeek V4 Flash auf Budget-Hardware um 3×CPU-offloaded Inferenz großer MoE-Modelle wird durch llama.cpp-Optimierungen zunehmend praxistauglich – auch auf Consumer-Hardware ohne Highend-GPU. AI-Builder können 98-GB-Modelle bereits mit ~150 € GPU + günstigem DDR5-RAM betreiben.
- MEINUNG16. JuliAlte Mining-Rigs mit 6× RX 470 8 GB für ~100 USD: 48 GB VRAM günstig?48 GB VRAM für ~100 USD klingt verlockend, aber RX 470 sind alte AMD-GPUs mit eingeschränktem ROCm-Support und geringer Rechenleistung – Kompatibilität und Treiber-Aufwand können den Preisvorteil schnell auffressen.
- LAUNCH16. JuliAMD ROCm 7.14 „TheRock" Tech Preview für neuesten GPU-Compute-Stack getaggtFür lokale LLM-Nutzer mit AMD-Hardware könnte ROCm 7.14 verbesserte Kompatibilität und Performance auf aktuellen AMD-GPUs bringen. Konkreter Mehrwert ohne Volltext nicht vollständig beurteilbar.
- MEINUNG15. JuliQwen3.5 122B A10B mit Q2-Quant in 64 GB RAM: Praxisbericht CPU-InferenzFür CPU-only-Setups mit 64 GB RAM zeigt der Bericht, dass UD-Q2_K_XL-Quants trotz aggressiver Komprimierung qualitativ überzeugen können – aber prompt-processing-Engpässe agentic Workloads praktisch ausschließen. DDR5-5600 würde die Geschwindigkeit auf ~6 tok/s fast verdoppeln.
- FORSCHUNG15. JuliGrok 4.5 optimiert Parakeet CPU-ASR auf bis zu 2,1× schnelleres STTStatisches QDQ-MinMax-Quantisieren per Channel am Encoder bringt ohne GPU-Hardware messbare Speedups bei unveränderter Qualität (WER ~0). Für CPU-gebundene STT-Deployments ist das eine konkret nachvollziehbare Optimierungsroute mit veröffentlichten Skripten.
- FORSCHUNG15. JuliFBI: KI-gestützte Sprachklonfraude verursacht 893 Mio. Dollar Schaden in 2025KI-Sprachklone sind mit minimalem Aufwand einsetzbar und laut INTERPOL rund 4,5× profitabler als klassischer Betrug. Für AI-Builder bedeutet das: Plattformen, die Voice-Cloning anbieten, stehen unter zunehmendem regulatorischem Druck, da Consumer Reports bei vier von sechs geprüften Anbietern kaum wirksame Missbrauchsschutzmaßnahmen fand.
- BENCHMARK15. Juliggml-ZenDNN: Q8_0-Quantisierung für AMD EPYC bringt bis zu 213% Prompt-SpeedupWer llama.cpp auf AMD EPYC-Servern betreibt, kann mit diesem Patch die Prompt-Processing-Geschwindigkeit bei Q8_0-Modellen drastisch steigern — besonders bei langen Prompts. Decoding-Throughput (tg128) bleibt dabei nahezu unverändert.
- MEINUNG15. JuliCommunity-Bericht: Ternary Bonsai 27B DFlash bringt keinen Speed-up unter ROCmTernäre Quantisierung verspricht schnellere Inferenz, scheint aber unter ROCm (AMD) aktuell nicht zu funktionieren. AI-Builder mit AMD-GPUs sollten vor dem Einsatz auf Community-Feedback zu ihrer Plattform achten.
- LAUNCH15. JuliQwen 3.5 122B Heretic als ROCm-FP4-iMatrix-Quant für Strix HaloDas Quant ermöglicht das lokale Ausführen eines 122B-MoE-Modells auf AMD-Strix-Halo-Hardware (z. B. Ryzen AI Max) mit akzeptabler Qualitätsabweichung (KLD ~0,10) und über 28 tok/s – relevant für ROCm-Nutzer ohne NVIDIA-GPU.
- MEINUNG14. JuliLocalLLaMA-Community diskutiert Radeon Pro V620 als günstige GPU-OptionFür lokale LLM-Setups sind ROCm-Kompatibilität und Software-Support bei AMD-Karten oft die entscheidenden Hürden – die Community-Diskussion kann praktische Hinweise zu Treiber- und Framework-Unterstützung der V620 liefern.
- MEINUNG14. JuliRyzen AI Halo (Strix Halo) für 10–15 % schnellere LLM-Inferenz konfigurierenWer lokale Inferenz auf Ryzen-AI-Halo-Hardware betreibt, kann ohne Hardware-Upgrade spürbare Geschwindigkeitssteigerungen erzielen. Die genauen Konfigurationsschritte sind im verlinkten Reddit-Post dokumentiert.
- MEINUNG14. JuliFrankenbox: Drei GPUs (9070 XT, 1080 Ti, 5700 XT) in einem Single-GPU-CaseZeigt einen praxisnahen Workaround für VRAM-Limitierungen unter Local-LLM-Betrieb in Märkten mit hohen GPU-Preisen: Oculink-eGPU-Anbindung via M.2 ermöglicht Multi-GPU-Setups ohne teures High-End-Einzelmodell.
- FORSCHUNG12. JuliCommunity-Experiment: Gemma4-31B auf 40,5B Parameter durch Layer-Insertion erweitertDie Methode zeigt, dass Layer-Insertion in bereits feingetunte Modelle möglich ist, ohne das Modell zu ruinieren – relevant für alle, die Modellkapazität nachträglich erhöhen wollen. Zwei-Phasen-Training (erst neue Layer einfrieren, dann alles gemeinsam trainieren) ist der Schlüssel.
- BENCHMARK11. JuliEPYC 9374f vs. 9135: CPU-Benchmarks für lokale LLM-Inferenz mit ik_llama.cppMehr CCDs bedeuten bei CPU-Inferenz nicht automatisch mehr TG-Durchsatz; Thread-Zahl und NUMA-Topologie sind entscheidend. Für LLM-Builder: 9374f liefert bei 48 Threads ~12 t/s TG (vs. ~8,7 t/s beim 9135), bringt beim PP aber kaum Gewinn.
- LAUNCH10. JuliVoice-Assistent auf CPU: Qwen3-ASR und Kokoro-TTS ONNX ohne GPUASR und TTS vollständig auf CPU auszulagern ermöglicht es, die GPU exklusiv für das LLM zu nutzen. Der öffentliche Code zeigt, dass brauchbare Latenzen auf Consumer-Hardware (M2, Ryzen 9) bereits erreichbar sind.
- MEINUNG09. JuliLM Studio ROCm ab v2.22 erkennt Radeon RX 6900 XT nicht mehrAMD-GPU-Nutzer, die LM Studio für lokale Inferenz einsetzen, sollten vorerst bei ROCm v2.21 bleiben, bis ein Fix verfügbar ist. Der Fehler blockiert GPU-beschleunigtes Inferencing auf RDNA 2-Hardware vollständig.
- BENCHMARK09. Juli6x AMD MI50 vs. 6x NVIDIA P40: MiniMax M2.7 139B lokal benchmarkedFür Local-LLM-Builder zeigt der Vergleich: Hohe HBM2-Bandbreite der MI50 (~1.024 GB/s) hilft beim Decode, aber ROCm-Reife und VRAM-Kapazität der P40s überwiegen beim Prefill massiv. Ältere GDDR5-Karten mit mehr VRAM können bei großen Modellen trotz schlechterer Specs konkurrenzfähig bleiben.
- LAUNCH09. JuliMeta startet Produktion eigener KI-Chips (MTIA) im SeptemberMeta reduziert seine Nvidia-Abhängigkeit durch eigene MTIA-Chiplets im modularen Design – AI-Builder sollten beobachten, wie sich dadurch Verfügbarkeit und Preise für GPU-Kapazität am Markt verschieben. Das Capex-Budget von 125–145 Mrd. USD signalisiert den Maßstab des Infrastrukturwettbewerbs.
- MEINUNG09. Julillama.cpp vs. vLLM auf AMD MI50: Community-Diskussion zu Tensor-Parallel-Supportllama.cpp hat Tensor-Parallel-Support nachgerüstet, was es für Multi-GPU-Setups mit Consumer- oder älterer AMD-Hardware als Alternative zu vLLM relevant macht – besonders wenn GGUF-Quants und schnelles Modell-Switching wichtig sind.
- LAUNCH08. JuliZML lanciert kostenlosen LLM-Inferenzserver für diverse AI-ChipsEnterprises und Cloud-Anbieter können mit ZML/LLMD verschiedene Chip-Hersteller kombinieren und so Kosten sowie Energieverbrauch senken, ohne auf Vendor-Lock-in angewiesen zu sein. Das Tool ist aktuell kostenlos, ein Bezahlmodell ist für später geplant.
- BENCHMARK07. JuliDFlash in llama.cpp: 4,44× schnellere Inferenz bei 36K Kontext auf RTX 6000 PRODFlash schlägt MTP-Speculative-Decoding bei jeder Draft-Länge und skaliert besser mit wachsendem Kontext – ein direkter Vorteil für lokale Long-Context-Workloads. Der Overhead beträgt ~5 GB VRAM für den Q8-Drafter; ab llama.cpp PR #22105 ist es produktionsbereit.
- BENCHMARK07. JuliKV-Quantisierung bei Qwen3.6-27B: KLD-Vergleich Q8, Q6, Q5Wer Qwen3.6-27B lokal betreibt, sollte (q8_0, q8_0) für den KV-Cache wählen – der VRAM-Overhead ist minimal. V-Cache auf q4_0 zu senken schadet deutlich mehr als K-Cache-Quantisierung; Q6 mit vollem KV ist Q8 mit q4_0-V nahezu gleichwertig.
- BENCHMARK07. JuliAutomationBench-AA: Claude Fable 5 führt Agenten-Eval mit 48,6 %Das offene Modell-Feld komprimiert sich rasant: Hy3 konkurriert mit deutlich größeren Systemen und läuft ab Launch nativ in vLLM mit bis zu 2,95× Decode-Speedup. Agenten-Evals zeigen, dass alle Top-Modelle noch Business-Rules brechen – Kosten pro Task werden zum entscheidenden Differenzierungsmerkmal.
- LAUNCH06. JuliPyTorch Monarch unterstützt jetzt AMD GPUs via ROCmAI-Teams, die auf AMD-Hardware setzen, können künftig Monarch für fehlertolerantes verteiltes Training nutzen – relevant bei großen Clustern, wo Hardwareausfälle als Normalfall gelten, nicht als Ausnahme.
- LAUNCH06. JuliGMKtec EVO-X3: Neuer Strix-Halo-Mini-PC mit OCuLink für $3.600OCuLink ermöglicht eine direkte, verlustarme Verbindung zu einer Desktop-GPU – relevant für Local-LLM-Nutzer, die Inferenz-Performance über eine externe GPU maximieren wollen. Der Preis liegt jedoch mehr als doppelt so hoch wie bisherige Strix-Halo-Geräte (~$1.600).
- LAUNCH06. JuliAMD Ryzen AI Halo: 4.000-Dollar-Dev-Kit für lokale KI-EntwicklungEin dediziertes 4k-Dev-Kit von AMD senkt die Einstiegshürde für lokale LLM-Entwicklung auf x86-Hardware und könnte als Alternative zu Apple Silicon für On-Device-AI-Workflows relevant werden.
- GERÜCHT06. JuliNvidia Kyber NVL144 auf 2028 verschoben, Rubin Ultra gestrichenDie Verzögerung und Streichung von Rubin Ultra öffnen AMD und Google ein Zeitfenster, um im High-End-KI-Infrastrukturmarkt aufzuholen. Unternehmen, die auf Kyber-Hardware für 2027 geplant haben, müssen ihre Beschaffungsstrategie überarbeiten.
- BENCHMARK06. Julillama.cpp: -ffast-math für HIP-Builds bringt bis zu 7% Prompt-Speedup auf RDNA3.5AMD-GPU-Nutzer von llama.cpp können mit diesem Compiler-Flag kostenlosen Prompt-Throughput gewinnen – ohne Modelländerung. Besonders relevant für Strix-Halo-APUs mit großem iGPU-Speicher.
- MEINUNG05. JuliCommunity-Frage: Coding-Modelle für AMD Ryzen 395 mit 125 GB DDR5125 GB DDR5-Unified-Memory ermöglichen das Ausführen großer lokaler Modelle (70B+). Die Community-Antworten können als Orientierung dienen, welche Coding-Modelle auf vergleichbarer Consumer-Hardware praktisch nutzbar sind.
- GERÜCHT03. JuliCommunity wartet ungeduldig auf AMDs Gorgon Halo mit 192 GB Unified Memory192 GB Unified Memory würde es ermöglichen, Modelle mit ~300B Parametern lokal auszuführen – ein potenzieller Wendepunkt für Consumer-Hardware. Bislang gibt es jedoch keine konkreten Hinweise auf einen baldigen Launch.
- LAUNCH03. JuliAMD veröffentlicht Micro-World: Open-Source interaktives World-Model auf Wan2.1-BasisEntwickler erhalten ein vollständig quelloffenes World-Model inklusive Trainings- und Inferenzcode sowie kuratiertem Datensatz – direkt einsetzbar für kontrollierbare Videogenerierung und interaktive Szenenmodellierung ohne Eigenentwicklung der Infrastruktur.
- MEINUNG03. JuliMojo Max unterstützt keine V100-GPUs – Turing (RTX 20) ist MinimumWer ältere Nvidia-Hardware wie V100-Cluster betreibt, kann Mojo Max nicht nutzen. AMD-Kompatibilität mit älteren GPUs wurde ebenfalls relativiert – Prüfung der Hardwareanforderungen vor dem Einsatz ist Pflicht.
- MEINUNG03. JulivLLM auf Dual AMD R9700 mit ROCm: Qwen3.6-27B startet nichtMulti-GPU-ROCm-Setups mit vLLM bleiben für große Modelle wie 27B-Parameter-Klassen fehleranfällig. Das konkrete Fehlerbild (shm_broadcast-Timeout nach langem Warmup) ist ein bekanntes Muster bei RCCL/Tensor-Parallelismus-Konfigurationen und zeigt Optimierungsbedarf im ROCm-Stack für Consumer-Hardware.
- FORSCHUNG02. JuliHIP-Kernel-Generierung für AMD-GPUs mit Multi-Agent und RL verbessertKonkreter Mehrwert ohne Volltext nicht beurteilbar – der Ansatz könnte jedoch die lokale LLM-Inferenz auf AMD-Hardware durch optimierte Kernel spürbar verbessern.
- BENCHMARK02. JuliDual AMD R9700 mit Qwen3.6-27B: ROCm schlägt Vulkan beim PrefillFür Multi-GPU-Setups mit AMD unter llama.cpp zeigt der Praxisvergleich: ROCm sättigt beide GPUs beim Prefill (1355 vs. 683 t/s), während Vulkan nur eine GPU gleichzeitig nutzt. Split-Mode und PCIe-Bandbreite bleiben Engpässe bei TG.
- BENCHMARK02. JuliDisaggregiertes Prefill/Decode: DGX Spark + Strix Halo laufen Qwen 122B mit 4,4× SpeedupFür lokale Agentic-Workloads mit langen Kontexten (z.B. OpenCode) kann disaggregiertes PP/TG über zwei Consumer-nahe Maschinen die Time-to-First-Token drastisch senken. Der Ansatz ist mit llama.cpp umsetzbar und zeigt, dass heterogene Hardware-Kombinationen reale Engpässe lösen können.
- LAUNCH02. JuliLokales RPG-Modell RPG-HaloTales-V1 mit Multimedia-Erlebnis veröffentlichtWer lokale Rollenspiel-Anwendungen mit Multimedia-Unterstützung bauen möchte, kann RPG-HaloTales-V1 als Basis nutzen – ohne Cloud-Abhängigkeit. Konkreter Funktionsumfang ohne vollständige Dokumentation nur begrenzt beurteilbar.
- MEINUNG01. JuliCommunity-Diskussion: Tenstorrent p150a als lokale AI-GPU im PraxistestTenstorrent positioniert sich als günstige Alternative zu Nvidia für lokale Inferenz. Reife des Software-Stacks und Multi-Card-Unterstützung ohne PCIe-Flaschenhals sind die entscheidenden offenen Fragen für AI-Builder, die in die Plattform einsteigen wollen.
- LAUNCH01. JuliOpen Models Juni 2026: Überblick über Finetunes, Quantisierungen und ReleasesHardware-Anbieter NVIDIA, AMD und Intel quantisieren aktiv große Open-Weight-Modelle (u.a. Qwen3.5-397B, DeepSeek-V4-Pro, MiniMax-M3) in eigene Formate — AI-Builder erhalten damit hardwareoptimierte Varianten für effiziente lokale Inferenz.
- MEINUNG01. JuliLemonade Appliance: Privater KI-Server stößt an Hardware-GrenzenKonkreter Mehrwert ohne Volltext nicht beurteilbar. Der Beitrag deutet auf praktische Erfahrungen mit selbst gehosteten KI-Server-Setups hin, die für Local-LLM-Enthusiasten relevant sein könnten.