Perplexity — August 2026
28 Beiträge im August 2026.
- LAUNCH31. Aug.beellama-Fork optimiert kvarn KV-Quants: bis zu 76 % schnelleres Token-GenWer lokal auf begrenztem VRAM (z. B. 16 GB) mit langen Kontexten inferiert, kann durch diesen Fork kvarn-Quants ohne Geschwindigkeitsverlust bei tiefen Kontexten nutzen. Bei ctx 163 840 sollen die Ergebnisse mit regulären qx_x-Quants vergleichbar sein – allerdings ist die Auswirkung auf Qualität (KLD) noch ungeprüft.
- BENCHMARK27. Aug.Qwen3.8-Flash-Next durchbricht 94% auf privatem Cupel-BenchmarkQwen3.8-Flash-Next übertrifft größere Modelle wie Qwen 3.8 27B in Allgemeinwissen und Science auf lokalem Hardware-Setup. Für Local-LLM-Nutzer mit Apple Silicon relevant: MLX-mixed-4_8bit-Quant (pipenetwork) zeigt niedrigere Perplexität als Standard-4-bit, passt aber knapp in 128 GB RAM.
- LAUNCH25. Aug.Nvidia und Perplexity AI kooperieren für lokale Ausführung auf DGX SparkPerplexity AI kann damit direkt auf lokaler Hardware (DGX Spark) ausgeführt werden – relevant für Nutzer, die KI-Suche ohne Cloud-Abhängigkeit und mit mehr Datenkontrolle betreiben wollen.
- MEINUNG24. Aug.Community-Benchmark für Qwen3.8-27B Quants & KV-Cache geplantDie geplanten Ergebnisse sollen praxisnahe Fragen klären, die reine Perplexity-Zahlen nicht beantworten: ob höhere Quants mit 8-bit KV besser abschneiden als niedrigere mit 16-bit KV, und ob schwächere Quants auf langen Agentic-Tasks mehr Tokens/Steps verbrauchen – relevant für alle, die Qwen3-27B lokal auf 24–48 GB VRAM betreiben.
- FUNDING24. Aug.Nvidia verhandelt Investment in Perplexity bei über 30-Mrd-Dollar-BewertungNvidia investiert strategisch in KI-Startups, deren Wachstum direkt Chip-Nachfrage erzeugt – das Investment fließt so indirekt als Umsatz zurück. Für Builder zeigt dies, wie eng Infrastruktur-Anbieter und Anwendungsschicht finanziell verflochten werden.
- LAUNCH24. Aug.SHADOW-250M: Eigenes quantisiertes LLM aus 30B Tokens, 60 MB DeploymentDas Modell zeigt, dass ein Solo-Projekt mit begrenztem Budget ein vollständiges LLM mit extrem niedrigem Speicherbedarf und CPU-only-Betrieb realisieren kann – relevant für Edge-Deployments ohne Cloud-Abhängigkeit oder GPU-Hardware.
- MEINUNG23. Aug.Qwen3.8-27B: Community-Urteil nach einer Woche lokaler NutzungFür lokale Agentic-Setups ist Q4_K_M praktisch gleichwertig zu Q8 bei Perplexity, bricht aber laut Community unter Q6 bei komplexem Reasoning ein. Das Reasoning-Preset sollte aktiv auf Low/Medium gesetzt werden – xhigh ist für die meisten Use-Cases ineffizient und schadet der Context-Effizienz messbar.
- BENCHMARK21. Aug.Qwen3.8-27B auf RTX 5060 Ti 16GB: IQ4 vs. Q8, 64K-Kontext und Agent-BenchmarksUnsloth UD-IQ4_XS mit MTP-1 erreicht 45,6 tok/s bei 64K-Kontext und liegt perplexitätsmäßig nahezu auf Q8-Niveau (KLD 0,018). Die 27B-Modelle schlagen das 9B-Modell klar in Multi-Turn-Tool-Calling (38–40/80 vs. 29/80), während Single-Turn-BFCL beim 9B noch leicht besser ausfällt.
- FORSCHUNG21. Aug.Meta zählt zu Microsofts größten Azure-AI-Kunden mit hunderten Millionen DollarMeta nutzt OpenAI-Modelle via Azure Foundry intensiv zum Benchmarking, baut aber gleichzeitig einen eigenen API-Dienst als potenziellen Konkurrenten – ein Muster, das sich schon bei Bing zeigte. AI-Builder sollten die zunehmende Eigenentwicklung großer Hyperscaler im Blick behalten.
- LAUNCH21. Aug.Self-hosted Open-Source-Alternative zu Manus und Perplexity in EntwicklungWer eine datenschutzfreundliche, lokale Alternative zu Manus oder Perplexity sucht, könnte von diesem Tool profitieren. Besonders relevant: ~4000 generierte Websites als Testdaten und ein Write-up zur Zuverlässigkeit agentischer Loops könnten unabhängig vom Tool-Release wertvoll sein.
- BENCHMARK20. Aug.llama.cpp PR: AVX2-Optimierung beschleunigt IQ-Quants auf CPU um bis zu 1278%Wer IQ-Quants auf CPU für imatrix-Berechnungen oder Perplexitäts-Evaluierungen nutzt, könnte durch diesen PR drastisch kürzere Laufzeiten erzielen. Der Patch ist noch Draft/Open, aber die Benchmark-Daten auf AMD EPYC 9654 sind reproduzierbar und überzeugend.
- LAUNCH19. Aug.Qwen3.8-27B auf RTX 3090: 138 tps durch DFlash2 und Lookup-DraftingPrefix-Caching für Hybrid-Modelle reduziert Folge-Turn-Latenz von 23 s auf unter 1,35 s; der Lookup-Drafting-Kernel bringt +29 % Tokens/Schritt bei reproduktiven Tasks. Alle Patches sind Open Source und per Docker deploybar – direkt verwertbar für lokale Inferenz-Setups.
- BENCHMARK18. Aug.Perplexity gewinnt Millionen Nutzer in Indien durch Airtel-Gratis-DealDie Umsätze in Indien stiegen nach Ende der Gratis-Aktion um 60 %, was zeigt, dass Freemium-Partnerschaften mit Telekoms echte zahlende Nutzer erzeugen können. Für AI-Builder ist Indien trotz schwieriger Monetarisierung ein valides Skalierungslabor für Bundling-Strategien.
- MEINUNG17. Aug.Benchmark-Lücke: Quant-Modelle werden kaum systematisch evaluiertWer lokale Modelle deployt, trifft Kaufentscheidungen (VRAM vs. Qualität) auf Basis von Zahlen, die einen anderen Artefakt messen. Systematische Evals über Quantisierungsstufen hinweg – besonders für Long-Context und Tool-Calling – fehlen laut Post bisher vollständig.
- MEINUNG15. Aug.Anleitung: Gehackte Accounts bei ChatGPT, Claude und Perplexity erkennenWer KI-Plattformen produktiv nutzt, sollte wissen, wie er kompromittierte Sessions erkennt und beendet. Wichtig: Claude bietet kein Passwort und kein MFA – Kontosicherheit hängt allein an der E-Mail-Adresse des Nutzers.
- FORSCHUNG15. Aug.AI-Textdetektor von Grund auf bauen: End-to-End-Tutorial mit DistilBERT und RLVREntwickler erhalten eine vollständige Anleitung für einen lokalen AI-Detektor-API inkl. Browser-UI, der Scores von 0–100 liefert. Zusätzlich dient das Projekt als Fallstudie für Verifier-basiertes LLM-Training jenseits von Mathe/Code-Reasoning.
- MEINUNG14. Aug.LFM 2.5 2.6B überzeugt als kleines Modell für Tool UseFür AI-Builder, die kleine Modelle lokal für Agenten und Tool-Use-Pipelines einsetzen, könnte LFM 2.5 2.6B eine leistungsstarke Option ohne Nachtraining sein. Der Erfahrungsbericht ist jedoch anekdotisch und ohne quantitative Vergleiche.
- FORSCHUNG10. Aug.Hobbyist trainiert 1,1B-Parameter-LLM auf 20B Tokens für 200 USDDas Projekt zeigt konkret, dass das vollständige Pretraining eines 1B-Modells inklusive Instruction-Tuning für unter 200 USD realisierbar ist – nützlicher Referenzpunkt für Kostenplanung eigener LLM-Trainingsläufe auf Cloud-GPU-Marktplätzen wie vast.ai.
- LAUNCH10. Aug.WinterMix38: 3-Bit MLX-Quant von Qwen3.5-122B schlägt Unsloth GGUF bei Long ContextFür Apple-Silicon-Nutzer bietet WinterMix38 erstmals ein natives MLX-Modell, das bei langen Kontexten besser misst als das beste imatrix-GGUF – ohne Custom-Kernels, als Drop-in für LM Studio. MLX liefert laut Autor ~9× schnelleres Prefill als llama.cpp auf derselben Hardware.
- FORSCHUNG07. Aug.LFM2.5-2.6B Quantisierungsreport: Beste Konfiguration für 4- und 8-GB-GeräteFür Edge-Deployments zeigt der Report konkret, welche Quant-Kombination Qualität erhält und wo Degradation klippenartig einsetzt – inklusive Warnung vor irreführenden Metriken wie Logarithmic KLD und Top-1%-Plots. Abliteration kostet pauschal ~0,075 KLD.
- BENCHMARK07. Aug.llama.cpp PR beschleunigt Q2_0 auf x86-CPUs um Faktor 3,0–3,6×Lokale Inferenz mit Q2_0-Modellen (z. B. Bonsai-GGUFs) wird auf x86-Hardware drastisch schneller, ohne GPU. Wichtig: Der PR ist noch nicht gemergt, und der Gewinn gilt nur für Q2_0 – nicht für Q4/Q5-Quants.
- BENCHMARK07. Aug.EschaLabs Qwen3-35B-A3B W2-Quant: 2× schneller als Q5 bei ähnlicher QualitätFür VRAM-limitierte Nutzer (unter 13 GiB) ermöglicht die W2-Variante das lokale Ausführen eines 35B-MoE-Modells ohne CPU-Offload bei deutlich höherem Durchsatz. Die Perplexität ist ~22 % schlechter als Q5, praktische Benchmarks (GSM8K, IFEval, HumanEval) zeigen jedoch kaum Unterschiede.
- LAUNCH05. Aug.Reddit kündigt einschneidende Änderungen für old.reddit.com anEntwickler und Moderatoren, die auf old.reddit.com oder die Reddit-API setzen, müssen mit baldigen Einschränkungen rechnen. Ein konkreter Zeitplan fehlt, doch Reddit arbeitet aktiv daran, alle Drittanbieter-Apps auf die eigene Developer Platform zu migrieren.
- LAUNCH05. Aug.Shopify: KI-Suche verdreifacht Traffic und Orders, Google bleibt starkKI-Agenten erschließen den Long Tail des E-Commerce durch mehrdimensionale Produktsuche – 75 % der KI-attributierten Käufe entfielen auf Kategorien außerhalb der Top 100. Für Shopify-Händler bedeutet das bessere Konversionsraten ohne Abhängigkeit von Keyword-Rankings.
- LAUNCH05. Aug.Gericht erlaubt Perplexitys KI-Shopping-Agent zurück auf AmazonDies ist die erste bundesgerichtliche Entscheidung zur Rechtmäßigkeit von KI-Agenten auf Online-Plattformen im Auftrag von Nutzern – sie könnte die rechtliche Grundlage für die gesamte Agent-Industrie neu definieren und Plattformsperren gegen Drittanbieter-Agenten erschweren.
- BENCHMARK02. Aug.KV-Cache-Quantisierung bei DeepSeek V4 Flash verursacht erhebliche QualitätsverlusteWer DeepSeek V4 Flash lokal mit Q8 KV-Cache betreibt, riskiert messbare Ausgabeveränderungen. Im Gegensatz zu Qwen 397B ist Q8-KV-Quantisierung hier nicht verlustfrei – Nutzer sollten auf BF16 KV-Cache setzen oder die Einschränkung bewusst akzeptieren.
- LAUNCH02. Aug.WinterMix: Native-MLX-Quants von Qwen3.5-122B-A10B schlagen größere 6-bit-BuildsAuf Apple Silicon bietet MLX laut Messung ~9× schnelleres Prefill und ~20% schnellere Token-Generierung gegenüber llama.cpp. WinterMix ermöglicht damit hochqualitative lokale Inferenz von Qwen3.5-122B auf 128-GB-Macs, inklusive paralleler Agenten-Sessions, ohne Laufzeit-Anpassungen.
- BENCHMARK02. Aug.Expert-only IQ3-Requant von DeepSeek-V4-Flash-0731 mit 1,4× Decode-Speed auf CPU-Spill-RigFür Nutzer mit gemischten Multi-GPU-Setups, bei denen Experts in den RAM spillen, ermöglicht dieser Ansatz die 3-Bit-Qualitätsstufe ohne Drop auf Q2 – mit messbarer KLD-Verbesserung und 13,9 t/s statt 9,9 t/s. Achtung: bekannte SWA/Rollback-Stall-Bugs in llama.cpp betreffen alle DSV4-GGUFs.