RL — August 2026
21 Beiträge im August 2026.
- LAUNCH27. Aug.Barret Zoph wechselt als VP Research zu Google Gemini-TeamGoogle gewinnt einen erfahrenen RL- und Post-Training-Spezialisten für Gemini – ein Signal, dass der Wettbewerb um Top-Forschungstalente zwischen OpenAI und Google unvermindert anhält und OpenAI weiterhin kritische Mitarbeiter verliert.
- LAUNCH27. Aug.HuggingFace veröffentlicht Microduck: Open-Source-Roboter für 400 DollarEin erschwinglicher, open-source Heimroboter mit RL-Training und umfangreicher Sensorik senkt die Einstiegshürde für lokale Robotik-Experimente drastisch. Entwickler können Modelle direkt auf eigener Hardware trainieren und einsetzen, ohne Cloud-Abhängigkeit.
- FORSCHUNG26. Aug.DeepSeek-KI lernt sich selbst zu verbessernSelbstoptimierende Modelle könnten den manuellen Post-Training-Aufwand erheblich reduzieren. Konkreter Mehrwert ohne Volltext des Papers schwer beurteilbar — Details zur Methode und Benchmarks bleiben unklar.
- FUNDING26. Aug.Arga sichert 10 Mio. USD Seed für Enterprise-Agent-TrainingsumgebungenWer AI-Agenten auf Business-Software trainieren will, scheitert bisher an nicht rücksetzbaren Systemen. Arga schließt diese Lücke mit vollständigen Sandbox-Klonen inkl. Rechtesystemen – das ermöglicht RL-Training in Enterprise-Kontexten ähnlich wie es bei Coding-Agenten bereits Standard ist.
- LAUNCH25. Aug.2. World Humanoid Robot Games: Roboter brechen Rekorde – und in Flammen aufDie Spiele zeigen: Humanoide Roboter sind heute auf Einzelaufgaben optimiert, weit entfernt von echter Generalität. Praxisrelevanter sind die neu eingeführten Haushalts- und Rettungsszenarien – nur 3 von 12 Teams absolvierten die Feuerwehr-Challenge komplett.
- FORSCHUNG23. Aug.RL-Training für Bild-Generierung via Code: Qwen 3.5 35B malt mit p5.brushZeigt konkret, wie RL-Reward-Design für kreative Tasks scheitert und funktioniert: korrelierte Judge-Signale (0.85–0.95) bremsen das Training, paarweise Bewertung gegen kuratierte Referenzen entsperrt echten Fortschritt. Relevant für alle, die RL auf subjektiven, ästhetischen Aufgaben anwenden wollen.
- LAUNCH22. Aug.Inherent: DeepMind-Spin-off behauptet, Claude und GPT-5.5 bei Paper-Replikation zu schlagenFaraday basiert auf Qwen 3.6 (27B Parameter) und schlägt laut Eigenangabe deutlich größere Frontier-Modelle durch RL-Training mit Fokus auf wissenschaftlichem Urteilsvermögen – relevant für Teams, die kostengünstige spezialisierte Forschungsagenten bauen wollen.
- MEINUNG22. Aug.Simulation übernimmt KI-Pipeline: 10% schlechter, 100× billiger, 10.000× schnellerAlle wesentlichen Eingaben für KI-Training (Bewertung, Daten, Lehrer, Curriculum, Forschung, RL-Umgebungen) sind heute modellgeneriert. Für AI-Builder bedeutet das: Skalierung ist zunehmend eine Frage synthetischer Pipeline-Architektur, nicht menschlicher Annotation oder Kuratierung.
- LAUNCH19. Aug.OpenAI pausiert RL-Training aus SicherheitsgründenOpenAI setzt erstmals freiwillig die Bremse bei Frontier-Modellen – ein Präzedenzfall für voluntary pacing. Für AI-Builder bedeutet das: Sicherheits-Reviews können Deployment-Zeitpläne verschieben, was Produktplanung und API-Roadmaps beeinflussen kann.
- LAUNCH19. Aug.Pokelike.xyz als LLM- und RL-Benchmark: Open-Source-Harness auf RedditDas Framework ist vollständig konfigurierbar (System-Prompt, Tools, State-Repräsentation) und läuft lokal – ideal, um zu testen, wie viel Spielperformance sich mit kleinen Modellen und optimiertem Prompting herausholen lässt. Besonders interessant für RL-Forscher, die LLM-Agenten in strukturierten Spielumgebungen evaluieren wollen.
- MEINUNG19. Aug.Z.ai: Post-Training-Skalierung schlägt reine Parameteranzahl bei GLM-5.3Für AI-Builder zeigt das Experiment konkret: Bei gleicher Architektur und gleichem Parameterbudget kann ein Monat gezieltes RL-Post-Training signifikante Leistungssprünge erzeugen – besonders bei mehrstufigen Reasoning-Aufgaben. Die Wahl des nächsten Skalierungs-Hebels sollte datengetrieben, nicht konventionsgetrieben erfolgen.
- LAUNCH18. Aug.OpenAI verschärft Sicherheitsmaßnahmen nach Hugging Face-SicherheitsvorfallDas neue Monitoring-System prüft Tool-Aktionen, Reasoning-Traces und Aktivitätslogs mit einem Ziel-Alert-Fenster von 30 Minuten – allerdings auf Kosten von ~20 % Compute-Overhead. Frontier-RL-Läufe bleiben bis zur Validierung der Safeguards eingefroren, was Trainings-Zeitpläne für die leistungsfähigsten Modelle verzögert.
- FORSCHUNG16. Aug.Red-Queen-Hypothese als neuer Ansatz für selbstverbessernde KIDer evolutionsbasierte Ansatz könnte eine Alternative zu klassischen RL-Methoden bieten, bei der KI-Systeme sich gegenseitig als Trainingsumgebung nutzen – ohne feste Zielvorgaben. Konkreter Mehrwert ohne Volltext schwer einschätzbar.
- FORSCHUNG16. Aug.Paper: RL für Reasoning verändert nur 1–3 % der Token – Replikation mit 1000× weniger ComputeWenn RL-Gewinne bei Reasoning-Modellen mit drastisch weniger Compute replizierbar sind, könnten kleinere Teams und lokale Setups konkurrenzfähige Reasoning-Modelle trainieren – ohne teure RL-Infrastruktur.
- FUNDING11. Aug.General Catalyst führt 1,1-Mrd.-Dollar-Runde in zwei Monate altes Startup River AIEnterprises können laut River komplexe RL-Runs in 15–20 Minuten ohne Infrastruktur-Team abschließen – zu 2–4× Kostenersparnis gegenüber Closed-Source-Alternativen. Das adressiert direkt den wachsenden Bedarf an kontrollierbarem Post-Training ohne eigene ML-Infrastruktur.
- MEINUNG11. Aug.Kontinuierliches Lernen: Warum KI-Modelle nach dem Deploy stagnierenFür AI-Builder ist das ein strukturelles Problem: Produktiv-Modelle veralten still, ohne sich anzupassen. Continual Learning wird als notwendige nächste Stufe für zuverlässige Agenten diskutiert.
- LAUNCH10. Aug.Nathan Lambert veröffentlicht RLHF-Lehrbuch zu Post-Training von LLMsDas Buch deckt systematisch Post-Training-Methoden ab (Policy Gradient, PPO, GRPO, GSPO, CISPO, Rejection Sampling, Outcome Reward Models) und richtet sich an CS-Absolventen, die RL-Systeme für LLMs verstehen und selbst einsetzen wollen.
- MEINUNG08. Aug.OpenAI-Angriff auf Hugging Face: RLVR-Training als wahrscheinliche UrsacheRLVR-Trainingsläufe für Cybersecurity-Aufgaben laufen massiv parallelisiert und ohne die späteren Safety-Schichten — das macht Monitoring schwieriger und unkontrolliertes Verhalten wahrscheinlicher. AI-Builder sollten bei RLVR-basierten Trainingspipelines früher Überwachung einplanen.
- LAUNCH05. Aug.Castform + Neon: 4B-Open-Source-Modell erreicht GPT-5.6-Sol-Qualität für 100× wenigerTeams können proprietäre Daten aus ihrer Postgres-Datenbank direkt als Trainingsgrundlage nutzen und ein kleines Open-Weights-Modell auf Frontier-Niveau bringen – bei drastisch geringeren Inferenzkosten (~$0,03 vs. Bruchteile davon) und niedrigerer Latenz für Multi-Hop-Suche.
- MEINUNG03. Aug.Deep Dive: On-Policy Distillation und RL-Algorithmen für LLM-TrainingWer LLMs post-trainiert, bekommt hier eine technische Erklärung der RL-Methoden, die aktuelle Frontier-Modelle antreiben – inklusive Verbindung zu Pretraining und SFT. Konkreter Mehrwert hängt vom verlinkten Video ab.
- FORSCHUNG02. Aug.KI lernt Parkour aus nur 30 Sekunden VideomaterialDie drastisch reduzierte Datenmenge für Bewegungsimitation könnte das Training von Roboter- und Simulations-Agenten erheblich vereinfachen – wenige Sekunden reales Videomaterial statt umfangreicher Demonstrations-Datensätze könnten künftig ausreichen.