RL — Juli 2026
18 Beiträge im Juli 2026.
- MEINUNG26. JuliCommunity-Diskussion: SFT vs. RL vs. Continued Pre-Training bei Qwen3.6-27BMehrere aktuelle Paper (arXiv:2507.05386, 2510.18874, 2607.04364, 2605.20005) deuten darauf hin, dass RL-basiertes Fine-Tuning Fähigkeiten besser erhält als SFT, aber kein Allheilmittel ist. Für Practitioner, die Qwen3.6-27B domänenspezifisch anpassen wollen, fehlen noch direkte Vergleichsdaten mit Before/After-Benchmarks.
- LAUNCH23. JuliinclusionAI veröffentlicht LLaDA2.2-flash: 100B MoE Diffusions-LLM mit 128K KontextDas Modell bringt Diffusions-LLMs erstmals in agentic Szenarien: Levenshtein Editing ermöglicht strukturierte Sequenzedits während der Generierung, L-EBPO-Training optimiert Multi-Turn Tool-Use via RL. Relevant für Builder, die Alternativen zu autoreggressiven Agenten-Architekturen suchen.
- LAUNCH23. JuliPoolside AI stellt Laguna S 2.1 vor: 118B MoE schlägt ~1T-Modell von Thinking MachinesPoolside zeigt, dass ein kleines Team mit konsequenter Infrastruktur (streaming Data-Pipelines, reproduzierbare Experimente, acht-Wochen-Release-Zyklen) frontier-nahe Modelle bauen kann. Für AI-Builder relevant: RL soll laut Kant künftig früher ins Pre-Training verlagert werden, und MCP/Tool-Calls hält er für grundlegend falsch konzipiert.
- MEINUNG18. JuliRaschka erklärt: Wie LLMs mehrere Reasoning-Effort-Modi erlernenWer Reasoning-Modelle entwickelt oder einsetzt, versteht nach diesem Artikel das Zusammenspiel von RLVR-Training, Inference-Scaling und mehreren Effort-Modi – und kann gezielt zwischen Kosten und Qualität abwägen.
- MEINUNG16. JuliLila Sciences baut automatisiertes Labor als KI-Datenfabrik für wissenschaftliche SuperintelligenzLila behandelt das Labor als Token-Generator mit der Natur als Verifier – ein RL-Ansatz, der domain-spezifische Modelle sample-für-sample schlagen soll. Konkrete Ergebnisse: platingruppenfreie Elektrokatalysatoren und CAR-T-Daten in Nicht-Human-Primaten innerhalb von sechs Monaten zeigen das praktische Potenzial dieser Strategie.
- FORSCHUNG15. JuliPluralis Research: RL Post-Training auf 14 Macs über das offene InternetRollout-Generierung macht ~80 % des Rechenaufwands bei agentic RL aus – diesen Teil auf dezentrale Consumer-Hardware auszulagern (via PULSE-Deltasync und DPPO-Gate) macht RL-Training ohne teure Datacenter-Interconnects möglich. Der Code ist open source.
- MEINUNG14. JuliNeue Startups entwickeln Tools zur Überwachung und Validierung von AI-AgentenWer Agenten-Systeme produktiv einsetzt, braucht Mechanismen zur Verhaltensprüfung. Die entstehende Infrastruktur-Schicht für Agent-Monitoring und RL-basierte Zuverlässigkeit wird zur kritischen Grundlage für sichere Deployments.
- FORSCHUNG14. JuliQwen3.6-35B per RL trainiert, um kleine Qwen-Modelle per RL zu trainierenDer Ansatz zeigt, dass rekursives RL-Training (Modell trainiert Modelle) mit überschaubarem Budget (~1.300 USD) und Open-Source-Tooling realisierbar ist. Die Episode-Reward stieg von ~0,0 auf ~0,63, und die Fähigkeit generalisierte auf eine nie gesehene Task-Familie — relevant für AI-Builder, die automatisiertes Modell-Finetuning skalieren wollen.
- LAUNCH13. JuliTuring-Preisträger Rich Sutton gründet Oak Lab für selbstlernende AI-AgentenSutton kritisiert aktuelle Deep-Learning-Methoden als „schwach und ineffizient" und setzt auf kontinuierliches Lernen statt statisches Training – ein möglicher Richtungswechsel weg vom heutigen Paradigma, der für RL-Forscher und Agent-Entwickler relevant ist.
- MEINUNG09. JuliWas macht eine Domain gut für KI-Training? Analyse jenseits von VerifizierbarkeitFür AI-Builder relevant: Warum RL-Umgebungen für bestimmte Domains (Robotik, Computer Use) trotz hoher Investitionen enttäuschen und welche strukturellen Eigenschaften bei der Auswahl von Trainingsdomains entscheidend sind.
- FUNDING08. JuliPrime Intellect sammelt 130 Mio. Dollar für Enterprise-KI-Agent-PlattformPrime Intellect ermöglicht Unternehmen, eigene Agenten per Reinforcement Learning zu trainieren, ohne auf geschlossene Frontier-Labs angewiesen zu sein – mit bereits 100 Mio. Dollar annualisiertem Umsatz und Kunden wie Ramp und Zapier ein ernstzunehmender Full-Stack-Ansatz.
- LAUNCH08. JuliCognition launcht SWE-1.7: Frontier-Coding-Modell zu geringeren KostenSWE-1.7 ist ab sofort in Devin (Web, Desktop, CLI) via Cerebras mit 1000 TPS verfügbar. Die Ergebnisse deuten darauf hin, dass RL-Post-Training deutlich mehr Spielraum hat als bisher angenommen – relevant für Teams, die Coding-Agenten auf Basis offener Basismodelle aufbauen.
- FORSCHUNG08. JuliLilian Weng fasst 35 Paper zu Harness Engineering für RSI zusammenHarness Engineering gilt laut Weng als entscheidender Hebel für RSI – nicht direkte Gewichtsmodifikation. Wer Agent-Systeme baut, sollte die dokumentierten Design-Trends (u.a. ACE-Paper, Meta-Harnesses) kennen, da sie Richtung zukünftiger Auto-Research-Architekturen weisen.
- MEINUNG07. JuliKI treibt autonome Allzweckroboter in Betrieb und Haushalt voranAllgemeine KI-Modelle sollen künftig viele verschiedene Robotertypen antreiben statt nur spezialisierte Maschinen in kontrollierten Umgebungen – das verschiebt den Entwicklungsfokus weg von Einzellösungen hin zu generalistischen Robot-Foundation-Models.
- LAUNCH05. JuliRL-Modell mit PPO augmentiert LLM-Antworten für VerkaufsstrategienLLMs neigen bei Verkaufsanwendungen zu übermäßiger Zustimmung; das Framework bietet eine Möglichkeit, diese Tendenz durch eine extern trainierte Policy zu korrigieren – ohne großen Sprachdatensatz. Via PyPI-Paket direkt nutzbar, für API-basierte LLMs auch ohne Residual-Injektion als System-Prompt-Augmentierung.
- MEINUNG03. JuliOpenAI Agent RFT: Reinforcement Learning für Enterprise-Finetuning im PraxiseinsatzAgent RFT adressiert das Credit-Assignment-Problem im Kontextfenster durch RL – relevant für Teams, die Reasoning-Modelle auf komplexe, werkzeuggestützte Unternehmens-Workflows spezialisieren wollen, ohne klassische Supervised-Finetuning-Grenzen zu treffen.
- FORSCHUNG02. JuliHIP-Kernel-Generierung für AMD-GPUs mit Multi-Agent und RL verbessertKonkreter Mehrwert ohne Volltext nicht beurteilbar – der Ansatz könnte jedoch die lokale LLM-Inferenz auf AMD-Hardware durch optimierte Kernel spürbar verbessern.
- LAUNCH02. JuliKI-Agenten schreiben kollaborativ Wiki zu RL für LLMs mit 200+ PapersEin agent-getriebenes, kollaborativ wachsendes Wiki zu RL für LLMs könnte als strukturierte Wissensquelle für Forscher und Praktiker nützlich sein. Konkreter Mehrwert des Projekts (Qualität, Methodik) ohne Volltext schwer beurteilbar.