
AI-Roundup: vLLM 0.20, Poolside Laguna, NVIDIA Nemotron Omni und Agenten-Tooling
Der Roundup vom 28./29. April 2026 fasst einen vergleichsweise ruhigen Nachrichtentag zusammen, an dem dennoch mehrere technisch substanzielle Releases erschienen. Besonders im Fokus steht die Inference-Infrastruktur: SemiAnalysis veröffentlichte frühe DeepSeek-V4-Pro-Serving-Ergebnisse auf B200-, B300-, H200- und GB200-Disaggregated-Setups, wobei der B300 beim betreffenden Workload bis zu 8× schneller als der H200 sein soll. Für die vLLM-Community ist zudem das neue DeepGEMM-MegaMoE-Kernel relevant, das EP-Dispatch, EP-Combine, GEMMs und SwiGLU in einem einzigen Mega-Kernel fusioniert. Auf der Modellseite veröffentlichte Poolside mit Laguna XS.2 ein vollständig intern trainiertes Coding-MoE-Modell, das neben der 33B/3B-Variante auch eine 225B/23B-aktive Version umfasst – beide mit Hybrid-Attention und FP8-KV-Cache. NVIDIA Nemotron 3 Nano Omni fällt durch seinen Parakeet-Encoder für Sprachverständnis auf und erreicht laut Angaben 5,95 % WER auf dem Open-ASR-Leaderboard. Im Agenten-Bereich meldete Hugging Face, dass bereits 300.000 Nutzer Hardware-Spezifikationen im Hub hinterlegt haben, um lokal lauffähige Modelle zu entdecken. Microsoft veröffentlichte mit TRELLIS.2 ein 4B-Modell für Image-to-3D mit bis zu 1536³ PBR-texturierten Assets, das auf nativen 3D-VAEs mit 16-facher räumlicher Kompression basiert.
- SemiAnalysis: B300 bis zu 8× schneller als H200 bei DeepSeek-V4-Pro auf disaggregierten Serving-Setups (B200/B300/H200/GB200).
- Poolside Laguna XS.2 existiert in zwei Varianten: 33B/3B aktiv und 225B/23B aktiv – beide mit Hybrid-Attention und FP8-KV-Cache, laut Community-Vergleich nahe Qwen-3.5.
- NVIDIA Nemotron 3 Nano Omni: 30B/A3B MoE, Parakeet-Encoder für Sprache, 5,95 % WER auf Open-ASR-Leaderboard, derzeit nur Englisch.
- Microsoft TRELLIS.2: 4B Image-to-3D-Modell, bis zu 1536³ PBR-Assets, native 3D-VAEs mit 16× räumlicher Kompression, Open Source.
- Hugging Face: 300.000 Nutzer haben Hardware-Specs im Hub eingetragen, um lokal lauffähige Modelle zu finden; ML-Intern-Space erhielt natives Metric-Logging via Trackio-Integration.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FUNDINGreddit.com3w
Nvidia investiert 7 Mrd. USD in Poolside und übernimmt Großteil der Belegschaft
- LAUNCHreddit.com3w
AirLLM unterstützt Qwen3.8-27B und Kimi K3 (2,8T) auf Single-GPU
- LAUNCHthesequence.substack.com3w
DeepSeek V4-Pro, GLM-5.3, Nemotron 3.5 Lightning und NeMo Switchyard im Überblick
- LAUNCHreddit.com0mo
Linux 7.3 Kernel verbessert VRAM-Management für GPUs

AI-Roundup: vLLM 0.20, Poolside Laguna, NVIDIA Nemotron Omni und Agenten-Tooling
Der Roundup vom 28./29. April 2026 fasst einen vergleichsweise ruhigen Nachrichtentag zusammen, an dem dennoch mehrere technisch substanzielle Releases erschienen. Besonders im Fokus steht die Inference-Infrastruktur: SemiAnalysis veröffentlichte frühe DeepSeek-V4-Pro-Serving-Ergebnisse auf B200-, B300-, H200- und GB200-Disaggregated-Setups, wobei der B300 beim betreffenden Workload bis zu 8× schneller als der H200 sein soll. Für die vLLM-Community ist zudem das neue DeepGEMM-MegaMoE-Kernel relevant, das EP-Dispatch, EP-Combine, GEMMs und SwiGLU in einem einzigen Mega-Kernel fusioniert. Auf der Modellseite veröffentlichte Poolside mit Laguna XS.2 ein vollständig intern trainiertes Coding-MoE-Modell, das neben der 33B/3B-Variante auch eine 225B/23B-aktive Version umfasst – beide mit Hybrid-Attention und FP8-KV-Cache. NVIDIA Nemotron 3 Nano Omni fällt durch seinen Parakeet-Encoder für Sprachverständnis auf und erreicht laut Angaben 5,95 % WER auf dem Open-ASR-Leaderboard. Im Agenten-Bereich meldete Hugging Face, dass bereits 300.000 Nutzer Hardware-Spezifikationen im Hub hinterlegt haben, um lokal lauffähige Modelle zu entdecken. Microsoft veröffentlichte mit TRELLIS.2 ein 4B-Modell für Image-to-3D mit bis zu 1536³ PBR-texturierten Assets, das auf nativen 3D-VAEs mit 16-facher räumlicher Kompression basiert.
- SemiAnalysis: B300 bis zu 8× schneller als H200 bei DeepSeek-V4-Pro auf disaggregierten Serving-Setups (B200/B300/H200/GB200).
- Poolside Laguna XS.2 existiert in zwei Varianten: 33B/3B aktiv und 225B/23B aktiv – beide mit Hybrid-Attention und FP8-KV-Cache, laut Community-Vergleich nahe Qwen-3.5.
- NVIDIA Nemotron 3 Nano Omni: 30B/A3B MoE, Parakeet-Encoder für Sprache, 5,95 % WER auf Open-ASR-Leaderboard, derzeit nur Englisch.
- Microsoft TRELLIS.2: 4B Image-to-3D-Modell, bis zu 1536³ PBR-Assets, native 3D-VAEs mit 16× räumlicher Kompression, Open Source.
- Hugging Face: 300.000 Nutzer haben Hardware-Specs im Hub eingetragen, um lokal lauffähige Modelle zu finden; ML-Intern-Space erhielt natives Metric-Logging via Trackio-Integration.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FUNDINGreddit.com3w
Nvidia investiert 7 Mrd. USD in Poolside und übernimmt Großteil der Belegschaft
- LAUNCHreddit.com3w
AirLLM unterstützt Qwen3.8-27B und Kimi K3 (2,8T) auf Single-GPU
- LAUNCHthesequence.substack.com3w
DeepSeek V4-Pro, GLM-5.3, Nemotron 3.5 Lightning und NeMo Switchyard im Überblick
- LAUNCHreddit.com0mo
Linux 7.3 Kernel verbessert VRAM-Management für GPUs