
Black Forest Labs: Flux 3 generiert Videos mit nativem Audio bis 20 Sekunden
Black Forest Labs (BFL), das Berliner Startup hinter der populären Flux-Bildgenerierungsreihe, hat mit Flux 3 erstmals ein Modell veröffentlicht, das Bild, Video und Audio nativ in einem einzigen Foundation-Modell vereint. Videos können bis zu 20 Sekunden lang generiert werden – inklusive synchronem Ton, der direkt vom Modell produziert wird, ohne nachgelagerte Audiopipeline. Bislang mussten Content-Pipelines für vertontes Videomaterial separate Modelle kombinieren; Flux 3 soll diesen Schritt überflüssig machen. In unternehmenseigenen Benchmarks schneidet Flux 3 knapp besser ab als Seedance 2.0, das derzeit als Marktführer in der KI-Videogenerierung gilt – unabhängige Evaluierungen durch Dritte stehen jedoch noch aus, weshalb diese Einstufung mit Vorsicht zu bewerten ist. BFL kommuniziert zudem ein langfristiges Ziel: Der Aufbau eines sogenannten World Models, also eines Modells, das physikalische Zusammenhänge und die reale Welt grundlegend modellieren kann. Als ersten Schritt in diese Richtung testet das Unternehmen Flux 3 bereits auf Robotik-Aufgaben, was auf Einsatzfelder weit jenseits klassischer Medienproduktion hindeutet. BFL war 2024 von ehemaligen Stable-Diffusion-Mitentwicklern gegründet worden und hatte mit der Flux-1-Familie schnell Marktaufmerksamkeit gewonnen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGhuggingface.co2w
DreamX-Creator: 7B-Modell generiert Audio und Video nativ in 2K
- FORSCHUNGarxiv.org0mo
SALSA-V: Video-zu-Audio-Modell generiert synchronen Langform-Sound in 8 Schritten
- LAUNCHthe-decoder.com3w
Adobe Firefly integriert KI-Audiotools und Google Gemini Omni Flash
- LAUNCHvercel.com3w
Wan 3.0 von Alibaba jetzt auf Vercel AI Gateway verfügbar

Black Forest Labs: Flux 3 generiert Videos mit nativem Audio bis 20 Sekunden
Black Forest Labs (BFL), das Berliner Startup hinter der populären Flux-Bildgenerierungsreihe, hat mit Flux 3 erstmals ein Modell veröffentlicht, das Bild, Video und Audio nativ in einem einzigen Foundation-Modell vereint. Videos können bis zu 20 Sekunden lang generiert werden – inklusive synchronem Ton, der direkt vom Modell produziert wird, ohne nachgelagerte Audiopipeline. Bislang mussten Content-Pipelines für vertontes Videomaterial separate Modelle kombinieren; Flux 3 soll diesen Schritt überflüssig machen. In unternehmenseigenen Benchmarks schneidet Flux 3 knapp besser ab als Seedance 2.0, das derzeit als Marktführer in der KI-Videogenerierung gilt – unabhängige Evaluierungen durch Dritte stehen jedoch noch aus, weshalb diese Einstufung mit Vorsicht zu bewerten ist. BFL kommuniziert zudem ein langfristiges Ziel: Der Aufbau eines sogenannten World Models, also eines Modells, das physikalische Zusammenhänge und die reale Welt grundlegend modellieren kann. Als ersten Schritt in diese Richtung testet das Unternehmen Flux 3 bereits auf Robotik-Aufgaben, was auf Einsatzfelder weit jenseits klassischer Medienproduktion hindeutet. BFL war 2024 von ehemaligen Stable-Diffusion-Mitentwicklern gegründet worden und hatte mit der Flux-1-Familie schnell Marktaufmerksamkeit gewonnen.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
- FORSCHUNGhuggingface.co2w
DreamX-Creator: 7B-Modell generiert Audio und Video nativ in 2K
- FORSCHUNGarxiv.org0mo
SALSA-V: Video-zu-Audio-Modell generiert synchronen Langform-Sound in 8 Schritten
- LAUNCHthe-decoder.com3w
Adobe Firefly integriert KI-Audiotools und Google Gemini Omni Flash
- LAUNCHvercel.com3w
Wan 3.0 von Alibaba jetzt auf Vercel AI Gateway verfügbar