Wan-Dancer: Hierarchisches Framework erzeugt minutenlange Tanzvideos aus Musik
Wan-Dancer stammt aus dem HumanaIGC-Forschungsprojekt und baut auf dem Wan-Video-Ökosystem auf, zu dem auch das öffentlich verfügbare Wan-Dancer-14B-Modell auf HuggingFace gehört. Das Framework löst ein bekanntes Problem aktueller Diffusionsmodelle: Diese versagen typischerweise jenseits von 20 Sekunden durch Temporal Drift, Identitätsinkonsistenzen und sich wiederholende Bewegungsmuster. Wan-Dancer trennt den Generierungsprozess in zwei Stufen – globales Keyframe-Planning, das den gesamten Musiktrack analysiert, und lokales Temporal Refinement, das Übergänge zwischen Keyframes verfeinert. Für die präzise rhythmische Synchronisation nutzt das System time-mapped RoPE-Embeddings, die eine dynamische Framerate-Anpassung ermöglichen. Eine optische-Fluss-basierte Verlustfunktion sorgt zusätzlich für Bewegungskontinuität, während ein dedizierter Motion-Speed-Controller bei schnellen Bewegungen Details erhält. Das Modell kann sowohl über Audioinput als auch über Textprompts gesteuert werden und unterstützt fünf Tanzgenres. Neben dem GitHub-Repository und den Modellgewichten steht das System über ModelScope Studio und einen HuggingFace Space zur direkten Erprobung bereit.
- Modellgröße: 14 Milliarden Parameter, Gewichte und Inferenz-Code sind öffentlich auf HuggingFace (Wan-AI/Wan-Dancer-14B) verfügbar.
- Drei technische Kerninnovationen: time-mapped RoPE-Embeddings, optische-Fluss-Verlustfunktion und Motion-Speed-Control für schnelle Bewegungssequenzen.
- Ausgabequalität: stabile Videos mit 720p Auflösung und 30 fps über mehr als eine Minute Länge.
- Konditionierung flexibel: Modell akzeptiert sowohl Audio-Prompts (Musik) als auch Textprompts zur Steuerung von Stil und Genre.
- Direkter Zugang zum Ausprobieren über ModelScope Studio und HuggingFace Space, Paper auf arXiv (2607.09581) veröffentlicht.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.
Verwandte Beiträge
Wan-Dancer: Hierarchisches Framework erzeugt minutenlange Tanzvideos aus Musik
Wan-Dancer stammt aus dem HumanaIGC-Forschungsprojekt und baut auf dem Wan-Video-Ökosystem auf, zu dem auch das öffentlich verfügbare Wan-Dancer-14B-Modell auf HuggingFace gehört. Das Framework löst ein bekanntes Problem aktueller Diffusionsmodelle: Diese versagen typischerweise jenseits von 20 Sekunden durch Temporal Drift, Identitätsinkonsistenzen und sich wiederholende Bewegungsmuster. Wan-Dancer trennt den Generierungsprozess in zwei Stufen – globales Keyframe-Planning, das den gesamten Musiktrack analysiert, und lokales Temporal Refinement, das Übergänge zwischen Keyframes verfeinert. Für die präzise rhythmische Synchronisation nutzt das System time-mapped RoPE-Embeddings, die eine dynamische Framerate-Anpassung ermöglichen. Eine optische-Fluss-basierte Verlustfunktion sorgt zusätzlich für Bewegungskontinuität, während ein dedizierter Motion-Speed-Controller bei schnellen Bewegungen Details erhält. Das Modell kann sowohl über Audioinput als auch über Textprompts gesteuert werden und unterstützt fünf Tanzgenres. Neben dem GitHub-Repository und den Modellgewichten steht das System über ModelScope Studio und einen HuggingFace Space zur direkten Erprobung bereit.
- Modellgröße: 14 Milliarden Parameter, Gewichte und Inferenz-Code sind öffentlich auf HuggingFace (Wan-AI/Wan-Dancer-14B) verfügbar.
- Drei technische Kerninnovationen: time-mapped RoPE-Embeddings, optische-Fluss-Verlustfunktion und Motion-Speed-Control für schnelle Bewegungssequenzen.
- Ausgabequalität: stabile Videos mit 720p Auflösung und 30 fps über mehr als eine Minute Länge.
- Konditionierung flexibel: Modell akzeptiert sowohl Audio-Prompts (Musik) als auch Textprompts zur Steuerung von Stil und Genre.
- Direkter Zugang zum Ausprobieren über ModelScope Studio und HuggingFace Space, Paper auf arXiv (2607.09581) veröffentlicht.
Frag die KI zum Artikel
Folgefragen zu Headline, Quelle und Volltext — Antwort streamt in wenigen Sekunden.