Gesicht und Körper sollten sichtbar, wenig verdeckt und mit ausreichend Rand dargestellt sein.
Wan-Animate-2
End-to-End-Charakteranimation aus Bild und Bewegungsvideo
Wan-Animate-2 verarbeitet Referenzfigur, Bewegungsvideo und Text direkt in einem neu gestalteten 14B Diffusion Transformer. Diese Seite verbindet Modellguide und öffentliche ZeroGPU-Demo.
Kurzes Wan-Animate-2-Video online erstellen
Bild und kurzes Bewegungsvideo hochladen. Der eingebettete Space nutzt das destillierte Diffusers-Modell auf ZeroGPU.
Der Space lädt Wan-AI/Wan2.2-Animate-2-14B-Distilled-Diffusers und leitet nicht an DashScope weiter. /animate ist als Gradio-Endpunkt verfügbar.
Bild, Bewegungsvideo und Prompt gehen direkt an einen externen Hugging-Face-Space. Keine privaten, vertraulichen oder nicht lizenzierten Inhalte hochladen.
Die Demo verarbeitet 1–5 Sekunden und normalisiert auf 24fps.
Prompt für Kleidung, Identität und Hintergrund nutzen; die Bewegung kommt aus dem Video.
Zuerst 320×480 und 4–6 Schritte testen, bevor mehr Kontingent verbraucht wird.
Was Wan-Animate-2 verändert
Wan-Animate-2 erschien am 7. August 2026 als neuer Animationsrahmen und ist keine Umbenennung des alten Wan2.2 Animate. Das Bewegungsvideo wird ohne separaten Bewegungsextraktor direkt im Video-DiT verarbeitet.
Referenz, Bewegungsvideo und Textbedingung fließen direkt in den neu gestalteten Video-Diffusion-Transformer.
Das DiT verwendet das Bewegungsvideo ohne vorgeschalteten Pose- oder Bewegungsextraktor.
Referenzmerkmale sollen das Aussehen der Figur während der Bewegungsübertragung stabil halten.
Die Ausgabekamera kann von der Perspektive des Bewegungsvideos entkoppelt werden.
Sie senkt den Sampling-Aufwand; genau diese Diffusers-Variante läuft im iframe.
Das iframe nutzt Wan-AI/Wan2.2-Animate-2-14B-Distilled-Diffusers. Ältere Wan2.2-Animate-Endpunkte können noch das Vorgängermodell ausführen.
Vom Referenzbild zur Animation
Die Demo zeigt den kürzesten nutzbaren Ablauf mit allen drei Konditionierungseingaben.
Ein Bild definiert Gesicht, Kleidung, Proportionen und Identität.
Ein 1–5 Sekunden langer Clip steuert Körper-, Kopf- und Kamerabewegung.
Figur und Hintergrund objektiv beschreiben; Bewegung nicht doppelt anweisen.
Mit niedrigen Einstellungen starten und Identität, Gliedmaßen, Verdeckungen und Kamera prüfen.
Parameter der kostenlosen Demo
Dies sind die aktuellen Regler des hugging-apps Space, nicht die vollständigen Grenzen des herunterladbaren Modells.
Länge ab Beginn des Bewegungsvideos.
Jede Seite wird auf ein Vielfaches von 16 gerundet.
Mehr Schritte benötigen mehr GPU-Zeit; Standard ist 6.
Bei 1.0 ist CFG für den schnellen destillierten Lauf aus.
Passt den Flow-Matching-Samplingplan an; Standard 5.0.
Ein- und Ausgabe werden mit 24fps verarbeitet.
Ergebnis reproduzieren oder variieren.
Das offizielle Repository dokumentiert 720P mit 8× A800. Die Demo-Regler sind keine Modellgrenzen.
Kostenlos heißt nicht unbegrenzt
ZeroGPU vergibt tägliche GPU-Zeit je Kontotyp. Dieser Space fordert xlarge an; höhere Auflösung und mehr Schritte verbrauchen das Kontingent schnell.
Anonyme Aufrufe nutzen zusätzlich einen strengeren gemeinsamen Pool. Warteschlange und Regeln können sich ändern.
Messwerte im Space-Code
Zwei aktuelle Messungen, kein standardisierter Benchmark und keine garantierte Wartezeit.
Der Space ist auch eine öffentliche Gradio-API
Der Generate-Button registriert api_name="animate". Vor dem Upload die aktuelle Struktur mit view_api() prüfen.
from gradio_client import Client, handle_file
client = Client(
"hugging-apps/wan2-2-animate-2-14b"
)
client.view_api()
# Then call api_name="/animate"view_api() oder OpenAPI nutzen, statt eine alte Argumentreihenfolge fest einzubauen.
Bild und Video müssen über die Gradio-Dateiverarbeitung hochgeladen werden.
Videogenerierung ist asynchron, rechenintensiv und vom ZeroGPU-Kontingent abhängig.
Nicht das alte Wan2.2 Animate
Beide animieren Figuren, doch die neue Veröffentlichung besitzt eine andere Konditionierungsarchitektur.
Erste Wan2.2-Animate-Generation
Neuer End-to-End-Rahmen
Zwischenrepräsentationen
Video direkt im neu gestalteten DiT
Stärker an Quelle gebunden
Textgesteuerte Perspektive
Nicht verwendet
Destilliertes 14B-Diffusers-Modell
Vor dem Generieren beachten
Eine frühe, rechenintensive öffentliche Demo; Erfolg hängt von Eingabe, Warteschlange und Kontingent ab.
Nur die ersten 1–5 Sekunden werden verarbeitet.
Verdeckungen, schnelle Drehungen, Hände und ungewöhnliche Anatomie können Fehler erzeugen.
Der Space kann schlafen, warten, fehlschlagen, aktualisiert oder beendet werden.
Einwilligung, Persönlichkeitsrechte, Urheberrecht und rechtmäßige Nutzung bleiben Verantwortung der Nutzer.
Lokaler Betrieb braucht große Hardware
Die Referenzkonfiguration zielt auf High-End-Mehrfach-GPU-Systeme.
- Offizieller Standard: 8× A800 für 720P
- Offiziell getestet: 2× A800 für 480P
- Base, Destillation, Diffusers und ComfyUI-Integration verfügbar
Häufige Fragen
Unterschiede zwischen Modell, öffentlichem Space und Produktions-API.
Ist die Demo wirklich kostenlos?+
Der Space nutzt aktuell ZeroGPU ohne direkte Kosten, ist aber durch Tageskontingent, Warteschlange und Verfügbarkeit begrenzt.
Brauche ich ein HF-Konto?+
Anonym geht derzeit, jedoch nur mit zwei Minuten Tageskontingent und strengerem gemeinsamem Pool.
Ist es wirklich das neue Modell?+
Ja. Der Quellcode nennt den neuen destillierten 14B-Diffusers-Checkpoint.
Kann ich die API verwenden?+
/animate ist öffentlich, solange der Space läuft. Es ist ein Demo-Endpunkt ohne Produktions-SLA.
Sind lange Videos oder 720P möglich?+
Nicht im iframe: 1–5 Sekunden und 320–640 Pixel je Seite. Lokal sind andere Einstellungen mit deutlich mehr Hardware möglich.
Modell- und Demoquellen
Am 29. August 2026 anhand offizieller Quellen geprüft.