01
Ein Standbild wählen
Ein klares Gesicht oder eine klare Figur funktioniert am besten. Fotos, Illustrationen, Anime und Haustiere sind erlaubt.
Kostenlose öffentliche Demo
Lade ein Foto und eine Spur hoch. Wan 2.2 S2V macht daraus ein Sprech-, Gesangs- oder Performance-Video — Lippen, Mimik und Körper.
Live-Tool
Bild + Audio rein, MP4 raus. Das Studio spricht mit dem offiziellen Wan-AI-Hugging-Face-Space — ohne deinen DashScope-Key.
Offizieller Space wird geladen. Schlafende Demos brauchen oft eine Minute zum Aufwachen.
Was es ist
Wan 2.2 Speech to Video nimmt ein Standbild und ein Audio und erzeugt ein Video, in dem die Figur spricht, singt oder auftritt. Es ist die S2V-Variante der Wan-2.2-Familie für Talking Photos, singende Charaktere und audio-getriebene Avatare.
Anders als ein reines Mund-Werkzeug treibt S2V eine vollere Performance: Lippen, Mimik, Kopf und oft den Oberkörper. Suchen nach Talking Photo, Singing Photo, Audio to Video, AI Lip Sync oder Talking Avatar meinen meist genau das.
Für diese Demo reichen Bild, Audio und Auflösung.
01
Ein klares Gesicht oder eine klare Figur funktioniert am besten. Fotos, Illustrationen, Anime und Haustiere sind erlaubt.
02
Die Videolänge folgt dem Audio. Klare Stimmen geben lesbarere Lippen als verrauschte Spuren.
03
480P ist schneller zum Ausprobieren. 720P ist schärfer, die öffentliche Queue dauert länger.
Dieselbe Pipeline aus Bild + Audio deckt Talking Photos, Gesang, Anime-Covers und sprechende Haustiere ab.
Gib einem Porträt einen Satz. Nützlich für Erklärungen, Grüße und Avatare.
Gesicht plus Gesang. Das Modell behandelt Singen als Performance, nicht als aufgeklebten Mund.
Illustrierte oder Anime-Figuren können zu einem Song lippensynchron bewegen, wenn die Zeichnung klar ist.
Ein Haustierfoto plus ein kurzer Voice-Clip ist ein häufiges Spiel — das Tier groß im Bild halten.
Wenn nur der Mund in einem vorhandenen Video einem Text folgen soll, reicht oft ein Lip-Sync-Editor. S2V erzeugt das Video aus Standbild und Audio.
| Merkmal | Wan 2.2 S2V | Typisches Lip Sync |
|---|---|---|
| Bewegung | Audio-getriebene Gesicht-, Mimik- und Körperperformance | Vor allem Mundformen auf vorhandenem Clip |
| Eingaben | Standbild + Audio | Vorhandenes Video + Audio |
| Stile | Sprache, Gesang und Performance | Meist nur Sprache |
| Am besten für | Talking Photos, singende Figuren, Audio zu Video | Dialog in vorhandenem Material ersetzen |
Diese öffentliche Demo nimmt keinen Textprompt. Bild und Audio führen Regie. Offizielle APIs können später Style oder Prompt ergänzen; diese Paarungen helfen jetzt.
Diese Seite nutzt den offiziellen öffentlichen Wan-AI-Hugging-Face-Space, daher können Besucher Bild + Audio ohne API-Key testen. Es ist ein Demo-Backend, kein garantiertes Produktionskontingent.
Nein. Die aktuelle Peking-Preisliste für wan2.2-s2v nennt kein Freikontingent. Plane nicht mit der alten „100 Sekunden gratis“-Notiz.
Nicht für diese Demo. Der Space-Betreiber stellt das Backend. Selbst hosten der 14B-Apache-2.0-Gewichte ist ein anderer Weg und braucht offiziell eine sehr große GPU.
Öffentliche Spaces können schlafen, drosseln oder pausieren. Versuche 480P, kürzeres Audio, den Official-Space-Tab oder das ModelScope-Studio.
Verwandt, aber breiter. Lip Sync bearbeitet meist den Mund in vorhandenem Video. S2V erzeugt ein neues Sprech- oder Gesangsvideo aus Standbild und Audio.
Nicht als stabile Produktions-API. Bei echtem Traffic nach bestätigter Nachfrage einen bezahlten Anbieter nutzen. Diese Seite dient zum Ausprobieren.