01
準備一張靜態圖
臉或角色清楚最好。照片、插畫、動漫和寵物都能當起始畫面。
線上工具
圖片 + 音訊輸入,輸出 MP4。工作室直接呼叫 Wan-AI 官方 Hugging Face Space,不必使用你的 DashScope Key。
正在載入官方 Space。休眠中的 Demo 可能需要一分鐘才能喚醒。
是什麼
Wan 2.2 Speech to Video 接收一張靜態圖和一段音訊,生成人物說話、唱歌或表演的影片。它是 Wan 2.2 家族中的 S2V 變體,面向說話照片、唱歌角色與音訊驅動虛擬人。
它與只動嘴巴的對口型工具不同:音訊會驅動更完整的表演,包括嘴唇、表情、頭部,以及常見的上半身動作。搜尋 talking photo、唱歌照片、音訊轉影片、AI 對口型或說話虛擬人,通常就是這類需求。
這個 Demo 只需要圖片、音訊與解析度。
01
臉或角色清楚最好。照片、插畫、動漫和寵物都能當起始畫面。
02
影片長度跟隨音訊。乾淨人聲比嘈雜背景更容易對上口型。
03
480P 更適合先試功能。720P 更清晰,但公開佇列會更慢。
同一條流程可做說話照片、唱歌表演、動漫翻唱與寵物開口。
讓肖像說出一句話。適合解說、問候與說話虛擬人。
把臉與人聲配在一起。模型會把唱歌當成表演,而不只是貼嘴型。
只要畫得清楚,插畫或動漫角色也能跟著歌曲對口型並動起來。
寵物照片加一小段語音很常見——讓動物在畫面裡夠大。
若你已有影片,只想讓嘴巴跟上台詞,對口型工具可能就夠。S2V 是從靜態圖和音訊直接生成新影片。
| 項目 | Wan 2.2 S2V | 常見對口型 |
|---|---|---|
| 動作 | 音訊驅動臉部、表情與身體表演 | 多半只改既有影片的嘴型 |
| 輸入 | 靜態圖片 + 音訊 | 既有影片 + 音訊 |
| 風格 | 說話、唱歌、表演 | 通常只有對白 |
| 更適合 | 說話照片、唱歌角色、音訊轉影片 | 替既有素材更換對白 |
這個公開 Demo 沒有文字提示框,導演工作由圖片與音訊完成。官方 API 之後可能加入 style / prompt,這些搭配現在就有用。
本頁使用 Wan-AI 官方公開 Hugging Face Space,訪客不必提供 API Key 就能試 Image + Audio 生成。這是免費 Demo 後端,不是保證的正式額度。
沒有。目前北京地域 wan2.2-s2v 價目表標明無免費額度。不要再依舊頁面的「100 秒免費」規劃。
這個 Demo 不需要。後端由 Space 營運方提供。自行部署 14B Apache 2.0 權重是另一條路,官方推論對顯示記憶體要求很高。
公開 Space 可能休眠、限流或暫停。可改用 480P、更短音訊、官方 Space 分頁,或 ModelScope Studio 備用入口。
相關,但範圍更廣。對口型通常是在既有影片上改嘴巴;S2V 是從靜態圖和音訊生成新的說話/唱歌影片。
不能當成穩定的正式 API。有真實流量後再接付費服務。這個頁面用來驗證功能與搜尋需求。