免費公開 Demo

Wan 2.2 Speech to Video

上傳一張照片和一段聲音。Wan 2.2 S2V 會生成說話、唱歌或表演影片,帶動嘴唇、表情與身體動作。

訪客免費 不用 API Key 480P / 720P

線上工具

生成說話影片

圖片 + 音訊輸入,輸出 MP4。工作室直接呼叫 Wan-AI 官方 Hugging Face Space,不必使用你的 DashScope Key。

解析度 解析度

是什麼

Wan 2.2 S2V 是語音驅動影片,不只是對口型

Wan 2.2 Speech to Video 接收一張靜態圖和一段音訊,生成人物說話、唱歌或表演的影片。它是 Wan 2.2 家族中的 S2V 變體,面向說話照片、唱歌角色與音訊驅動虛擬人。

它與只動嘴巴的對口型工具不同:音訊會驅動更完整的表演,包括嘴唇、表情、頭部,以及常見的上半身動作。搜尋 talking photo、唱歌照片、音訊轉影片、AI 對口型或說話虛擬人,通常就是這類需求。

Wan 2.2 S2V 怎麼用

這個 Demo 只需要圖片、音訊與解析度。

01

準備一張靜態圖

臉或角色清楚最好。照片、插畫、動漫和寵物都能當起始畫面。

02

加入說話或唱歌

影片長度跟隨音訊。乾淨人聲比嘈雜背景更容易對上口型。

03

選擇 480P 或 720P

480P 更適合先試功能。720P 更清晰,但公開佇列會更慢。

圖片要求

  • 主體盡量大、不要被擋住。
  • 正面或四分之三側面比極端側臉更穩。
  • 一個主要角色比擁擠合照更可靠。
  • 照片、繪畫與風格化角色都可以。

音訊要求

  • 說話、唱歌、表演音訊都在範圍內。
  • 人聲清楚比混音花俏更重要。
  • 短音訊對免費公開佇列更友善。
  • 此 Demo 主要接受 MP3、WAV、M4A。

實際常見的生成場景

同一條流程可做說話照片、唱歌表演、動漫翻唱與寵物開口。

說話照片

讓肖像說出一句話。適合解說、問候與說話虛擬人。

唱歌照片

把臉與人聲配在一起。模型會把唱歌當成表演,而不只是貼嘴型。

動漫唱歌

只要畫得清楚,插畫或動漫角色也能跟著歌曲對口型並動起來。

寵物開口

寵物照片加一小段語音很常見——讓動物在畫面裡夠大。

S2V 與對口型差在哪

若你已有影片,只想讓嘴巴跟上台詞,對口型工具可能就夠。S2V 是從靜態圖和音訊直接生成新影片。

項目Wan 2.2 S2V常見對口型
動作音訊驅動臉部、表情與身體表演多半只改既有影片的嘴型
輸入靜態圖片 + 音訊既有影片 + 音訊
風格說話、唱歌、表演通常只有對白
更適合說話照片、唱歌角色、音訊轉影片替既有素材更換對白

S2V 提示與搭配建議

這個公開 Demo 沒有文字提示框,導演工作由圖片與音訊完成。官方 API 之後可能加入 style / prompt,這些搭配現在就有用。

  1. 01. 能量要對上:平靜的聲音配平靜肖像,高亢演唱配表演姿勢。
  2. 02. 臉周圍留一點空間,避免頭部動作把主體切出畫面。
  3. 03. 背景不要太亂,表演才容易看清楚。
  4. 04. 音訊裡一個說話者,比多人疊音更乾淨。

Wan 2.2 S2V 常見問題

這裡真的免費嗎?

本頁使用 Wan-AI 官方公開 Hugging Face Space,訪客不必提供 API Key 就能試 Image + Audio 生成。這是免費 Demo 後端,不是保證的正式額度。

阿里雲百鍊還有 S2V 免費額度嗎?

沒有。目前北京地域 wan2.2-s2v 價目表標明無免費額度。不要再依舊頁面的「100 秒免費」規劃。

需要 GPU 或自己的 Key 嗎?

這個 Demo 不需要。後端由 Space 營運方提供。自行部署 14B Apache 2.0 權重是另一條路,官方推論對顯示記憶體要求很高。

為什麼會排隊或失敗?

公開 Space 可能休眠、限流或暫停。可改用 480P、更短音訊、官方 Space 分頁,或 ModelScope Studio 備用入口。

這就是 AI 對口型嗎?

相關,但範圍更廣。對口型通常是在既有影片上改嘴巴;S2V 是從靜態圖和音訊生成新的說話/唱歌影片。

能拿它當付費產品後端嗎?

不能當成穩定的正式 API。有真實流量後再接付費服務。這個頁面用來驗證功能與搜尋需求。

© 2026 wan2.video