Wiki に戻る タスク

音声から動画

Wan2.2-S2V-14B (2025年8月26日) は,オープン映画的なスピーチ・トゥ・ビデオモデルである.一つのアイデンティティ画像 +オーディオ (+オプションプロンプトとポーズ) →唇,顔,身体,カメラ.

S2V-14BCosyVoicelip-sync
このページの目次 4
ビデオへのスピーチ入力:画像,オーディオ,オプションプロンプトおよびポーズ
S2V-14B入力. --num_clipが短いカットを先見しない限り,オーディオの持続時間は続く.
公式 Wan-S2V パイプラインの概要
公式 Wan-S2V メソッド概要:映像,オーディオ,テキストを映画生成器に
公式 Wan-S2V 音声注射パイプライン
公式のオーディオインジェクションパイプライン Wan-S2V.

公式 generate.py

画像 + wav
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wav
CosyVoice TTS
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"

独身GPU 公式のフロアは 80 GB追加: --pose_video ポーズで歌う/演じる --num_clip 短暫のプレビューのために requirements_s2v.txt 服用している場合 CosyVoice面積は面積予算で,側面は画像に続く.

公開された比較 (プロジェクトページ)

Wan-S2Vページでは,FID 15.66, SSIM 0.734, PSNR 20.49, CSIM 0.677 がこれらのメトリックの表記されたトークヘッドベースラインの中で最も良い. 競争力のあるSync-C / EFID.表は,普遍的なランキングボードではなく,著者の測定値として扱います.

公式 Wan-S2V データ収集の鍵
公式データ収集図 (OpenHumanVid,Koala36M,および手動映画クリップ)

よくある質問

S2Vはネイティブオーディオビデオですか?
音声を供給 (または CosyVoice合成) する.モデルはそのトラックに画像をアニメ化します.ネイティブコイント AVは Wan 2.5+ APIsです.
Diffusers?
S2Vは, Wan2.2 todo (インフェレンスの, ComfyUI, Diffusers) に統合されているようにリストされている.包装が遅れている場合,公式 README 旗を好む.

一次資料

Wan-Video/Wan2.2 README と照合済み · 2026年8月28日

© 2026 wan2.video