Oficial generate.py
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wavpython generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"- Só...GPU O plano oficial é 80 GB- Extras extras: --pose_video para canto/acção em postura; --num_clip Para uma breve prévia. requirements_s2v.txt se utilizar CosyVoiceO tamanho é um orçamento de área; o aspecto segue a imagem.
Comparativos publicados (página de projecto)
A página Wan-S2V relata FID 15.66, SSIM 0.734, PSNR 20.49, CSIM 0.677 melhor entre as linhas de base listadas de cabeças de conversa nessas métricas com Sync-C / EFID competitivo.
Perguntas frequentes
- É S2V áudio-vídeo nativo?
- Não. Você fornece (ou CosyVoice-síntese) o áudio. O modelo anima a imagem para essa faixa. AV conjunta nativa é Wan 2.5+ APIs.
- Diffusers?
- S2V é listado como integrado no todo Wan2.2 (inferência, ComfyUI, Diffusers). Preferir as bandeiras oficiais README se um envolvente se atrasar.
Fontes primárias
Verificado com o README do Wan-Video/Wan2.2 · 28 de agosto de 2026