Oficial generate.py
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wavpython generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"Solo GPU piso oficial es 80 GB. Extras adicionales: --pose_video para cantar/actuar en postura; --num_clip para una breve vista previa. Instale requirements_s2v.txt si utiliza CosyVoice. El tamaño es un presupuesto de área; el aspecto sigue la imagen.
Comparaciones publicadas (página de proyecto)
La página Wan-S2V informa FID 15.66, SSIM 0.734, PSNR 20.49, CSIM 0.677 mejor entre las líneas de referencia de los cabezas de conversación enumeradas en esas métricas con Sync-C / EFID competitivo. Trate la tabla como la medición de los autores, no como una tabla de clasificación universal.
Preguntas frecuentes
- ¿Es usted S2V ¿Nativo de audio y video?
- No. Usted suministra (o CosyVoice-síntesis) el audio. El modelo anima la imagen a esa pista. AV nativa conjunta es Wan 2.5+ APIs.
- Diffusers?
- S2V se enumera como integrado en el todo Wan2.2 (inferencia, ComfyUI, Diffusers). Preferir las banderas oficiales README si un envoltorio se retrasa.
Fuentes primarias
Verificado con el README de Wan-Video/Wan2.2 · 28 de agosto de 2026