Voz a vídeo

Wan2.2-S2V-14B (26 de agosto de 2025) es el modelo de habla a video cinematográfico abierto: una imagen de identidad + audio (+ prompt y pose opcionales) → labios, cara, cuerpo y cámara. Consume audio; no inventa una banda sonora a partir de texto.

S2V-14BCosyVoicelip-sync
En esta página 4
Ingresos de habla a vídeo: imagen, audio, instancia y postura opcionales
S2V-14B La duración sigue el audio a menos que --num_clip Prevé un corte más corto.
Oficial Wan-S2V una visión general de la tubería
Visión general oficial del método Wan-S2V: imagen, audio y texto en el generador cinematográfico.
Oficial Wan-S2V conducto de inyección de audio
Línea oficial de audio inyección para Wan-S2V.

Oficial generate.py

Imagen + onda
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wav
CosyVoice TTS
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"

Solo GPU piso oficial es 80 GB. Extras adicionales: --pose_video para cantar/actuar en postura; --num_clip para una breve vista previa. Instale requirements_s2v.txt si utiliza CosyVoice. El tamaño es un presupuesto de área; el aspecto sigue la imagen.

Comparaciones publicadas (página de proyecto)

La página Wan-S2V informa FID 15.66, SSIM 0.734, PSNR 20.49, CSIM 0.677 mejor entre las líneas de referencia de los cabezas de conversación enumeradas en esas métricas con Sync-C / EFID competitivo. Trate la tabla como la medición de los autores, no como una tabla de clasificación universal.

Oficial Wan-S2V clave de recopilación de datos
Diagrama oficial de recogida de datos (OpenHumanVid, Koala36M, más clips cinematográficos manuales).

Preguntas frecuentes

¿Es usted S2V ¿Nativo de audio y video?
No. Usted suministra (o CosyVoice-síntesis) el audio. El modelo anima la imagen a esa pista. AV nativa conjunta es Wan 2.5+ APIs.
Diffusers?
S2V se enumera como integrado en el todo Wan2.2 (inferencia, ComfyUI, Diffusers). Preferir las banderas oficiales README si un envoltorio se retrasa.

Fuentes primarias

Verificado con el README de Wan-Video/Wan2.2 · 28 de agosto de 2026

© 2026 wan2.video