Audio et vidéo natifs

L'audio-vidéo natif signifie qu'un échantillonneur émet une image et une bande sonore synchronisée (speech, effects, music). Cette capacité est annoncée sur Wan 2.5 et le produit ultérieur APIs. Ce n'est pas une propriété des poids ouverts Wan2.2-T2V/I2V.

Wan 2.5API-onlysync
Sur cette page 5
Wan2.2 vidéo silencieuse ouverte contre Wan 2,5+ vidéo audio natif APIs
Gardez la ligne de produits et les points de contrôle ouverts dans des boîtes séparées.

Quels sont les émissions des modèles ouverts 2.2

  • T2V-A14B / I2V-A14B / TI2V-5B Vidéo silencieuse.
  • S2V-14B vous apportez l'audio; le modèle anime.
  • Animate-14B transfert de mouvement; audio non généré.

Ce que les produits 2.5+ ajoutent

Les écrits publics 2.5 (fal, DashScope-style APIs, agrégateurs) décrivent la génération conjointe de dialogue, d'ambiance et de musique, 1080P, et des clips plus longs que les recettes de 2,2 ~ 5 s. Plus tard 2.6/2.7/3.0 conservent AV natifs et ajoutent des contrôles multi-shot ou de référence. Aucun de ceux-ci ne sont publiés comme Wan2.2-style GitHub points de contrôle.

Substituts à poids ouvert

Pour rester sur Apache-2.0 / poids public: générer une vidéo silencieuse Wan2.2, puis ThinkSound (ou une autre V2A) pour le foley; ou faire S2V avec CosyVoice pour les têtes de conversation.

Questions fréquentes

Un 2.2 GGUF ajoutera-t-il magiquement de l'audio?
La quantification change le type de poids, pas la modalité de sortie.
Le S2V compte-t-il comme AV native?
Non, le AV natif synthétise le son. S2V consomme du son.

Sources primaires

Vérifié avec le README Wan-Video/Wan2.2 · 28 août 2026

© 2026 wan2.video