Native Audio-Video-Generierung

Native Audio-Video bedeutet, dass ein Sampler ein Bild und einen synchronisierten Soundtrack (Sprache, Effekte, Musik) ausstrahlt. Diese Fähigkeit wird auf Wan 2.5 und höherem Produkt APIs beworben. Es ist keine Eigenschaft der Wan2.2-T2V/I2V offenen Gewichte.

Wan 2.5API-onlysync
Auf dieser Seite 5
Wan2.2 offenes stilles Video gegenüber Wan 2,5+ natives Audio-Video APIs
Die Produktlinie und die offenen Kontrollstellen in separaten Schachteln aufbewahren.

Was 2.2 offene Modelle ausstrahlen

  • T2V-A14B / I2V-A14B / TI2V-5B Schweigendes Video.
  • S2V-14B Sie bringen das Audio mit; das Modell animiert.
  • Animate-14B Bewegungstransfer; Audio nicht erzeugt.

Was 2,5+ Produkte hinzufügen

Public 2.5 Writ-ups (fal, DashScope-style APIs, Aggregatoren) beschreiben die gemeinsame Generation von Dialog, Atmosphäre und Musik, 1080P, und Clips länger als die 2,2 ~ 5 s Rezepte. Später 2.6/2.7/3.0 halten nativen AV und fügen mehrere Aufnahmen oder Referenzsteuerungen hinzu. Keines davon wird als Wan2.2-style GitHub Checkpoints veröffentlicht.

Ersatzmittel für offene Gewichte

Um auf Apache-2.0 / Public Weights zu bleiben: generieren Sie stilles Wan2.2 Video, dann ThinkSound (oder ein anderes V2A) für Foley; oder fahren Sie S2V mit CosyVoice für Sprechköpfe. Das sind zwei (oder drei) Modelle, nicht native AV.

Häufige Fragen

Wird ein 2.2 GGUF magisch Audio hinzufügen?
Die Quantifizierung ändert Gewichtsd-Typ, nicht die Ausgangsmodalität.
Zählt S2V als native AV?
Nein, nativer AV synthetisiert Ton. S2V verbraucht Ton.

Primärquellen

Mit dem Wan-Video/Wan2.2 README abgeglichen · 28. August 2026

© 2026 wan2.video