Text zu Video

Text-zu-Video in der offenen 2.2 Linie sind zwei Rezepte: die kinematische MoE T2V-A14B (480P/720P, ~80 GB) und die hybride TI2V-5B (720P@24 fps auf einer 24 GB Karte mit Abladen). Beide dekodieren stille Rahmen.

t2v-A14Bti2v-5B720P
Auf dieser Seite 6
Text-zu-Video-Pipeline von prompt über UMT5 und DiT MoE bis VAE-Decode
T2V Weg: prompt → UMT5-XXL → Wan2.2 DiT → VAE Dekodieren.

Zwei offizielle T2V Einträge

AufgabenbannerModellTypische GrößeVRAM (offiziell)Anmerkungen
t2v-A14BWan2.2-T2V-A14B1280×720 oder 480P≥ 80 GB Einzelne GPUMoE Experten für hohe/niedrige Geräusche
ti2v-5BWan2.2-TI2V-5B1280×704 oder 704×1280≥ 24 GB mit Ablast720P @ 24 fpsHybrid T2V+I2V

Offizielle Single-GPU-Befehle

T2V-A14B (80 GB Klasse)
python generate.py --task t2v-A14B --size 1280*720 --ckpt_dir ./Wan2.2-T2V-A14B --offload_model True --convert_model_dtype --prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."
TI2V-5B (24 GB - 4090-Klasse)
python generate.py --task ti2v-5B --size 1280*704 --ckpt_dir ./Wan2.2-TI2V-5B --offload_model True --convert_model_dtype --t5_cpu --prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage"

Multi-GPU verwendet Torchrun mit --dit_fsdp --t5_fsdp --ulysses_size. Das README Beispiel für acht GPUs ist der unterstützte Weg, wenn eine einzige 80 GB Karte nicht verfügbar ist.

Was macht der Stapel

  • Text-Coder: UMT5-XXL. Laden Sie es mit --t5_cpu ab, wenn VRAM dicht ist.
  • Rückgrat: Fluss-Matching DiT. A14B schaltet Experten durch SNR; TI2V-5B ist dicht.
  • Latente: Wan-VAE (2.1-Stil 4×8×8 auf A14B; 2.2 4×16×16 auf TI2V-5B).
  • Eine schnelle Erweiterung wird empfohlen; siehe das Wiki zur Schnelle Erweiterung.

Qualitätsansprüche aus der Quelle

Die README positioniert Wan2.2 als Top- Wan-Bench 2.0 gegenüber mehreren geschlossenen Modellen, mit mehr Bewegung/semantischer/ästhetischer Daten als Wan2.1. Behandeln Sie SOTA-Tabellen von Drittanbietern als Marketing, es sei denn, sie zitieren die gleiche Bank und den gleichen 2.2 Checkpoint (A14B vs 5B vs. ein quantiziertes Community Pack).

Häufige Fragen

Welche Größe soll ich bestehen?
A14B verwendet 1280*720 (oder ein 480P Paar). TI2V-5B 720P ist 1280*704 oder 704*1280 nicht 1280*720. Dieser Unterschied ist in der offiziellen README.
Wie lange ist ein clip?
Die öffentlichen Rezepte sind kurze Filmmessungen (in der Reihenfolge von 5 Sekunden). S2V Die Dauer folgt stattdessen dem Audio-Track.
Diffusers?
Ja. Wan-AI/Wan2.2-T2V-A14B-Diffusers und Wan2.2-TI2V-5B-Diffusers sind im Newsblock vom 28. Juli 2025 aufgeführt.

Primärquellen

Mit dem Wan-Video/Wan2.2 README abgeglichen · 28. August 2026

© 2026 wan2.video