なぜこのモデルは違うのか
T2V/I2V DTs は RGB (または VAE) の latences を否定するために訓練されています. V2A モデルは,ビデオ機能 (CLIP/Sync) に条件付けされたオーディオ latences (音声 latences) を否定します.これらのヘッドを2.2 のオープン ckpt に混合することは,2025年7月のリリースの一部ではありませんでした.
ツールファミリーでThinkSound
- 論文:オーディオ生成および編集のためのMLLMにおける思考連鎖推論 (arXiv:2506.21448,NeurIPS 2025).
- 3つの段階:ビデオからフォリー,オブジェクト中心のリファイン (クリック/地域),言語指导による編集.
- 脊椎: VideoLLaMA 2 CoT の MM-DiT; FunAudioLLM/ThinkSound の Hugging Face の重量.
実践的なマックス
Wan clipのフレームレートと長さを保持します. 音声を一致する長さで生成し, ffmpeg -c:vコピー -c:a aac. 唇同調スピーチが必要な場合は, S2V に移動して V2A V2A ではなく,既に持っている波動から特定のアクターの口を再構築しません.
よくある質問
- TI2V-5B は AAC を出せるか?
- 解码はビデオフレーム.どんなサウンドトラックも2番目のモデルまたは後に閉じた Wan APIです.
- プリズムオーディオは同じですか?
- PrismAudioはThinkSoundの著者からの V2Aのフォローアップライン (CoT-RL) です.同じ問題ファミリー,異なるチェックポイントです.
一次資料
Wan-Video/Wan2.2 README と照合済み · 2026年8月28日