Wiki に戻る タスク

動画から音声

ビデオからオーディオ (V2A) は S2V の逆である.静かな (またはスコア不足) 画像が入っている,サウンドトラックが出ている. Wan2.2 T2V/I2V はこれをしない.このサイトのオープンパートナーは,CoTガイドフローマッチングの Any2AudioモデルであるThinkSound (FunAudioLLM) です.

ThinkSoundV2Afoley
このページの目次 5
音声のないビデオを シンクサウンドに 収録した
典型的な 2.2 ワークフロー:静かな Wan フレームを生成し, V2A モデルと mux を実行します.

なぜこのモデルは違うのか

T2V/I2V DTs は RGB (または VAE) の latences を否定するために訓練されています. V2A モデルは,ビデオ機能 (CLIP/Sync) に条件付けされたオーディオ latences (音声 latences) を否定します.これらのヘッドを2.2 のオープン ckpt に混合することは,2025年7月のリリースの一部ではありませんでした.

ツールファミリーでThinkSound

  • 論文:オーディオ生成および編集のためのMLLMにおける思考連鎖推論 (arXiv:2506.21448,NeurIPS 2025).
  • 3つの段階:ビデオからフォリー,オブジェクト中心のリファイン (クリック/地域),言語指导による編集.
  • 脊椎: VideoLLaMA 2 CoT の MM-DiT; FunAudioLLM/ThinkSound の Hugging Face の重量.

実践的なマックス

Wan clipのフレームレートと長さを保持します. 音声を一致する長さで生成し, ffmpeg -c:vコピー -c:a aac. 唇同調スピーチが必要な場合は, S2V に移動して V2A V2A ではなく,既に持っている波動から特定のアクターの口を再構築しません.

よくある質問

TI2V-5B は AAC を出せるか?
解码はビデオフレーム.どんなサウンドトラックも2番目のモデルまたは後に閉じた Wan APIです.
プリズムオーディオは同じですか?
PrismAudioはThinkSoundの著者からの V2Aのフォローアップライン (CoT-RL) です.同じ問題ファミリー,異なるチェックポイントです.

一次資料

Wan-Video/Wan2.2 README と照合済み · 2026年8月28日

© 2026 wan2.video