تحويل الفيديو إلى صوت

الفيديو إلى الصوت (V2A) هو عكس S2V: الصورة الصامتة (أو أقل من النتيجة) في، المسطح الصوتي خارج. Wan2.2 T2V / I2V لا تفعل هذا. الشريك المفتوح على هذا الموقع هو ThinkSound (FunAudioLLM) ، نموذج Any2Audio يتناسب مع التدفق الذي يوجهه CoT.

ThinkSoundV2Afoley
محتويات الصفحة 5
فيديو صامت في ThinkSound ثم مس مسقط صوتي
سير العمل النموذجي 2.2: إنشاء إطارات صامتة Wan ، ثم تشغيل نموذج V2A ومكس.

لماذا هذا هو نموذج مختلف

T2V/I2V يتم تدريب المهنيين على إشكال RGB (أو VAE) غامضة. V2A النموذج يشير إلى غامضات الصوت المضطربة على ميزات الفيديو (CLIPالمزج هذه الرؤوس في واحد 2.2 مفتوحة لم يكن جزءا من إصدار يوليو 2025.

فكرصوت في هذه العائلة من الأدوات

  • ورقة: التفكير في سلسلة الأفكار في MLLMات لتوليد الصوت والتحرير (arXiv:2506.21448، NeurIPS 2025).
  • ثلاث مراحل: الصفحة من الفيديو، وتحسين مركز الموضوع (انقر/منطقة) ، والتحرير الذي يوجهه اللغة.
  • العمود الفقري:DiT مع VideoLLaMA 2 CoT؛ الوزن على Hugging Face (FunAudioLLM/ThinkSound)

المكس العملي

إبقوا Wan clips سرعة الإطار ومدة. توليد الصوت في طول متطابق، ثم ffmpeg -c:v نسخة -c:a aac. إذا كنت بحاجة إلى خطاب مزامنة شفاه، اذهب إلى S2V بدلاً من V2A — V2A لن يعيد بناء فم ممثل معين من الموجات التي لديك بالفعل

أسئلة شائعة

هل يمكن TI2V-5B ان تنطلق AAC؟
لا. التشريح هو إطار الفيديو. أي مسطح صوتي هو نموذج ثان أو مغلق لاحقا Wan API.
هل PrismAudio هو نفس الشيء؟
PrismAudio هو خط متابعة V2A (CoT-RL) من مؤلفي ThinkSound. نفس عائلة المشكلة، نقطة تفتيش مختلفة.

المصادر الأولية

تمت المراجعة وفق README لمشروع Wan-Video/Wan2.2 · 28 أغسطس 2026

© 2026 wan2.video