वीडियो से ऑडियो

वीडियो-टू-ऑडियो (V2A) S2V का विपरीत हैः मूक (या कम स्कोर) चित्र में, साउंडट्रैक आउट। Wan2.2 T2V/I2V ऐसा नहीं करते हैं। इस साइट पर खुला साथी ThinkSound (FunAudioLLM) है, एक CoT-निर्देशित प्रवाह-मिलान Any2Audio मॉडल।

ThinkSoundV2Afoley
इस पृष्ठ पर 5
मूक वीडियो में थिंकसाउंड फिर म्यूज़ ध्वनि ट्रैक
सामान्य 2.2 कार्यप्रवाहः मौन Wan फ्रेम उत्पन्न करें, फिर V2A मॉडल और mux चलाएं।

यह एक अलग मॉडल क्यों है

T2V/I2V डीटी को आरजीबी (या VAE) लटेंट्स को अस्वीकार करने के लिए प्रशिक्षित किया जाता है। V2A मॉडल वीडियो सुविधाओं (CLIP/सिंक), कैप्शन और अक्सर सोच श्रृंखला पर स्थित ऑडियो लटेंट्स को अस्वीकार करता है। उन सिरों को एक 2.2 खुली सीसीपीटी में मिलाकर जुलाई 2025 रिलीज का हिस्सा नहीं था।

इस उपकरण परिवार में सोच ध्वनि

  • पेपर: ऑडियो जनरेशन और संपादन के लिए एमएलएलएम में सोच-विचार श्रृंखला (arXiv:2506.21448, NeurIPS 2025) ।
  • तीन चरणः वीडियो से फ़ोली, ऑब्जेक्ट-केंद्रित परिष्करण (क्लिक/क्षेत्र), भाषा-निर्देशित संपादन।
  • रीढ़ की हड्डीः VideoLLaMA 2 CoT के साथ MM-DiT; FunAudioLLM/ThinkSound पर Hugging Face वजन।

व्यावहारिक मक्स

Wan clips फ्रेम रेट और अवधि रखें। एक मेल खाने लंबाई पर ऑडियो उत्पन्न करें, फिर ffmpeg -c:v कॉपी -c:a aac। यदि आपको लिप-सिंक भाषण की आवश्यकता है, तो S2V के बजाय V2A V2A पर जाएं आपके पास पहले से ही एक wav से एक विशिष्ट अभिनेता के मुंह को पुनर्निर्माण नहीं करेगा।

अक्सर पूछे जाने वाले प्रश्न

TI2V-5B आउटपुट एएसी कर सकते हैं?
नहीं. डिकोड वीडियो फ्रेम है। कोई भी साउंडट्रैक एक दूसरा मॉडल या बाद में बंद Wan API है।
क्या प्रिज्म ऑडियो वही है?
प्रिज्म ऑडियो थिंकसाउंड के लेखकों की एक अनुवर्ती V2A लाइन (CoT-RL) है। एक ही समस्या परिवार, अलग-अलग चेकपॉइंट।

प्राथमिक स्रोत

Wan-Video/Wan2.2 README से सत्यापित · 28 अगस्त 2026

© 2026 wan2.video