यह एक अलग मॉडल क्यों है
T2V/I2V डीटी को आरजीबी (या VAE) लटेंट्स को अस्वीकार करने के लिए प्रशिक्षित किया जाता है। V2A मॉडल वीडियो सुविधाओं (CLIP/सिंक), कैप्शन और अक्सर सोच श्रृंखला पर स्थित ऑडियो लटेंट्स को अस्वीकार करता है। उन सिरों को एक 2.2 खुली सीसीपीटी में मिलाकर जुलाई 2025 रिलीज का हिस्सा नहीं था।
इस उपकरण परिवार में सोच ध्वनि
- पेपर: ऑडियो जनरेशन और संपादन के लिए एमएलएलएम में सोच-विचार श्रृंखला (arXiv:2506.21448, NeurIPS 2025) ।
- तीन चरणः वीडियो से फ़ोली, ऑब्जेक्ट-केंद्रित परिष्करण (क्लिक/क्षेत्र), भाषा-निर्देशित संपादन।
- रीढ़ की हड्डीः VideoLLaMA 2 CoT के साथ MM-DiT; FunAudioLLM/ThinkSound पर Hugging Face वजन।
व्यावहारिक मक्स
Wan clips फ्रेम रेट और अवधि रखें। एक मेल खाने लंबाई पर ऑडियो उत्पन्न करें, फिर ffmpeg -c:v कॉपी -c:a aac। यदि आपको लिप-सिंक भाषण की आवश्यकता है, तो S2V के बजाय V2A V2A पर जाएं आपके पास पहले से ही एक wav से एक विशिष्ट अभिनेता के मुंह को पुनर्निर्माण नहीं करेगा।
अक्सर पूछे जाने वाले प्रश्न
- TI2V-5B आउटपुट एएसी कर सकते हैं?
- नहीं. डिकोड वीडियो फ्रेम है। कोई भी साउंडट्रैक एक दूसरा मॉडल या बाद में बंद Wan API है।
- क्या प्रिज्म ऑडियो वही है?
- प्रिज्म ऑडियो थिंकसाउंड के लेखकों की एक अनुवर्ती V2A लाइन (CoT-RL) है। एक ही समस्या परिवार, अलग-अलग चेकपॉइंट।
प्राथमिक स्रोत
Wan-Video/Wan2.2 README से सत्यापित · 28 अगस्त 2026