LTX-2.3
المعيار الجديد لفيديو الذكاء الاصطناعي مفتوح المصدر. معمارية DiT بنموذج واحد مع مزامنة صوتية أصلية.
ما هو LTX-2.3؟
LTX-2.3 هو نموذج إنشاء فيديو بالذكاء الاصطناعي مفتوح المصدر من شركة Lightricks، ويمثل أحدث إصدار من عائلة LTX-2. إنه نموذج أساسي (Diffusion Transformer - DiT) قادر على إنشاء فيديو عالي الدقة وصوت متزامن في نفس الوقت.
يدعم أوضاع T2V (نص إلى فيديو)، I2V (صورة إلى فيديو)، و A2V (صوت إلى فيديو)، ويُشاد به كـ "Veo 3 مفتوح المصدر"، حيث يوفر تشغيلًا محليًا بتكلفة صفر وسرعات وجودة تنافس أفضل النماذج المغلقة.
LTX-2.3 مقابل LTX-2
| الميزة | LTX-2 (القديم) | LTX-2.3 (الحالي) |
|---|---|---|
| VAE والمساحة الكامنة | دقة قياسية | ✅ إعادة بناء لنسيج أكثر حدة بنسبة 40% |
| الالتزام بالمطالبة (Prompt) | يواجه صعوبة مع التعليمات المعقدة | ✅ سعة نصية 4x مع انتباه موجه (Gated Attention) |
| تناسق I2V | إطارات مجمدة في بعض الأحيان | ✅ متناسق للغاية، تشوهات أقل |
| جودة الصوت | ضوضاء خلفية ملحوظة | ✅ نقاء الاستوديو مع مزامنة بمستوى الملي ثانية |
دليل المطالبات المتقدمة LTX-2.3
الترتيب الزمني: صف التسلسلات خطوة بخطوة.
كلمات رئيسية سينمائية: استخدم "لقطة مقربة"، "لقطة رافعة"، إلخ.
الإضاءة: أضف "إضاءة حجمية"، "نيون"، إلخ.
إشارات الصوت: اذكر "جهير قوي"، "أصوات مطر" في المطالبات.
التحسينات الأساسية
محسن للإنتاج الاحترافي
تفاصيل أكثر حدة
شعر، وملمس، وحواف أكثر وضوحًا.
اتباع أقوى
انتباه موجه جديد للمطالبات المعقدة.
I2V واقعي
تقليل الإطارات المجمدة وتناسق أفضل.
صوت أنقى
فلترة محسنة + مشفر صوتي (Vocoder) جديد.
أبرز الميزات
عمودي أصلي
1080x1920 لـ TikTok/Shorts.
موجه بالصوت
الصوت يقود الحركة ومزامنة الشفاه.
متعدد الوسائط
يدعم الإطارات الرئيسية، والعمق/الوضعية/Canny.
المواصفات
التشغيل محليًا
- 01 موصى به: عقدة ComfyUI-LTXVideo المخصصة.
- 02 يدعم البرامج النصية الرسمية، وCLI، وFal.ai.
- 03 LTX Desktop: محرر احترافي مفتوح المصدر.
ملاحظات
"LTX-2.3 هو الحل النهائي المفتوح المصدر للفيديو/الصوت المتزامن."