MOVA: Towards Scalable and Synchronized Video-Audio Generation
إن MOVA هو نموذج مفتوح المصدر، بـ 32 مليار معلمة من نوع "خليط الخبراء" (Mixture-of-Experts)، مصمم لتوليد الصور والنصوص والفيديو والصوت بشكل قابل للتوسع ومتزامن، مما يوفر محتوى متعدد الوسائط عالي الجودة بما في ذلك الكلام المتزامن مع حركة الشفاه والمؤثرات الصوتية المدركة للبيئة المحيطة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تشاهد فيلماً تتحرك فيه شفاه الممثلين بدقة مع الكلمات، وصوت تحطم الزجاج يحدث تماماً عند اصطدامه بالأرض، والموسيقى التصويرية تتصاعد ببراعة مع الحالة المزاجية للمشهد.
حالياً، تعاني معظم نماذج الذكاء الاصطناعي في هذا المجال. فهي تشبه رساماً موهوباً يمكنه رسم مشهد جميل ولكنه أصم تماماً، أو موسيقياً يمكنه عزف مقطوعة جميلة ولكنه كفيف. ولصنع "فيلم"، يتعين عليها عادةً استخدام أداتين مختلفتين: واحدة لصنع الفيديو وأخرى لـ "لصق" الصوت لاحقاً. وهذا يؤدي غالباً إلى تأثير "الدبلجة السيئة" حيث يبدو الصوت والصورة غير متزامنين قليلاً.
MOVA هو بمثابة مبدع تعلم أخيراً كيف يستخدم عينيه وأذنيه في الوقت ذاته وبدقة متناهية.
إليك تفصيل لكيفية قيامهم بذلك، باستخدام بعض التشبيهات البسيطة:
1. بنية "العقلين" (البرج المزدوج)
بدلاً من عقل واحد ضخم ومشتت يحاول القيام بكل شيء، بنى الباحثون MOVA بعقلين متخصصين (يُسميان الأبراج) يتواصلان مع بعضهما باستمرار:
- عقل الفيديو: خبير هائل في فهم الأشكال، والضوء، والحركة.
- عقل الصوت: متخصص يفهم الإيقاع، وطبقة الصوت، والنغمة.
- الجسر: هذا هو الجزء الأهم. تخيل راقصين يؤديان رقصة ثنائية؛ إذا لم ينظرا إلى بعضهما البعض، فسوف يتعثران. يعمل "الجسر" مثل تواصل بصري مستمر وتلامس جسدي، مما يضمن أنه عندما يقرر "عقل الفيديو" تحريك فم ما، يعرف "عقل الصوت" فوراً أنه يجب تشغيل الصوت المقابل.
2. "السيناريو المثالي" (هندسة البيانات)
لتعليم هذا النموذج، لا يمكنك مجرد عرض فيديوهات عشوائية عليه، بل يجب أن تعطيه "سيناريو مثالياً".
إذا عرضت على طفل فيديو لكلب ينبح، فأنت لا تقول له "كلب" فحسب، بل تقول: "كلب من فصيلة جولدن ريتريفر ينبح بصوت عالٍ في حديقة مشمسة بينما تزقزق العصافير في الخلفية".
بنى فريق MOVA "معلماً آلياً" ضخماً (خط إنتاج) ينظر إلى آلاف الساعات من الفيديو ويكتب أوصافاً تفصيلية للغاية لكل من المشاهد والأصوات. هذا يضمن أن النموذج يتعلم بالضبط أي صوت ينتمي إلى أي حركة بصرية.
3. "مقبض التحكم الذكي في الصوت" (التوجيه المزدوج الخالي من التصنيف)
عندما يقوم الذكاء الاصطناعي بتوليد فيديو، فإنه يحاول اتباع رئيسين مختلفين: النص الوصفي (ما طلبته أنت) والارتباط بين الوسائط (التأكد من مطابقة الصوت للفيديو).
أحياناً، قد يركز الذكاء الاصطناعي أكثر من اللازم على النص وينسى مزامنة الصوت، أو يركز كثيراً على المزامنة لدرجة تجعل الصوت يبدو آلياً.
يقدم MOVA "مقبضاً ذكياً" يسم يسمح للمستخدمين بموازنة هذين الأمرين. يمكنك رفع "مقبض المزامنة" إذا كنت تريد مزامنة شفاه مثالية لشخصية تتحدث، أو رفع "مقبض الإبداع" إذا كنت تريد فيديو سينمائياً وفنياً أكثر.
4. لماذا يهم هذا؟
قبل MOVA، كان توليد الفيديو والصوت عالي الجودة بمثابة "وصفة سرية" تمتلكها الشركات الكبرى المغلقة (مثل Sora من OpenAI). لكن MOVA هو مصدر مفتوح، مما يعني أنهم يسلمون الوصفة للعالم أجمع.
باختصار: MOVA ليس مجرد صانع فيديو أو صانع صوت؛ إنه راوٍ للقصص متعدد الوسائط يدرك أن الرؤية والسمع في العالم الحقيقي هما وجهان لعملة واحدة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.