Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks
تقدم هذه الورقة البحثية "Many-for-Many"، وهو إطار عمل موحد يستخدم محولات خفيفة الوزن واستراتيجية تعلم مشتركة للصور والفيديو لتدريب نموذج تأسيسي واحد قادر على أداء أكثر من عشر مهام متنوعة للتوليد والمعالجة البصرية، محققاً أداءً تنافسياً مع الاستفادة من البيانات من مصادر متعددة للتغلب على التكلفة العالية للتدريب الخاص بكل مهمة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مكتبة ضخمة من التعليمات لإنشاء الفنون. بعض التعليمات تقول: "ارسم قطة"، وأخرى تقول: "حول هذه الصورة لقطة إلى فيديو"، وبعضها يقول: "أصلح الأجزاء الضبابية في هذا الفيديو" أو "لوّن هذا الفيلم الأبيض والأسود".
عادةً، للقيام بكل هذه الأشياء، تحتاج إلى متخصص مختلف لكل وظيفة. ستحتاج إلى "طباخ نص-إلى-فيديو"، و"طباخ صورة-إلى-فيديو"، و"طباخ تحرير فيديو". تدريب كل هؤلاء الطباخين من الصفر أمر مكلف للغاية ويتطلب كميات هائلة من المكونات عالية الجودة (البيانات).
إليك "العديد-للكثير" (Many-for-Many - MfM).
قام مؤلفو هذه الورقة البحثية ببناء "طباخ خارق" يمكنه القيام بكل هذه الوظائف في وقت واحد. بدلاً من توظيف عشرة متخصصين مختلفين، قاموا بتدريب نموذج واحد فقط يمكنه التعامل مع أكثر من 10 أنواع مختلفة من المهام البصرية، بدءاً من إنشاء الفيديوهات من الصفر وصولاً إلى تحرير الفيديوهات الموجودة.
إليك كيف فعلوا ذلك، باستخدام تشبيهات بسيطة:
1. المحول العالمي (مقبض "السكين السويسري")
تتطلب المهام المختلفة "مدخلات" مختلفة.
- نص-إلى-فيديو: تعطيه جملة.
- صورة-إلى-فيديو: تعطيه صورة.
- تحرير الفيديو: تعطيه فيديو مع "قناع" (قالب يوضح الأجزاء المراد تغييرها).
عادةً، تكون هذه المدخلات مثل قطع أحجية (بازل) ذات أشكال مختلفة لا تتناسب مع نفس الفتحة. صمم فريق MfM محولاً خفيف الوزن. فكر في هذا كأنه مقبض عالمي أو ملحق لسكين سويسري. إنه يأخذ النص، والصورة، والفيديو، والقناع، وحتى خريطة العمق (مخطط للمساحة ثلاثية الأبعاد، مثل الخريطة الطبوغرافية للمشهد) ويعيد تشكيلها جميعاً لتصبح بنفس التنسيق. هذا يسمح للنموذج بفهم أي تعليمات، بغض النظر عن شكلها.
2. استراتيجية "التعلم المشترك" (طريقة "المتدرب")
تدريب ذكاء اصطناوي للفيديو من الصفر يشبه عادةً محاولة تعليم شخص ما الركض في ماراثون قبل أن يتعلم المشي. يتطلب الأمر ملايين الأمثلة المرئية المكلفة.
يستخدم MfM خدعة تدريب ذكية تسمى التعلم المشترك للصورة والفيديو.
- المرحلة الأولى: يبدأون بتعليم النموذج مهام "الصورة" البسيطة (مثل رسم صورة من نص). هذا أمر رخيص وسهل.
- المرحلة الثانية: يقدمون مهام "الفيديو" ببطء.
- السحر: نظرًا لأن النموذج تعلم الأساسيات "البصرية" من الصور، فإنه لا يحتاج إلى الكثير من أمثلة الفيديو المكلفة ليتعلم كيفية جعل الأشياء تتحرك. الأمر يشبه متدرباً يتعلم تقطيع الخضروات (الصور) أولاً؛ عندما ينتقل إلى طهي الحساء (الفيديو)، يكون قد تعلم بالفعل كيفية التعامل مع المكونات.
وهذا يعني أنهم استطاعوا تدريب نموذج قوي بقدر 8 مليارات معلمة (parameter) باستخدام 10% فقط من بيانات الفيديو التي تستخدمها النماذج الرائدة الأخرى.
3. نظام "3D RoPE" (جهاز الـ GPS للزمان والمكان)
لجعل الفيديوهات تبدو طبيعية، يحتاج النموذج ليس فقط لمعرفة أين توجد الأشياء (يسار، يمين، فوق، تحت) ولكن أيضاً متى تحدث (الإطار الأول، الإطار الأخير).
قام الفريق بترقية "نظام تحديد المواقع" الداخلي للنموذج (المسمى 3D RoPE). فبدلاً من مجرد معرفة موقع البكسل على شاشة مسطحة، أصبح النموذج الآن يفهم الموقع في مساحة ثلاثية الأبعاد وعبر الزمن. يساعد هذا النموذج على إنشاء حركات سلسة وواقعية بدلاً من الحركات المتشنجة وغير الطبيعية.
4. النتائج: نموذج واحد، قدرات خارقة متعددة
اختبر الفريق هذا "الطباخ الخارق" على حجمين: نسخة أصغر بـ 2 مليار ونسخة أكبر بـ 8 مليارات.
- تعدد الاستخدامات: يمكن للنموذج أداء أكثر من 10 مهام مختلفة، بما في ذلك:
- الإنشاء: تحويل النص إلى فيديو، أو الصور إلى فيديو.
- التمديد: أخذ مقطع قصير وجعله أطول.
- التحرير: إزالة الأشياء (Inpainting)، إضافة مناظر طبيعية جديدة (Outpainting)، أو تغيير الألوان.
- التحسين: جعل الفيديوهات الضبابية حادة وواضحة (Super-resolution).
- الأداء: في الاختبارات المباشرة ضد نماذج شهيرة (مثل Wan2.1، وHunyuan، وحتى العمالقة التجاريين مثل Sora)، كان نموذج MfM تنافسياً للغاية. وغالباً ما احتل المرتبة الأولى أو الثانية في الاتساق العام وجودة الحركة، على الرغم من استخدامه لبيانات أقل بكثير.
الخلاصة
تزعم الورقة البحثية أنه من خلال توحيد عملية التدريب واستخدام "محول" ذكي لخلط أنواع مختلفة من البيانات، تمكنوا من إنشاء نموذج واحد فعال يضاهي، وأحياناً يتفوق على، النماذج المتخصصة التي تم تدريبها لمهمة واحدة محددة فقط. لقد أثبتوا أنك لست بحاجة إلى أداة منفصلة لكل وظيفة إذا بنيت أداة واحدة متعددة الاستخدامات تتعلم من مجموعة واسعة من التجارب.
ما لا تدعيه الورقة البحثية:
تركز الورقة البحثية حصرياً على التدريب التقني وأداء النموذج في المعايير القياسية. وهي لا تدعي حل مشكلات سريرية محددة، كما أنها لا تفصل منتجات تجارية مستقبلية محددة بخلاف الإصدار مفتوح المصدر للكود وأوزان النموذج. إنها خطوة بحثية تأسيسية، وليست تطبيقاً استهلاكياً نهائياً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.