ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs
تُعد ReGATE إطار عمل قائم على نموذج المعلم والطالب يعمل على تسريع تدريب النماذج اللغوية الكبيرة متعددة الوسائط من خلال تقليم الرموز الزائدة بشكل تكيفي باستخدام خسائر التوجيه وتقديرات الصعوبة، مما يحقق تقارباً أسرع وأداءً فائقاً مع تقليل إجمالي استهلاك الرموز بشكل كبير.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت ذكي جداً كيف يفهم الفيديوهات. في الوقت الحالي، الطريقة القياسية للقيام بذلك تشبه إجبار الروبوت على قراءة كل كلمة في النص، حتى الكلمات المملة مثل "الـ" أو "هو" أو "و"، بينما يشاهد فيلماً. هذا الأمر بطيء للغاية، ومكلف، ويهدر الكثير من الطاقة لأن الروبوت يقوم بعمل غير ضروري.
تقدم الورقة البحثية طريقة جديدة تسمى REGATE (حذف الرموز التكيفي الموجه بالمرجع). فكر في REGATE كـ مدرب دراسة فائق الكفاءة يساعد الروبوت على التعلم بشكل أسرع من خلال إخباره بالضبط بالكلمات التي يجب أن يركز عليها والكلمات التي يجب أن يتخطاها.
إليك كيف يعمل ذلك، باستخدام تشبيهات بسيطة:
1. المشكلة: قراءة النص بالكامل
في الطريقة القديمة (التدريب القياسي)، يقوم الروبوت بمعالجة كل "رمز" (قطعة نصية) في وصف الفيديو.
- التشبيه: تخيل أنك تحاول تعلم لغة جديدة من خلال قراءة كتاب حيث يتم تحديد كل كلمة فيه بلون نيون ساطع. تقضي ساعات في التحديق في الكلمات الشائعة مثل "الـ" أو "هذا"، والتي لا تعلمك الكثير فعلياً عن القصة. تصاب بالتعب، وتتعلم ببطء.
2. الحل: "المعلم" و"الطالب"
يستخدم REGATE فريقاً من شخصين:
- الطالب: هذا هو نموذج الروبوت الرئيسي الذي نحاول تدريبه. إنه ينظر إلى كل من الفيديو والنص.
- المعلم: هذا نسخة "مجمدة" (غير متغيرة) من الروبوت الذي يرى النص فقط. لا يمكنه رؤية الفيديو.
كيف يعملان معاً:
ينظر المعلم إلى جملة ويسأل: "هل يمكنني تخمين معنى هذه الكلمة بمجرد قراءة النص، دون رؤية الفيديو؟"
- إذا كانت الكلمة هي "الـ" أو "هو"، يقول المعلم: "سهل! أنا أعرف هذا".
- إذا كانت الكلمة هي "أحمر"، أو "يدور"، أو "يمزج"، يقول المعلم: "مهلاً، لا يمكنني تخمين هذا بدون رؤية الصورة! هذه الكلمة تحتاج إلى الفيديو".
3. "درجة الصعوبة"
يجمع REGATE بين تخمين المعلم وسجل الطالب الخاص.
- التشبيه: تخيل أن الطالب يؤدي اختباراً تجريبياً. يحتفظ REGATE بسجل للأسئلة التي يستمر الطالب في الخطأ فيها.
- إذا قال المعلم: "أنت بحاجة إلى الفيديو لهذه الكلمة"، وَ استمر الطالب في مواجهة صعوبة مع كلمات مماثلة من قبل، فإن REGATE يضع علامة على تلك الكلمة بأنها "أولوية عالية".
- إذا قال المعلم: "أنا أعرف هذه الكلمة"، وكان الطالب قد أتقنها بالفعل، فإن REGATE يضع علامة عليها بأنها "تخطي".
4. النتيجة: "التخطي الذكي"
أثناء التدريب، ينشئ REGATE قناعاً (Mask). إنه يخبر الروبوت: "اقرأ هذه الكلمات المهمة، ولكن تخطَّ الكلمات المملة".
- التشبيه: بدلاً من قراءة صفحة الكتاب بأكملها صفحة بصفحة، يقرأ الروبوت الآن فقط الجمل المظللة التي تدفع القصة للأمام فعلياً. إنه يتجاهل كلمات الحشو.
- الفائدة: يقوم الروبوت بـ عمل أقل بنسبة 40% (يعالج رموزاً أقل) ولكنه يتعلم بنفس القدر أو حتى بشكل أفضل، لأنه لا يهدر طاقته في أشياء يعرفها بالفعل.
ما تدعيه الورقة البحثية (النتائج)
اختبر المؤلفون هذه الطريقة على ثلاثة أنواع مختلفة من روبوتات تعلم الفيديو:
- VideoChat2
- VideoLLaMA2
- InternVL3.5
وقد وجدوا أن:
- السرعة: وصلت الروبوتات إلى ذروة أدائها بسرعة مضاعفة عن المعتاد.
- الكفاءة: استخدمت 38% فقط من الرموز (الكلمات/القطع) مقارنة بالطريقة القياسية.
- الدقة: في كثير من الحالات، أصبحت الروبوتات التي تدربت باستخدام REGATE أكثر ذكاءً من تلك التي تدربت بالطريقة القديمة، خاصة في أسئلة الفيديو المعقدة.
- لا تكلفة إضافية: لا تتطلب هذه الطريقة بناء روبوت جديد أو إضافة أجزاء إضافية؛ فهي تغير فقط كيفية قراءة الروبوت أثناء التدريب.
الملخص
REGATE هو بمثابة فلتر ذكي لتدريب الذكاء الاصطناعي. بدلاً من جعل الذكاء الاصطناعي يقرأ كل كلمة في النص، فإنه يستخدم خبيراً "نصياً فقط" لتحديد الكلمات التي تحتاج فعلياً إلى سياق الفيديو لفهمها. ومن خلال تخطي الكلمات السهلة والمتكررة، يتعلم الذكاء الاصطناعي بشكل أسرع، ويستخدم كهرباء أقل، وغالباً ما ينتهي به الأمر أكثر ذكاءً مما لو كان قد قرأ كل شيء.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.