MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding
تقدم هذه الورقة MSJoE، وهو إطار عمل مبتكر يطور بشكل مشترك نموذج لغة كبير متعدد الوسائط ومُنتقي إطارات رئيسية خفيف الوزن عبر التعلم التعزيزي لاختيار الإطارات المعلوماتية بكفاءة لفهم الفيديو طويل المدى، محققاً أداءً هو الأفضل في فئته على عدة معايير مرجعية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول حل لغز، ولكن بدلاً من الحصول على بضعة أدلة، تم تسليمك شريط كاميرا أمنية مدته 10 ساعات لمدينة مزدحمة. يتعين عليك العثور على اللحظة التي أسقط فيها شخص ما مفتاحاً.
إذا شاهدت الشريط بأكره بسرعة عادية، فسيستغرق الأمر وقتاً طويلاً جداً. وإذا شاهدت كل 10 ثوانٍ فقط (أخذ عينات منتظمة)، فقد تفوت لحظة سقوط المفتاح لأنها حدثت في جزء من الثانية بين نظراتك.
هذه هي المشكلة التي يحلها نظام MSJoE للذكاء الاصطناعي.
إليك شرح مبسط لكيفية عمل هذا النظام الجديد، باستخدام بعض التشبيهات الإبداعية.
المشكلة: عنق الزجاجة المتمثل في "المعلومات الزائدة عن الحد"
نماذج الذاء الاصطناعي الحالية (التي تسمى MLLMs) تشبه المحققين البارعين الذين يمكنهم قراءة وفهم النصوص والصور. ولكن عندما تعطيهم فيديو طويلاً، يصابون بالإرهاق.
- الطريقة القديمة: يحاولون النظر إلى كل إطار، أو يختارون إطارات في فترات زمنية عشوائية (مثل التحقق من ساعتك كل 5 دقائق). هذا بطيء وغالباً ما يفوّت الأشياء المهمة.
- العيب: معظم الفيديو ممل (ناس يمشون، سحب تتحرك). يستهلك الذكاء الاصطناعي قدراته الذهنية في الأجزاء المملة ويفوت "الإطارات المفتاحية" (أدلة المحقق).
الحل: فريق "المحقق الذكي والكشاف"
ابتكر مؤلفو هذه الورقة البحثية فريقاً من وكيلين للذكاء الاصطناعي يتعلمان العمل معاً بشكل مثالي. أطلقوا عليه اسم MSJoE (نموذج MLLM وكشاف يتطوران معاً).
تخيل الأمر كفريق مكون من محقق وكشاف.
1. الكشاف (The Sampler)
مهمة الكشاف هي مشاهدة الفيديو الذي مدته 10 ساعات واختيار الـ 32 إطاراً الأكثر أهمية لعرضها على المحقق.
- الكشافون القدامى: استخدموا قواعد بسيطة (مثلاً: "اختر إطاراً كل 5 دقائق"). أحياناً كانوا يختارون إطارات مملة.
- كشاف MSJoE: هذا الكشاف "قابل للتدريب". فهو يتعلم البحث عن أشياء محددة. لكنه لا يستطيع تخمين ما يبحث عنه بمفرده بعد.
2. المحقق (The MLLM)
المحقق هو العقل الكبير. ينظر إلى الإطارات التي يحضرها الكشاف ويجيب على السؤال.
- المشكلة: إذا قال المحقق فقط: "ابحث عن المفتاح"، فقد لا يعرف الكشاف كيف يبدو "المفتاح" في سياق الفيديو.
- محقق MSJoE: بدلاً من مجرد قول "ابحث عن المفتاح"، يقوم المحقق أولاً بالتفكير وتفكيك السؤال إلى أدلة بصرية محددة.
- سؤال سيء: "من الذي أسقط المفتاح؟"
- أدلة محقق MSJoE: "أرني يداً تمسك بجسم معدني"، "أرني شخصاً ينظر إلى الأرض"، "أرني جسماً لامعاً على الرصيف".
كيف يتعلمان معاً ("التطور المشترك")
هذا هو الجزء السحري. في الطرق السابقة، كان يتم تدريب المحقق والكشاف بشكل منفصل. لم يكن المحقق يعرف كيف يختار الكشاف الإطارات، ولم يكن الكشاف يعرف ما يحتاجه المحقق.
في MSJoE، يتم تدريبهما معاً باستخدام طريقة تسمى التعلم التعزيزي (Reinforcement Learning) (فكر في الأمر كأنه لعبة فيديو حيث تحصل على نقاط عند الفوز).
الحلقة:
- المحقق ينظر إلى معاينة صغيرة للفيديو ويكتب قائمة من "الأدلة البصرية" (الاستعلامات).
- الكشاف يستخدم تلك الأدلة لمسح الفيديو بالكامل ويختار أفضل الإطارات.
- المحقق ينظر إلى تلك الإطارات ويجيب على السؤال.
- إذا حصلوا على الإجابة الصحيحة: يحصل كلاهما على "هاي فايف" (مكافأة).
- إذا أخطأوا: يتعلم كلاهما ما الذي سار بشكل خاطئ.
النتيجة:
- يتعلم المحقق كتابة أدلة أفضل وأكثر تحديداً حتى يتمكن الكشاف من العثور على الإطارات الصحيحة.
- يتعلم الكشاف تجاهل الأجزاء المملة والتركيز تماماً على ما يطلبه المحقق.
- يتطوران معاً، ليصبحا فريقاً مثالياً.
"المعسكر التدريبي" (مجموعة البيانات الجديدة)
لتدريب هذا الفريق، أدرك الباحثون أن الفيديوهات الموجودة لم تكن صعبة بما يكفي. لذا، قاموا ببناء "نادي رياضي" جديد (مجموعة بيانات تسمى LongVideoQA).
- أخذوا 2,800 فيديو طويل (أفلام، رياضات، وثائقيات).
- استخدموا الذكاء الاصطناعي لتوليد آلاف الأسئلة الصعبة التي تتطلب ربط الأحداث عبر الزمن (على سبيل المثال: "لماذا غيرت الشخصية نظامها الغذائي؟" يتطلب رؤية زيارة طبيب الأسنان و وجبة العشاء العائلية).
- قاموا بتصفية الأسئلة السهلة حتى يتدرب فريق الذكاء الاصطناعي على الأمور الصعبة فقط.
لماذا يهم هذا؟
- السرعة: إنه أسرع بكثير. بدلاً من معالجة 1,000 إطار، يعالج 32 إطاراً فقط.
- الذكاء: لا يخمن فحسب؛ بل يفكر في ما الذي يجب البحث عنه قبل البحث فعلياً.
- نتائج أفضل: في الاختبارات، تفوق هذا الفريق على أفضل الطرق السابقة بفارق كبير (حوالي 8% أفضل في الدقة).
الخلاصة
تخيل أنك تحاول العثادة إبرة في كومة قش.
- الذكاء الاصطناعي القديم: يلتقط حفنة من القش من أماكن عشوائية.
- MSJoE: يسأل أولاً، "كيف تبدو الإبرة؟" ثم يرسل مغناطيساً (الكشاف) لسحب الأجزال المعدنية فقط، وأخيراً يفحص المعدن ليجد الإبرة.
من خلال تعليم الذكاء الاصطناعي كيف يفكر فيما يبحث عنه وكيف يتعلم كيفية البحث عنه في نفس الوقت، جعلوا فهم الفيديو الطويل فعالاً، دقيقاً، وأكثر ذكاءً بكثير.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.