Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models
تقترح هذه الورقة إطار عمل متكاملًا لفهم الفيديو طويل التنسيق بكفاءة في النماذج متعددة الوسائط الكبيرة، يجمع بين عينة فيديو تكيفية قائمة على كثافة المعلومات وضواغط مكانية-زمانية قائمة على المشفّر التلقائي للتغلب على قيود الذاكرة واستخراج المعلومات التمييزية من تسلسلات الفيديو الزائدة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك فيلمًا ضخمًا مدته 3 ساعات موضوعًا على مكتبك، وتريد من مساعد ذكاء اصطناعي فائق الذكاء (نموذج لغوي متعدد الوسائط - MLLM) أن يشاهده ويجيب على سؤال محدد حوله.
المشكلة؟ ذلك الفيلم كبير جدًا.
إذا حاولت تغذية الذكاء الاصطناعي بالفيلم بأكمله، فالأمر يشبه محاولة الشرب من خرطوم إطفاء حريق. سيصاب الذكاء الاصطناعي بالارتباك، وينفد منه الذاكرة، ويبدأ في "الهلوسة" (اختلاق أشياء من خياله) لأنه يغرق في الكثير من البيانات. معظم الفيلم عبارة عن أشخاص يجلسون بلا حراك، أو يمشون ببطء، أو يحدقون في حائط—الكثير من الأشياء "المملة" التي لا تساعد في الإجابة على السؤال.
يقدم هذا البحث نظامًا من خطوتين لحل هذه المشكلة، حيث يعمل مثل محرر أفلام فائق الكفاءة للذكاء الاصطناعي.
الحل المكون من خطوتين
بنى المؤلفون نظامًا يحتوي على أداتين رئيسيتين:
1. "القاص الذكي" (أخذ عينات الفيديو التكيفي - AVS)
التشبيه: تخيل أنك محرر أفلام تحاول العثور على أكثر اللحظات إثارة في فيلم وثائقي مدته 3 ساعات.
- الطريقة القديمة (أخذ العينات المنتظم): تمسك بمقص وتقص قطعة من الفيلم كل 10 ثوانٍ، بغضًا عما يحدث. قد تقص 10 ثوانٍ مملة لرجل نائم، ثم تقص مشهد انفجار مدته 10 ثوانٍ، ثم تقص مشهدًا مملًا آخر. أنت تضيع "وقت التحرير" الخاص بك على الأشياء المملة.
- الطالطريقة الجديدة (AVS): هذه الأداة تشبه محررًا ذكيًا يمتلك حاسة سادسة. فهي تشاهد الفيديو وتقص فقط الإطارات التي يتغير فيها شيء ما بالفعل. إذا استقرت الكاميرا على غرفة ساكنة لمدة 5 دقائق، فهي تتخطاها. وبمجرد أن يفتح باب أو يتحدث شخص ما، تلتقط ذلك الإطار.
- النتيجة: بدلاً من عرض 1,000 إطار للذكاء الاصطناعي (معظمها متطابق)، تعرض له الـ 20 إطارًا الأكثر أهمية التي تروي القصة.
2. "الضاغط السحري" (ضاغط الفيديو المكاني والزماني - SVC)
التشبيه: الآن بعد أن حصلت على أفضل 20 إطارًا، لا تزال هذه الملفات عالية الدقة وثقيلة. أنت بحاجة إلى تصغير حجمها حتى يتمكن الذكاء الاصطناعي من حملها بسهولة، ولكن لا يمكنك مجرد سحقها لتصبح كتلة غير مفهومة.
- الطريقة القديمة (التجميع المتوسط - Average Pooling): تخيل أنك أخذت 10 صور لقطة و10 صور لكلب، وخلطتهم جميعًا في خلاط، ثم قدمت للذكاء الاصطناً "عصيرًا رماديًا". ستفقد التفاصيل! لن يستطيع الذكاء الاصطناعي التمييز بين قطة وكلب.
- الطريقة الجديدة (SVC): هذه مثل خوارزمية ضغط عالية التقنية (تشبه طريقة عمل ملف ZIP، ولكنها أذكى). فهي تتعلم كيفية "تلخيص" المعلومات المرئية. تأخذ بيانات الفيديو الخام وتضغطها في "فضاء كامن" (Latent Space) صغير وكثيف (كود سري).
- السر الخفي: لقد دربوا هذا الضاغط باستخدام طريقة "المعلم والطالب". يحاول الضاغط تصغير الفيديو، ويحاول "المفكك" (Decoder) إعادة بناء الفيديو الأصلي من هذا التصغير. إذا فشل المفكك في إعادة بناء الصورة، يدرك الضاغط أنه تخلص من معلومات مهمة للغاية ويحاول مرة أخرى. هذا يضمن حصول الذكاء الاصطناعي على ملف صغير لا يزال يحتفظ بجميع التفاصيل الحاسمة.
كيف يعمل كل ذلك معًا
- المدخلات: تعطي النظام فيديو مدته ساعتان.
- الخطوة 1 (القاص): يقوم "القاص الذكي" بمسح الفيديو، ويتجاهل الأجزاء المملة، ويختار فقط اللحظات الرئيسية التي يحدث فيها الفعل.
- الخطوة 2 (الضاغط): يأخذ "الضاغط السحري" تلك اللحظات الرئيسية ويصغر حجمها بمقدار 64 مرة. إنه يحول كومة ضخمة من البيانات المرئية إلى حزمة صغيرة وفعالة.
- الخطوة 3 (الذكاء الاصطناعي): يتلقى الذكاء الاصطناعي (النموذج اللغوي الكبير) هذه الحزمة الصغيرة وعالية الجودة. ولأن البيانات فعالة للغاية، يمكن للذكاء الاصطناعي "قراءة" الفيديو الكامل لمدة ساعتين في ذهنه دون التعرض لصداع أو نفاد الذاكرة.
لماذا يعد هذا أمرًا بالغ الأهمية؟
- الكفاءة: يستخدم النظام رموزًا مرئية (Visual Tokens) أقل بنسبة 80% من النماذج الرائدة السابقة. الأمر يشبه الحصول على نفس الإجابة من مكتبة باستخدام بطاقة فهرسة واحدة فقط بدلاً من قراءة كل الكتب.
- الدقة: نظرًا لأنه لا ينزعج من البيانات المملة، فإنه يجيب على الأسئلة بشكل أفضل. في الاختبارات، تفوق على النماذج الرائدة الأخرى في اختبارات معيارية مثل EgoSchema و PerceptionTest.
- لا "هلوسة": من خلال الحفاظ على المعلومات "التمييزية" (الأشياء التي تهم حقًا) والتخلص من الضجيج، يصبح من غير المرجح أن يخترع الذكاء الاصطناعي حقائق.
الخلاصة
يعلمنا هذا البحث أنه لفهم فيديو طويل، لا تحتاج إلى إظهار كل شيء للذكاء الاصطناعي. أنت فقط بحاجة إلى إظهار الأشياء الصحيحة، في أصغر حزمة ممكنة. إنه الفرق بين تسليم شخص رواية مكونة من 500 صفحة وبين تسليمه ملخصًا مكتوبًا بإتقان من 5 صفحات يلخص جوهر القصة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.