← أحدث الأبحاث
💻 computer science

Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding

يُعد EviSelect إطار عمل للاختيار البصري الديناميكي دقيق التفاصيل، يستفيد من أدلة الانتباه الداخلية لنموذج لغوي كبير متعدد الوسائط (MLLM) عبر التعبئة المسبقة المتفرقة لتوجيه سياسة عشوائية محسنة، مما يتيح أخذ عينات مكانية-زمانية تكيفية تقلل بشكل كبير من التكاليف الحسابية وتسرع فهم الفيديو الطويل مع الحفاظ على أداء فائق.

المؤلفون الأصليون: Bo Zhang, Wenxin Wang, Feng Chen, Zhihao Zhang, Zixuan Wang, Changsheng Li, Yinjie Lei

نُشر 2026-08-07
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Bo Zhang, Wenxin Wang, Feng Chen, Zhihao Zhang, Zixuan Wang, Changsheng Li, Yinjie Lei

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت فائق الذكاء كيف يشاهد فيلماً ويجيب على أسئلة حوله. هذا الروبوت، المعروف باسم "النموذج اللغوي الكبير متعدد الوسائط" (أو MLLM اختصاراً)، موهوب للغاية في فهم الصور والكلمات. ومع ذلك، هناك مشكلة: الأفلام طويلة، والروبوتات لديها "ذاكرة قصيرة المدى" محدودة. إذا قمت بتغذية الروبوت بفيلم كامل مدته ساعتان إطاراً تلو الآخر، فسوف يصاب بالارتباك، وينسى الأجزاء المهمة، ويهدر كمية هائلة من الطاقة في معالجة مشاهد مملة ومتكررة مثل حركة كاميرا بطيئة عبر جدار ثابت. ولحل هذه المشكلة، حاول العلماء تعليم الروبوت كيف يكون "محرراً" أفضل، بحيث يختار فقط اللحظات الأكثر أهمية لمشاهدتها. لكن الطريقة القديمة في التحرير كانت تشبه استخدام نص جامد ومكتوب مسبقاً: فقد كانت تعتمد على أدوات خارجية لتخمين ما هو مثير للاهتمام، مما يؤدي غالباً إلى تفويت الإشارات الدقيقة التي قد يحتاجها الروبوت فعلياً لحل اللغز.

هنا يأتي دور نهج جديد يسمى EviSelect. فكر في EviSelect ليس كمحرر جامد، بل كمحقق فضولي يتعلم قراءة عقل الروبوت نفسه. فبدلاً من سؤال خبير خارجي عما يجب النظر إليه، يتلصص EviSelect على "خرائط الانتباه" الداخلية للروبوت—وهي بمثابة خريطة حرارية توضح الأجزاء التي يركز عليها عقل الروبوت بشكل طبيعي. ومن خلال حيلة ذكية تسمى "التعبئة المسبقة المتفرقة" (Sparse Prefilling) (والتي تشبه أخذ لقطة سريعة ومنخفضة الدقة للفيلم بأكمبله للحصول على انطباع عام)، يستطيع EviSelect معرفة مكان الحركة بالضبط، ومدى سرعة الأشياء، وكمية التفاصيل المطلوبة. ثم يعلم "مُنتقيًا" (Selector) خفيف الوزن كيف يتخذ ثلاثة قرارات ذكية لكل لحظة في الفيديو: هل يجب أن نحتفظ بهذا المشهد؟ كم عدد الإطارات التي يجب أن نعرضها هنا؟ وما مدى وضوح الصورة؟

النتائج تشبه السحر من حيث الكفاءة. ففي الاختبارات على ثلاثة تحديات مختلفة للفيديوهات الطويلة، تمكن EviSelect من الإجابة على الأسئلة بنفس جودة الطرق الحالية، أو حتى أفضل منها، ولكنه فعل ذلك باستخدام حوالي 50% أقل من الرموز المرئية (Visual Tokens) (وهي وحدات البناء الرقمية للفيديو). هذا التقليل الهائل في البيانات لم يوفر الذاكرة فحسب؛ بل جعل العملية أسرع بمقدار 3.9 مرة. ويشير البحث إلى أنه من خلال السماقة للروبوت في استخدام "الأدلة" الداخلية الخاصة به لتوجيه عملية الاختيار، بدلاً من الاعتماد على قواعد جامدة أو مخمنين خارجيين، يمكننا بناء أنظمة لفهم الفيديو تكون ذكية للغاية وفعالة بشكل مدهش في آن واحد.

المشكلة: عنق زجاجة "المعلومات الزائدة عن الحد"

الفيديوهات الطويلة تمثل كابوساً للذكاء الاصطناعي الحالي. إذا طلبت من روبوت مشاهدة فيديو مدته 30 دقيقة والإجابة على سؤال، فإنه يواجه معضلة. لا يمكنه تذكر كل شيء، لذا يحاول اختيار "الإطارات المفتاحية" (Keyframes)—أي اللحظات الأكثر أهمية. لكن الطرق القديمة لاختيار هذه الإطارات كانت معيبة. لقد كانت تشبه محرر أفلام لا يعرف سوى قص المشاهد بناءً على مدى صخب الموسيقى أو سطوع الألوان، متجاهلاً القصة الفعلية. استخدمت هذه الطرق أدوات خارجية (مثل ذكاء اصطناعي منفصل يقيس التشابه) لتقرير ما يجب الاحتفاظ به. والمشكلة؟ أن تلك الأداة الخارجية لا تعرف ما يدور في عقل الروبوت الرئيسي. فقد تسلط الضوء على انفجار مبهر بينما كان الروبوت يحتاج في الواقع لرؤية محادثة هادئة لحل اللغز.

علاوة على ذلك، كانت هذه الطرق القديمة "جامدة". فقد كانت تعامل كل فيديو بنفس الطريقة، باختيار عدد ثابت من الإطارات وبحجم ثابت. هذا يشبه محاولة قراءة كتاب عبر النظر إلى كل حرف على حدة، حتى المسافات بين الكلمات، بغض النظر عما إذا كانت الجملة بسيطة أم معقدة. وهذا يهدر الطاقة في الأجزاء المملة ويفوت التفاصيل الدقيقة في الأجزاء المثيرة.

الحل: قراءة عقل الروبوت

اقترح المؤلفون في هذه الورقة، بو تشانغ وفريقه، إطار عمل جديداً يسمى EviSelect. فبدلاً من التخمين عما يحتاجه الروبوت، يقوم EviSelect بسؤال الروبوت مباشرة.

إليك كيفية عمل ذلك، خطوة بخطوة:

  1. حيلة "التعبئة المسبقة المتفرقة": قبل أن يشاهد الروبوت الفيديو بالكامل، يعطي EviSelect نسخة مصغرة ومضغوطة من الفيلم. الأمر يشبه عرض سلسلة من الصور المصغرة السريعة والضبابية للفيلم بأكمله. هذه العملية رخيصة وسريعة.
  2. إشارات "الانتباه": على الرغم من أن الفيديو ضبابي وقصير، إلا أن عقل الروبوت يضيء في مناطق محددة. يقوم EviSelect بالتقاط هذه "خرائط الانتباه". وهو يحللها إلى ثلاثة أنواع من الإشارات:
    • الصلة (Relevance): هل تتطابق هذه اللحظة مع السؤال؟
    • الزمن (Time): كيف ترتبط هذه اللحظة باللحظات التي سبقتها والتي تلتها؟
    • المكان (Space): هل هناك الكثير من التفاصيل المطلوبة هنا، أم أنه مجرد خلفية بسيطة؟
  3. المُنتقي الذكي: ينظر ذكاء اصطناعي صغير وخفيف الوزن (المُنتقي) إلى هذه الإشارات ويتخذ ثلاثة قرارات ديناميكية لكل طابع زمني في الفيديو:
    • الاحتفاظ أو الحذف: هل يجب أن نشاهد هذه الثانية على الإطلاق؟
    • معدل أخذ العينات (Sampling Rate): إذا شاهدناها، هل نحتاج إلى إطار واحد، أم 4 إطارات، أم 8 إطارات في الثانية؟ (الأكشن السريع يحتاج إطارات أكثر؛ المشاهد البطيئة تحتاج إطارات أقل).
    • الدقة (Resolution): هل نحتاج إلى صورة بدقة 4K، أم أن رسماً تخطيطياً منخفض الدقة سيفي بالغرض؟ (الوجه الواضح يحتاج دقة عالية؛ بينما الممر المظلم قد لا يحتاج ذلك).

التدريب: التعلم عن طريق "المقارنة الجماعية"

كيف تعلم روبوتاً اتخاذ هذه القرارات التحريرية في أجزاء من الثانية؟ استخدم المؤلفون تقنية تسمى GRPO (تحسين السياسة النسبي للمجموعات). تخيل برنامج مسابقات يحاول فيه الروبوت تحرير فيديو بثماني طرق مختلفة في وقت واحد. ثم يتحقق النظام من أي نسخة أعطت الإجابة الصحيحة. إذا نجحت نسخة في الحصول على الإجابة واستخدمت بكسلات أقل، فإنها تحصل على مكافأة كبيرة. وإذا حصلت على الإجابة ولكنها استخدمت بكسلات كثيرة جداً، تحصل على مكافأة أصغر. وإذا أخطأت في الإجابة، فلا تحصل على أي مكافأة، حتى لو كانت فعالة.

هذه "المقارنة الجماعية" تعلم الروبوت إيجاد التوازن المثالي: الحصول على الإجابة الصحيحة مع استخدام الحد الأدنى المطلق من البيانات المرئية.

النتائج: أسرع، أذكى، وأكثر رشاقة

اختبر المؤلفون EviSelect في ثلاثة معايير رئيسية: MLVU، و LongVideoBench، و Video-MME. هذه المعايير تشبه "الأولمبياد" لفهم الفيديوهات الطويلة، حيث تضم أفلاماً، لقطات مراقبة، وروايات معقدة.

كانت النتائج مبهرة:

  • الدقة: حقق EviSelect أداءً رائداً (State-of-the-art)، متفوقاً على الطرق الحالية مثل TSPO و Q-Frame. على سبيل المثال، في معيار Video-MME، حسّن الدقة بنسبة 1.9% مقارم بالرقم القياسي السابق.
  • الكفاءة: استخدم في المتوسط 1,701 رمزاً مرئياً فقط، بينما كانت الطرق الأفضل سابقاً تستخدم حوالي 3,360. وهذا يمثل تقليلاً في البيانات بنسبة 49%.
  • السرعة: نظرًا لمعالجته بيانات أقل، انخفض الوقت النهائي من قرابة 10 ثوانٍ إلى 2.55 ثانية فقط. وهذا يعني زيادة في السرعة بمقدار 3.9 ضعفاً.

ماذا يعني هذا (وماذا لا يعني)

يشير البحث إلى أن مفتاح فهم الفيديوهات الطويلة ليس مجرد إلقاء المزيد من القدرة الحوسبية على المشكلة، بل يتعلق بكوننا أكثر ذكاءً بشأن ما ننظر إليه. من خلال استخدام "الأدلة" الداخلية الخاصة بالروبوت بدلاً من المخمنين الخارجيين، يتكيف EviSelect مع الإيقاع الفريد لكل فيديو.

ومع ذلك، يوضح المؤلفون حدود هذا النهج بحذر. نظرًا لأن EviSelect يتعلم من الانتباه الداخلي لروبوت معين، فقد لا يعمل بشكل مثالي إذا تم نقله إلى نوع مختلف تماماً من الروبوتات دون إعادة تدريب. كما أن هذه الطريقة تتطلب الوصول إلى "عقل" الروبوت الداخلي (خرائط الانتباه)، لذا لا يمكن استخدامها على النماذج "الصندوق الأسود" مغلقة المصدر حيث تكون هذه المعلومات مخفية.

باخت-الاختصار، يثبت EviSelect أنه إذا علمت الذكاء الاصطناعي أن يثق في غرائزه حول ما هو مهم، فيمكنه مشاهدة فيلم، والعثور على الأدلة، وحل اللغز بنصف الجهد وأربعة أضعاف السرعة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →