ملخص تقني: MERIT (الاسترجاع الزمكاني متعدد المفاتيح مع التوسع الزمني عند الاستنتاج)
بيان المشكلة
أدى التطور السريع للنماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) إلى نقل فهم الفيديو من المقاطع القصيرة إلى التدفقات فائقة الطول التي تمتد لساعات أو حتى أيام. ومع ذلك، فإن المعالجة المباشرة لمثل هذه الفيديوهات فائقة الطول من البداية إلى النهاية غير ممكنة حسابياً بسبب قيود نافذة السياق. وبينما توفر أطر عمل "التوليد المعزز بالاسترجاع" (RAG) حلاً لذلك، تعاني الأساليب السابقة من عدم كفاءة حرجتين في الإعدادات فائقة الطول:
- الأعباء غير المرتبطة بالاستعلام (Query-Agnostic Overhead): تستثمر الأساليب الحالية (مثل التلخيص الهرمي أو الذاكرة القائمة على الرسوم البيانية) موارد حوسبة كبيرة لنمذجة العلاقات والهياكل الدلالية عالية المستوى قبل معرفة الاستعلام اللاحق. وهذا يفرض "تجريداً غير مرتبط بالاستعلام" قد لا يتوافق مع المعلومات المحددة المطلوبة.
- سوء تخصيص الذكاء: إن استخدام النماذج اللغوية الكبيرة متعددة الوسائط القوية لبناء ذاكرة استاتيكية معقدة (مثل دمج المقاطع في ملخصات على مستوى اليوم أو بناء رسوم بيانية للمعرفة) يهدر قدرات الاستدلال العالية في مهام يمكن تأجيلها.
يجادل المؤلفون بأن عنق الزجاجة يجب أن ينتقل من بناء دلالات استاتيكية معقدة مسبقاً إلى تمكين الاسترجاع عالي الاستدعاء الذي يقدم باستمرار الأدلة الدقيقة الصحيحة، مع تأجيل التركيب الدلالي لوقت الاستنتاج عندما يكون الاستعلام معروفاً.
المنهجية: MERIT
إن MERIT هو إطار عمل وكيل (agentic) خفيف الوزن مصمم لفهم الفيديو فائق الطول. وهو يتبنى نموذجاً مبسطاً من مرحلتين: بناء الذاكرة الزمكانية (Episodic Memory Construction) (غير مرتبط بالاستعلام) يليه الاسترجاع والإجابة الوكيلية (Agentic Retrieval and Answering) (مرتبط بالاستعلام).
1. بناء الذاكرة الزمكانية (المرحلة 1)
بدلاً من بناء رسوم بيانية هرمية معقدة أو ملخصات متعددة المقاييس، يقوم MERIT بتقسيم الفيديو V إلى مقاطع غير متداخلة مدة كل منها 30 ثانية. لكل مقطع، يقوم النظام بتوليد وصف كثيف واستخراج مجموعة من المفاتيح المتعددة (Multi-keys) (Ki).
- تمثيل المفاتيح المتعددة: يتم فهرسة كل مقطع بواسطة أربعة مفاتيح متميزة ومتكاملة لالتقاط وجهات نظر متنوعة:
- مفتاح الحدث/الإجراء (Event/Action Key): الأفعال الفيزيائية والتفاعلات الملحوظة.
- مفتاح الحوار/الذكر (Dialogue/Mention Key): المحتوى المنطوق، الأوامر، أو كلمات محددة.
- مفتاح الكائن (Object Key): العناصر المحددة التي يتم التعامل معها، طلبها، أو تحريكها، بما في ذلك تغيرات الحالة.
- مفتاح الملخص (Summary Key): تجريد مدمج بأسلوب الكلمات المفتاحية للسرد الأساسي.
- مخزن الذاكرة: الذاكرة M هي عبارة عن مخزن بسيط (key-value store) حيث تتيح المفاتيح (Ki) عملية الاسترجاع، بينما توفر القيم (vi,di) الأدلة الخام.
2. الاسترجاع والإجابة الوكيلية (المرحلة 2)
عند الاستنتاج، يعمل النظام في حلقة تكرارية متعددة الخطوات:
- الاسترجاع متعدد المفاتيح: يقوم "المحلل" (solver) بتوليد استعلام استرجاع q(j) ويطابقه مع المفاتيح المخزنة باستخدام نموذج تضمين الجمل. يتم تحديد صلة الاسترجاع من خلال أقصى تشابه (Maximum Similarity) عبر جميع المفاتيح لمقطع معين:
Si(j)=k∈Kimaxsim(E(q(j)),E(k))
يسمح هذا للمقطع بأن يتم استرجاعه إذا توافق أي من مفاتيحه مع الاستعلام، مما يحسن الاستدعاء بشكل كبير.
- تصفية الجيران (التوسع الزمني): إدراكاً منه أن الأدلة غالباً ما تمتد عبر لحظات متعددة متجاورة، لا يعتمد MERIT فقط على المقطع المرجعي (anchor) المسترجع ومدته 30 ثانية. عند استرجاع مجموعة من المقاطع، يقوم النظام ديناميكياً بتوسيع السياق الزمني عبر تضمين المقاطع المجاورة (على سبيل المثال، ±Δ من المقاطع).
- التصفية المدركة للاستعلام: يعمل "المحلل" كمرشح (filter) على هذا السياق المحلي الموسع، حيث يقوم بتنقية المعلومات ذات الصلة بالاستعلام المحدد فقط. هذا يعيد بناء سياق متماسك دون الحاجة إلى هياكل عالمية محسوبة مسبقاً.
- الاستدلال التكراري: يقيم "الوكيل" ما إذا كانت الأدلة المتراكمة كافية. إذا لم تكن كذلك، فإنه يقوم بتحسين الاستعلام ويكرر عملية الاسترجاء؛ وإلا، فإنه يدمج الأدلة لتوليد الإجابة النهائية.
المساهمات الرئيسية
- تحول النموذج في تخصيص الذكاء: يقترح البحث تأجيل التركيب الدلالي لوقت الاستعلام بدلاً من الاستثمار في المعالجة المسبقة غير المرتبطة بالاستعلام. وهذا يستغل كامل قدرة الاستدلال للنموذج اللغوي الكبير (MLLM) فقط عندما يتم تحديد المهمة.
- الفهرسة البسيطة والفعالة للمفاتح المتعددة: من خلال إرفاق أربعة مفاتيح متباينة بمقاطع زمكانية دنيا، يحقق MERIT استرجاعاً عالي الاستدعاء دون الأعباء الحسابية للذاكرة الهرمية أو القائمة على الرسوم البيانية.
- التوسع الزمني عند الطلب: تلتقط آلية "تصفية الجيران" سياقاً دلالياً أوسع من خلال توسيع النطاق الزمني حصرياً حول المقاطع المسترجعة أثناء الاستنتاج، مما يتجنب التكلفة الهائلة لبناء ذاكرة عالمية.
- بنية بسيطة وفعالة: يلغي MERIT الحاجة إلى دمج الذاكرة متعدد المراحل المكلف، معتمداً بدلاً من ذلك على آلية مطابقة مفاتيح بسيطة وتوسيع سياقي ديناميكي.
النتائج التجريبية
تم تقييم MERIT في ثلاثة اختبارات مرجعية للفيديو الطويل: EgoLifeQA (فائق الطول، منظور شخصي)، LVBench (فيديو مدته ساعة)، و Video-MME (Long).
- أداء رائد (SOTA): حقق MERIT نتائج قياسية جديدة عبر جميع الاختبارات المرجعية.
- في EgoLifeQA، وباستخدام GPT-5 كمحلل، حقق MERIT دقة متوسطة بلغت 71.2%، متفوقاً على السجل السابق (WorldMM مع GPT-5) بنسبة +5.6%.
- في LVBench، وصل MER-IT (GPT-5) إلى 71.8%، متجاوزاً السجل السابق بنسبة +9.9%.
- في Video-MME (Long)، حقق MERIT نسبة 77.7%، متفوقاً على WorldMM (76.6%).
- الكفاءة: أظهر MERIT مكاسب كبيرة في كفاءة بناء الذاكرة. مقارنة بـ WorldMM، قلل MERIT عدد الرموز المدخلة (input tokens) بمقدار 8.4 ضعفاً والرموز المخرجة (output tokens) بمقدار 8.6 ضعفاً، مع تقليل استدعاءات الـ LLM من حوالي 23,700 إلى حوالي 6,200.
- جودة الاسترجاع: حقق MERIT معدل إصابة (Hit Rate) أعلى (0.56) مقارنة بالنماذج الهرمية (EgoRAG: 0.15) والقائمة على الرسوم البيانية (WorldMM: 0.53)، مما يؤكد أن الاسترجاع الدقيق والناعم أمر بالغ الأهمية لأداء الإجابة على الأسئلة.
- دراسات الاستبعاد (Ablation Studies):
- تصفية الجيران: أدى إزالة هذا المكون إلى انخفاض كبير في الأداء، خاصة في الفئات التي تتطلب سياقاً أوسع (مثل RelationMap و HabitInsight).
- توليفات المفاتيح المتعددة: أدى استخدام جميع المفاتيح الأربعة معاً إلى تحقيق أعلى دقة، مما يؤكد الطبيعة التكاملية للمفاتح.
- الاعتماد على المحلل (Solver Dependency): تصاعد الأداء بشكل كبير مع قوة المحللين (مثل GPT-5 مقابل Qwen3-VL-8B)، مما يعزز فرضية أن الذاكرة يجب أن تكون خفيفة الوزن بينما يتولى المحلل عمليات الاستدلال المعقدة.
الأهمية والادعاءات
يدعي البحث أن تأجيل التركيب الدلالي لوقت الاستعلام هو نهج أكثر منهجية وفعالية من الاستثمار في المعالجة المسبقة غير المرتبطة بالاستعلام. وتشير النتائج إلى أن:
- البساطة فعالة: يمكن للذاكرة الزمكانية البسيطة متعددة المفاتيح، جنباً إلى جنب مع التوسع الزمني عند الطلب، أن تتفوق على البنى الهرمية والمعقدة القائمة على الرسوم البيانية.
- الاسترجاع هو عنق الزجاجة: الاسترجاع عالي الاستدعاء للأدلة الدقيقة أكثر أهمية من الهياكل الدلالية المحسوبة مسبقاً.
- القابلية للتوسع: إطار العمل قابل للتوسع بشكل كبير لأي طول فيديو لأن MER-IT يتجنب التكاليف الحسابية المتتالية لتحديث هياكل الذاكرة العالمية المعقدة مع زيادة طول الفيديو.
يضع المؤلفون MERIT كقاعدة عملية وقابلة للتوسع لفهم الفيديو فائق الطول في المستقبل، مؤكدين على أن "الذكاء" المطلوب للاستدلال المعقد يجب تخصيصه لمرحلة الاستنتاج حيث يحدد الاستعلام التجريدات اللازمة.