Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval
تقدم الورقة البحثية ToolMerge، وهي طريقة مبتكرة لاسترجاع الإطارات الرئيسية تستفيد من نموذج لغوي كبير لتفكيك الاستعلامات إلى استدعاءات أدوات محددة ودمج نتائجها عبر معاملات بولينية، مما يظهر أداءً تنافسيًا على مقياس Molmo-2 Moments المقترح حديثًا.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك فيلمًا مدته 4 ساعات، وسألك أحدهم سؤالًا محددًا للغاية حول هذا الفيلم، مثل: "ماذا كان يفعل الرجل الذي يرتدي سترة صفراء قبل أن يعبر النهر؟"
إذا حاولت الإجابة عن ذلك من خلال مشاهدة الفيلم بأكمله من البداية إلى النهاية، فسيستغرق الأمر وقتًا طويلاً جدًا. أما إذا اخترت بضع إطارات عشوائية فقط (مثل تقليب ألبوم صور)، فمن المرجح أن تفوت اللحظة الدقيقة. هذه هي المشكلة التي تعالجها الورقة البحثية: كيف نجد الثواني القليلة المحددة من فيديو طويل والتي تحتوي على الإجابة، دون مشاهدة الفيديو بأكمله؟
يقترح المؤلفون نظامًا جديدًا يسمى ToolMerge. وإليك كيفية عمله، مشروحًا من خلال تشبيهات بسيطة.
1. المشكلة في الطرق القديمة
حاولت الأنظمة السابقة حل هذه المشكلة بطريقتين، كلتاهما تعانيان من عيوب:
- نهج "المقاس الواحد للجميع": تعاملوا مع السؤال بأكمله كأنه مصطلح بحث واحد ضخم. الأمر يشبه سؤال أمين مكتبة: "جد لي الصفحة التي بها الرجل ذو السترة الصفراء وهو يعبر النهر". قد يجد أمين المكتبة صفحة بها نهر، أو صفحة بها رجل، ولكن ليس بالضرورة المزيج الصحيح بينهما.
- نهج "قائمة التحقق الجامدة": حاولوا تقسيم السؤال إلى قائمة ثابتة من الأشياء (على سبيل المثال: "ابحث عن رجل"، "ابحث عن سترة"، "ابحث عن نهر"). لكن الحياة الواقعية فوضوية؛ فأحيانًا تحتاج للبحث عن فعل، وأحيانًا عن شيء، وأحيانًا عن لون محدد. قائمة التحقق الجامدة تفتقر إلى الدقة والبراعة.
2. الحل: ToolMerge (المحقق الذكي)
يعمل ToolMerge مثل محقق ذكي يعرف كيفية استخدام أدوات مختلفة لحل القضية. فبدلاً من محاولة إيجاد الإجابة في قفزة واحدة كبيرة، يقوم المحقق بتفكيك المهمة.
الخطوة 1: المخطط (العقل المدبر)
أولاً، يقوم "المخطط" (عقل اصطناعي) بقراءة السؤال. وبدلاً من مجرد البحث عن الجملة بأكملها، يقوم بتفكيك السؤال إلى مهام أصغر وأكثر تحديدًا.
- التشبيه: إذا كان السؤال هو "ماذا فعل الرجل الذي يرتدي سترة صفراء؟"، فإن المخطط لا يكتفي بالصراخ بعبارة "سترة صفراء!" في الفراغ. بل يقول: "حسنًا، أحتاج إلى ثلاثة أشياء: 1. ابحث عن مشهد به نهر. 2. ابحث عن رجل يرتدي اللون الأصفر. 3. ابحث عن شخص يعبر الماء".
الخطوة 2: الأدوات (المتخصصون)
يرسل المخطط هذه المهام الصغيرة إلى أدوات "متخصصة" مختلفة.
- الأداة (أ) (SigLIP): هذا هو متخصص المشاهد. ينظر إلى الصورة الكاملة للعثين على الأجواء العامة (مثل: "نهر"، "أخدود").
- الأداة (ب) (T-REN): هذا هو متخصص الأشياء. يقوم بعمل زووم (تكبير) للعثور على أشياء محددة (مثل: "رجل"، "سترة صفراء").
- الأداة (ج) (OCR): هذا هو قارئ النصوص. يقرأ أي كلمات مكتوبة على لافتات أو شاشات في الفيديو.
الخطوة 3: الدمج (القاضي)
الآن، قامت كل أداة بترتيب كل إطار (frame) في الفيديو بناءً على مدى مطابقتة لمهمتها المحددة. تقوم خطوة "الدمج" بجمع هذه الترتيبات.
- قاعدة "و" (AND): إذا كان السؤال يتطلب وجود "نهر" و"رجل" معًا، يبحث النظام عن الإطارات التي أعطت فيها كلتا الأداتين درجة عالية. إنه يشبه مخطط "فن" (Venn diagram)؛ يجب أن تكون الإجابة في المنتصف حيث تتقاطع الدائرتان.
- قاعدة "أو" (OR): إذا كان السؤال يسأل "هل عبر النهر أَم الجسر؟"، يبحث النظام عن الإطارات التي تستوفي أيًا من الشرطين.
أخيرًا، يختار النظام أفضل 3 إلى 8 إطارات سجلت أعلى الدرجات عبر كل هذه القواعد المجتمعة، ويقدمها إلى "مجيب" (AI) نهائي لإعطاء الإجابة الفعلية.
3. الاختبار الجديد: Molmo-2 Moments (M2M)
لإثبات نجاح نظامهم، أدرك المؤلفون أن الاختبارات الحالية كانت غير عادلة؛ إذ كانت الاختبارات القديمة تحتوي على أسئلة يمكن الإجابة عليها بالتخمين أو بالنظر إلى أجزاء عشوائية من الفيديو.
لذلك قاموا ببناء اختبار جديد يسمى Molmo-2 Moments (M2M).
- التشبيه: تخيل معلمًا يكتب اختبارًا يعتمد فقط على مقطع مدته 10 ثوانٍ من فيلم. المعلم يعرف بالضبط ما يحدث في تلك الثواني العشر. إذا أجاب الطالب بشكل صحيح، فهذا يعني أنه يجب أن يكون قد شاهد تلك الثواني العشر المحددة، ولم يكن بإمكانه تخمين الإجابة من بقية الفيلم.
- هذا يضمن أنه إذا حصل النظام على الإجابة الصحيحة، فإنه قد وجد بالفعل الإطارات الصحيحة.
4. النتائج
عندما اختبروا ToolMerge:
- كان أفضل في العثور على الإطارات الصحيحة من الطرق السابقة، خاصة في الأسئلة المعقدة التي تتضمن أشياء أو أفعال متعددة.
- أظهر أداءً جيدًا بشكل خاص في استرجاع الوصف (caption retrieval). فإذا أعطيت النظام وصفًا طويلًا ومفصلاً لمشهد ما (مثل وصف أو تعليق)، فإن ToolMerge أفضل بكثير في العثور على مقطع الفيديو الدقيق الذي يطابق ذلك الوصف مقارنة بالطرق القديمة.
- أظهروا أيضًا أنه إذا قمت بـ "تدريب" المخطط قليلاً باستخدام نظام مكافأة محدد (GRPO)، فإنه يصبح أفضل في معرفة الأدوات التي يجب استخدامها.
الملخص
ToolMerge هو نظام لا يحاول تخمين الإجابة لسؤال فيديو طويل دفعة واحدة. بدلاً من ذلك، يعمل كمدير مشروع: يفكك السؤال إلى مهام صغيرة ومحددة، ويرسل هذه المهام إلى أدوات متخصصة مختلفة، ثم يدمج النتائج للعثور على الثواني القليلة الدقيقة من الفيديو التي تحمل الحقيقة. لقد أثبتوا نجاحه من خلال إنشاء اختبار أكثر صرامة حيث تكون الإجابة مرتبطة بلحظة زمنية محددة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.