SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning
تقدم الورقة البحثية SCOUT، وهو إطار عمل لوكيل ذاتي الفحص وواعٍ بالاسترداد يستخدم سياسة استكشاف-استغلال تكيفية وطريقة تدريب UPS-GRPO لتحقيق أداء رائد في الاستنتاج عبر فيديوهات المنظور الشخصي فائقة الطول من خلال التخفيف من انتشار الأخطاء وتحسين تخصيص الاعتمادات في سيناريوهات استخدام الأدوات متعددة الخطوات.
المؤلفون الأصليون: Keyang Zhong, Kuo Wang, Peng Liu, Quanlong Zheng, Junlin Xie, Zhijia Liang, Yanhao Zhang, Guanbin Li
المؤلفون الأصليون: Keyang Zhong, Kuo Wang, Peng Liu, Quanlong Zheng, Junlin Xie, Zhijia Liang, Yanhao Zhang, Guanbin Li
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: SCOUT للاستدلال في الفيديو من منظور الشخص الأول فائق الطول
بيان المشكلة
يمثل فهم الفيديو من منظور الشخص الأول (egocentric) فائق الطول تحديًا فريدًا: يجب أن يحدث الاستدلال عبر آفاق زمنية تمتد لساعات أو أيام، حيث تكون الأدلة ذات الصلة متباعدة زمنيًا وموزعة عبر فجوات طويلة. تعاني النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) الحالية من هذه المشكلة بسبب محدودية نوافذ السياق والضغط البصري المفقود للمعلومات، مما يفرض مقايضة بين التغطية الزمنية ودقة الأدلة.
بينما تحاول أطر عمل "سلسلة تفكير واستخدام الأدوات" (Chain-of-Tool-Thought - CoTT) معالجة ذلك عبر تفكيك الاستدلال إلى استدعاءات متكررة للأدوات (الاسترجاع، الفحص، التحقق)، تعاني الوكلاء الحاليون من الالتزام المبكر غير القابل للتراجع. فهي عادة ما تتبنى استراتيجية "من العام إلى الخاص" (coarse-to-fine) رتيبة وصارمة للتقريب (zoom-in). بمجرد اختيار منطقة زمنية أولية، يقوم الوكيل بالتحسين داخل هذا النطاق، ويفتقر إلى آليات التعافي إذا كان الافتراض الأولي خاطئًا. في الفيديوهات فائقة الطول، يؤدي تفويت المنطقة الزمنية الصحيحة مبكرًا إلى استبعاد الأدلة ذات الصلة بشكل دائم، مما يؤدي إلى انتشار الخطأ. علاوة على ذلك، فإن تدريب مثل هؤلاء الوكلاء أمر صعب لأن طرق التعلم المعزز (RL) القياسية تعتمد على مكافآت نادرة مرتبطة بالنتيجة النهائية، وتفشل في توفير تخصيص دقيق للمسؤولية (credit assignment) للقرارات البحثية المتوسطة أو التعامل مع عدم اليقين العالي الناتج عن ملاحظات الأدوات الخارجية.
المنهجية
يقترح المؤلفون SCOUT (سلسلة التفكير بالأدوات ذاتية التحقق)، وهو إطار عمل وكيل مدرك للتعافي، إلى جانب UPS-GRPO، وهي استراتيجية تدريب مبتكرة.
1. SCOUT: سياسة استدلال مدركة للتعافي
يعزز SCOUT إطار CoTT التقليدي بآلية تحقق ذاتي صريحة تكسر قيد التحسين الرتيب.
- فضاء بحث غير رتيب: بدلاً من فرض St+1⊆St (تقريب صارم)، يعرّف SCOUT مجموعة انتقال موحدة تسمح للوكيل إما بتحسين المنطقة الحالية (S′⊆St) أو الانتقال إلى منطقة زمنية مختلفة (S′∼St).
- آلية التحقق الذاتي: يقوم الوكيل بتقييم مدى إفادة واتساق ملاحظات الأدوات. إذا كانت الأدلة غامضة أو ضعيفة أو غير متسقة مع الاستعلام، تقوم السياسة ديناميكيًا بتغيير الاستراتيجيات لاستكشاف فرضيات زمنية بديلة بدلاً من التحسين الأعمى لمسار قد يكون خاطئًا.
- مجموعة الأدوات: يستخدم الوكيل ثلاث أدوات موجهة للفيديو:
- RAG: الاسترجاع الزمني القائم على النص.
- VideoSeg: تحليل مقاطع الفيديو الموضعية.
- FrameProbe: الفحص البصري الدقيق لإطارات محددة.
2. UPS-GRPO: تحسين السياسة المرتكز على أولوية عدم اليقين
لتدريب هؤلاء الوكلاء متعددي الخطوات بفعالية، قدم المؤلفون UPS-GRPO، وهو نوع مطور من تحسين السياسة النسبي للمجموعات (Group Relative Policy Optimization - GRPO) مصمم للاستدلال المعزز بالأدوات.
- الاختيار المرتكز على عدم اليقين: إدراكًا بأن حالات ما بعد استخدام الأداة تسبب انزياحات توزيعية وعدم يقين عالي، يعيد UPS-GRPO تخصيص ميزانية الاستكشاف. بدلاً من توسيع جميع المسارات بشكل موحد، يقوم باختيار عينات متعددة من الاستمرارات المحتملة عند حالات عدم اليقين العالي ويحتفظ فقط بالفرع الأكثر عدم يقينًا للتشغيل التالي. هذا يركز الموارد الحسابية على نقاط اتخاذ القرار الحرجة حيث تكون السياسة أقل ثقة.
- فك الارتباط شبه المعتمد على الخطوات: لمعالجة المكافآت النادرة، تقدم الطريقة تفكيكًا للميزة على مستوى الخطوة. تقوم بحساب ميزة على مستوى الخطوة بناءً على المحاذاة الزمنية (مثل IoU مع الفترات الأرضية الحقيقية) والاتساق الدلالي. تُستخدم هذه الإشارة كـ عامل تعديل ضربي على الميزة العالمية للمسار بأكمله، بدلاً من كونها مكافأة جمعية. هذا يحافظ على اتجاه التحسين العالمي (صحة الإجابة النهائية) مع حقن إشارات دقيقة مرتبطة بالأدوات لتحسين تخصيص المسؤولية للخطوات المتوسطة.
3. خط بناء البيانات
بنى المؤلفون RA-CoTT (سلسلة التفكير بالأدوات المدركة للتعافي)، وهي مجموعة بيانات تضم حوالي 8 آلاف مسار، عبر خط إنتاج مكون من ثلاث مراحل:
- التوليد من العام إلى الخاص: يتم توليد مسارات استدلال عالية الجودة وصحيحة والتحقق منها.
- حقن الأخطاء: يتم إدخال أخطاء اصطناعية (مقاطع بحث غير صحيحة) في المسارات لمحاكاة حالات فشل الاسترجاع الواقعية.
- تحسين التعافي: يتم تعديل آثار الاستدلال صراحةً لتشمل سلوكيات التصحيح الذاتي، مما يعلم النموذج كيفية التعرف على أخطائه السابقة والتعافي منها.
المساهمات الرئيسية
- إطار عمل SCOUT: سياسة استدلال مدركة للتعافي تنمذج صراحةً عدم اليقين في البحث، مما يسمح بالتبديل الديناميكي بين التحسين المحلي وإعادة الاستكشاف الزمني، وبالتالي التخفيف من نمط فشل الالتزام المبكر غير القابل للتراجع.
- UPS-GRPO: استراتيجية تعلم معزز (RL) مرتكزة على أولوية عدم اليقين تعمل على تحسين كفاءة الاستكشاف من خلال التركيز على حالات ما بعد الأداة ذات عدم اليقين العالي، وتقدم صيغة ميزة شبه مفككة على مستوى الخطوة لتحسين تخصيص المسؤولية.
- مجموعة بيانات RA-CoTT ونموذج التدريب: خط إنتاج بيانات قابل للتوسع يولد مسارات مدركة للتعافي، مع تقديم وصفة تدريب مكونة من مرحلتين (SFT+RL) قابلة للتوسع لوكلاء الفيديو الطويل.
النتائج التجريبية
تم تقييم الطريقة على أربعة اختبارات مرجعية: Video-MME (long)، و EgoLifeQA، و Ego-R1 Bench، و HourVideo.
- الأداء: يحقق SCOUT-7B نتائج هي الأفضل في فئته (SOTA) على اختبارات الفيديو من منظور الشخص الأول فائقة الطول (EgoLifeQA و Ego-R1 Bench)، متفوقًا بشكل كبير على الأنظمة السابقة القائمة على الوكلاء (مثل Ego-R1 و VideoAgent) ومنافسًا للنماذج مفتوحة المصدر.
- في EgoLifeQA (44.3 ساعة من الفيديو)، يحقق SCOUT دقة بنسبة 47.6%، متفوقًا على أفضل وكيل مفتوح المصدر سابق (Ego-R1 بنسبة 38.5%) بمقدار 9.1 نقطة.
- في Ego-R1 Bench، يحقق 49.0%، بزيادة قدرها 6.0 نقاط عن Ego-R1.
- يظل منافسًا في الاختبارات ذات الأفق الأقصر مثل Video-MME (long) بدقة 63.0%.
- الدراسات الاستقصائية (Ablation Studies):
- SFT مقابل RL: يوفر SFT وحده الهيكل النحوي اللازم لاستخدام الأدوات، بينما يعد RL ضروريًا للتعميم وتعلم استراتيجيات التعافي. وتؤدي عملية (SFT+RL) الكاملة إلى أفضل النتائج.
- UPS-GRPO: يؤدي إزالة الاختيار المرتكز على عدم اليقين إلى انخفاض في الأداء في المهام طويلة الأمد وسلاسل استدلال أقل كفاءة (عدد خطوات أكثر).
- تخصيص المسؤولية (Credit Assignment): استبدال التعديل الضربي لمستوى الخطوة بتشكيل مكافأة جمعي أدى إلى تدهور الأداء، مما يؤكد أهمية الحفاظ على اتجاه التحسين العالمي مع تحسين المهارة المحلية.
- ديناميكيات التدريب: يؤدي تضمين مكافآت مستوى الخطوة و UPS إلى استقرار أكبر في معايير التدرج (gradient norms) وتسارع في تقارب تعقيد الاستدلال (عدد خطوات أقل) عبر خطوات التدريب.
الأهمية
تجادل الورقة بأن الاستدلال الفعال في الفيديو فائق الطول يعتمد بشكل أساسي على الاستكشاف المدرك للتعافي و الإشراف المتوسط المرتكز على الأدوات، وليس فقط استخدام الأدوات الهرمي. من خلال تحويل عملية البحث من تقريب رتيب إلى عملية بحث عن الأدلة تكيفية وذاتية التحقق، يعالج SCOT مشكلة الفشل الحرجة المتمثلة في الالتزام المبكر في الإعدادات طويلة الأمد. توفر UPS-GRPO وخط إنتاج البيانات المقترح حلاً قويًا لتدريب الوكلاء القادرين على التنقل عبر الأدلة المتفرقة وعدم اليقين العالي المتأصل في فهم الفيديو من منظور الشخص الأول فائق الطول.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.
تصلك أفضل أبحاث AI كل أسبوع.
يحظى بثقة باحثين في ستانفورد وكامبريدج والأكاديمية الفرنسية للعلوم.
تفقّد بريدك لتأكيد الاشتراك.
حدث خطأ ما. تعيد المحاولة؟
لا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.