← أحدث الأبحاث
💻 computer science

MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks

إنَّ MAVEN هو مسار وكلاء متعدد المراحل يقوم تلقائياً بتوليد بيانات استدلال فيديو عالية الجودة ومنظمة مع تتبعات "سلسلة الأفكار" (Chain-of-Thought) من خلال صقل هرمي وتكيف مع النطاق، مما يعزز بشكل كبير أداء نماذج الرؤية واللغة (Vision Language Models) التي تم ضبطها بدقة على اختبارات قياس الاستدلال في الأحداث المعقدة.

المؤلفون الأصليون: Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

نُشر 2026-05-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيفية فهم مشهد سينمائي معقد، مثل حادث مروري أو عراك في مستودع. إذا عرضت على الروبوت الفيديو الخام فقط وسألته: "ماذا حدث؟"، فقد يصاب بالارتباك، أو يغفل عن التفاصيل، أو يبدأ في اختلاق معلومات من خياله (الهلوسة).

يقدم هذا البحث نظام MAVEN، وهو نظام ذكي يعمل بمثابة "كاتب سيناريو" و"معلم" منظم للغاية لهذه الروبوتات. فبدلاً من مجرد تغذية الروبوت بالفيديو، يقوم MAVEN بتفكيك الفيديو أولاً إلى قصة مهيكلة، ثم يستخدم تلك القصة لإنشاء أسئلة تدريبية.

إليك كيف يعمل MAVEN، مشروحاً عبر تشبيهات بسيطة:

1. عملية "التقريب" ثلاثية المراحل (The Three-Stage "Zoom-In" Process)

تحاول معظم الأنظمة وصف فيديو كامل دفعة واحدة، مثل سائح يقدم ملخصاً سريعاً لعطلته؛ وغالباً ما تغفل عن التفاصيل الصغيرة والمهمة. أما MAVEN فيفعل ذلك بشكل مختلف، باستخدام نهج "التقريب" المكون من ثلاث خطوات:

  • المرحلة 1: اللقطة الواسعة (السياق العام): أولاً، ينظر إلى المشهد بأكمله. هل تمطر؟ هل الوقت ليل أم نهار؟ كيف يبدو الشارع؟ هذا يحدد المسرح العام.
  • المرحلة 2: الجدول الزمني (الأحداث الكثيفة): بعد ذلك، ينشئ جدولاً زمنياً للأحداث الرئيسية، مع تدوين متى بدأت ومتى انتهت بالضبط.
  • المرحلة 3: اللقطة القريبة (التفاصيل الدقيقة): أخيراً، يقوم بعمل تقريب (Zoom) على مقاطع فيديو قصيرة جداً لالتقاط التفاصيل الدقيقة، مثل نظرة خاطفة من شخص ما أو التقاط جسم صغير.

2. "المخطط الرئيسي" (MSTED)

هذا هو الجزء الأهم. فبدلاً من القفز مباشرة إلى طرح الأسئلة، يأخذ MAVEN كل هذه الأوصاف الثلاثة ويدمجها في "مخطط رئيسي" واحد مثالي يسمى MSTED.

فكر في هذا الأمر كأن محققاً يكتب ملف قضية كاملاً قبل استجواب شاهد.

  • لماذا يهم ذلك؟ إذا حاول الروبوت تخمين الإجابة مباشرة من الفيديو، فقد يخترع حقائق. ولكن إذا أُجبر الروبوت على قراءة "المخطط الرئيسي" أولاً، فلا يمكنه الإجابة إلا بناءً على ما هو مكتوب صراحةً هناك. لا يمكنه اختلاق الأشياء لأنه لا يملك سوى المخطط كمصدر وحيد للحقيقة.

3. "المحرر الذكي" (Agent-Driven Adaptation)

عادةً، إذا أردت تعليم روبوت موضوعاً جديداً (مثل الانتقال من كاميرات المرور إلى أمن المستودعات)، يتعين عليك إعادة كتابة جميع التعليمات للروبوت يدوياً، وهذا يستغرق الكثير من وقت البشر.

يمتلك MAVEN "محرراً ذكياً" مدمجاً (وكيل ذكاء اصطناعي).

  • كيف يعمل: أنت فقط تعطي المحرر وصفاً للعالم الجديد (على سبيل المثال: "هذا مستودع به رفوف عالية ورافعات شوكية") وبعض الأسئلة النموذجية.
  • اللمسة السحرية: يقوم المحرر تلقائياً بإعادة كتابة جميع التعليمات للمراحل الثلاث المذكورة أعلاه. فهو يستنتج: "أوه، في المستودع، أحتاج للبحث عن أشياء مخبأة تحت القمصان، وليس فقط عن سيارات تجاوزت الإشارة الحمراء". وهو يفعل ذلك دون الحاجة لتدخل بشري لتعديل الكود.

4. "حلقة ضبط الجودة" (The Quality Control Loop)

إذا راجع البشر الإجابات ووجدوا أخطاءً، فإن MAVEN لا يكتفي بالقول "عذراً". بل يتصرف كمحقق يحقق في فشله الخاص.

  • يتساءل: "هل فاتنا تفصيل في وصف الفيديو؟ أم أننا فشلنا في طرح السؤال الصحيح؟"
  • إذا كان الوصف سيئاً، فإنه يقوم بإصلاح مطالبات (Prompts) الوصف.
  • إذا كان الهيكل خاطئاً (على سبيل المثال، كانت أجزاء الفيديو قصيرة جداً مما أدى لقطع حدث في منتصفه)، فإنه يقوم فعلياً بإضافة خطوة جديدة إلى مسار العمل لإصلاح المشكلة الهيكلية.

ماذا حققوا؟

استخدم الفريق MAVEN لتسمية وتصنيف أكثر من 5,300 فيديو مروري (من كاميرات الشوارع وكاميرات لوحة القيادة في السيارات أيضاً). ثم استخدموا هذه البيانات لتدريب نموذج روبوت يسمى Cosmos-Reason2.

  • النتيجة: أصبح الروبوت المدرب بارعاً للغاية في الاستنتاج المنطقي. وفي اختبار خاص، تفوق على نماذج رفيعة المستوى مثل Gemini 2.5 Pro و Gemini 3.1 Flash.
  • المفاجأة: على الرغم من أنهم دربوا الروبوت فقط على فيديوهات كاميرات الشوارع (CCTV)، إلا أنه قدم أداءً يضاهي النماذج الكبيرة في اختبارات كاميرات لوحة القيادة (Dashcam). وهذا يشير إلى أن الروبوت تعلم كيف يستنتج منطقياً حول الأحداث، وليس مجرد حفظ شكل السيارات.
  • تعدد الاستخدامات: أظهروا عمل النظام على فيديوهات المستودعات ولقطات السلامة العامة (مثل العراك في الأنفاق) بمجرد ترك "المحرر الذكي" يكيف التعليمات، مما يثبت قدرته على التعامل مع عوالم مختلفة دون الحاجة لإعادة هندسة بشرية.

باختصار: MAVEN هو نظام يحول الفيديوهات الفوضوية إلى قصة مهيكلة ومثالية، ويستخدم تلك القصة لتعليم الروبوتات كيفية التفكير بمنطق، ويمتلك محرراً ذاتي التصحيح يمكنه التكيف مع البيئات الجديدة تلقائياً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →