← أحدث الأبحاث
💻 computer science

Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning

يُعد Video-o3 إطار عمل مبتكر للاستدلال متعدد الخطوات في الفيديوهات الطويلة، حيث يتغلب على قيود أخذ العينات الموحدة من خلال تمكين البحث التكراري الأصيل عن الأدلة عبر قناع انتباه مفكك المهام ومكافأة موجهة للمسار قابلة للتحقق، محققاً أداءً هو الأفضل في فئته على اختبارات معيارية مثل MLVU وVideo-Holmes.

المؤلفون الأصليون: Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang

نُشر 2026-05-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حل لغز في فيلم مدته 30 دقيقة، لكن ليس لديك سوى ثوانٍ قليلة لمشاهدته. تحاول معظم نماذج الذكاء الاصطنا القدرة الحالية حل هذه المشكلة عبر أخذ لقطات سريعة وضبابية للفيلم بأكمله كل بضع ثوانٍ ثم تخمين الإجابة فوراً. الأمر يشبه محاولة العثور على إبرة محددة في كومة قش من خلال إلقاء نظرة خاطفة على الكومة بأكملة مرة واحدة والأمل في أن تكون قد رأيتها. غالباً ما تفقد الإبرة لأنها مخبأة في "القش" (الأجزاء المملة)، أو قد تشعر بالارتباك بسبب كثرة المعلومات.

يعد Video-o3 إطار عمل جديد للذكاء الاصطناعي يغير قواعد اللعبة. فبدلاً من إلقاء نظرة خاطفة، فإنه يعمل مثل محقق يحمل عدسة مكبرة. إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:

1. نهج المحقق (البحث المتداخل الأصيل عن الأدلة)

بدلاً من مشاهدة الفيلم بأكرله ثم التخمين، يشاهد Video-o3 جزءاً صغيراً، يفكر، ثم يقرر: "أحتاج إلى التركيز (التقريب) على هذا الجزء المحدد الممتد لـ 5 ثوانٍ لأرى ما يحدث".

  • كيف يعمل: يطلب من النظام "قص" (crop) مقطع محدد من الفيديو (مثل قطع قطعة صغيرة من فيلم سينمائي) للنظر إليه عن كثب.
  • الحلقة: يكرر هذه العملية: شاهد قليلاً \leftarrow فكر \leftarrow زوّم (ركز) على دليل ما \leftarrow فكر مجدداً \leftarrow زوّم على دليل آخر.
  • النتيجة: يبني الإجابة قطعة قطعة، من خلال النظر فقط إلى الأجزاء المهمة من الفيديو، متجاهلاً الباقي.

2. مشكلة "تشتت الانتباه" (قناع الانتباه لفصل المهام)

تخيل محققاً يحاول كتابة تقرير بينما ينظر في نفس الوقت إلى مسرح الجريمة. إذا حاول القيام بالأمرين معاً في اللحظة ذاتها، فقد يصاب بالارتباك. قد ينظر إلى مسرح الجريمة ولكنه يكتب شيئاً من ذاكرته بدلاً مما يراه فعلياً. هذا ما يسمى بـ "التفكير الزائف".

  • الحل: يستخدم Video-o3 تقنية "قناع" (masking) خاصة.
    • عندما يكون الذكاء الاصطناعي في مرحلة البحث عن الأدلة (مسح الفيديو)، فإنه يُجبر على تجاهل الإجابة النهائية التي قد يكتبها؛ فهو يركز تماماً على إيجاد الدليل.
    • عندما يكون الذكاء الاصطناعي في مرحلة كتابة الإجابة، فإنه يُجبر على تجاهل لقطات الفيديو الخام والتركيز فقط على الأدلة التي وجدها للتو.
  • التشبيه: يشبه الأمر طالباً مسموحاً له بالنظر إلى كتابه المدرسي فقط خلال مرحلة "المذاكرة"، ومسموحاً له بالنظر إلى ملاحظاته فقط خلال مرحلة "الاختبار". هذا يمنعه من الغش أو الارتباك، ويضمن أن تكون إجابته النهائية مبنية على أدلة صلبة.

3. "علامة التوقف" (المكافأة الموجهة بالمسار القابل للتحقق)

يمكن للمحقق نظرياً أن يستمر في التقريب (Zooming) إلى الأبد، ليفحص كل إطار واحد، مما سيستغرق وقتاً طويلاً جداً وسيكلف الكثير من المال (قدرة حوسبية).

  • الحل: يتم تدريب Video-o3 باستخدام نظام مكافأة خاص.
    • إذا وجد الذكاء الاصطناعي الإجابة بسرعة ودقة، فإنه يحصل على "نجمة ذهبية" كبيرة (مكافأة).
    • إذا استمر الذكاء الاصطناعي في التقريب دون داعٍ بعد أن وجد الإجابة بالفعل، فإنه يتلقى "عقوبة" (تقل المكافأة).
  • التشبيه: يشبه الأمر لعبة "ساخن وبارد". يتعلم الذكاء الاصطناعي التوقف عن البحث بمجرد أن يشعر أنه "ساخن" (لديه أدلة كافية). إنه يتعلم أن يكون فعالاً، ويتوقف تماماً عندما يحل اللغز، بدلاً من إضاعة الوقت في البحث في الغرف الفارغة.

4. ساحة التدريب (Seeker-173K)

لتعليم الذكاء الاصطناعي كيف يكون محققاً، لا يمكنك مجرد إعطائه كتاباً مدرسياً؛ بل تحتاج إلى إعطائه آلاف القضايا التدريبية حيث يتعين عليه البحث عن الأدلة.

  • مجموعة البيانات: أنشأ الباحثون مجموعة بيانات ضخمة تسمى Seeker-173K. تحتوي هذه المجموعة على 173,000 مثال من "ألغاز الفيديو" حيث يُجبر الذكاء الاصطناعي على ممارسة دورة: انظر \leftarrow زوّم \leftarrow فكر \leftarrow انظر مجدداً \leftarrow حل اللغز.
  • النتيجة: نظرًا لأنه تدرب كثيراً على مهام "البحث عن الأدلة" المحددة هذه، فقد أصبح أفضل بكثير في حل أسئلة الفيديو المعقدة مقارنة بالنماذح السابقة.

الخلا الخلاصة

Video-o3 هو طريقة أذكى لجعل الحواسيب تشاهد الفيديوهات الطويلة. فبدلاً من محاولة حفظ الفيلم بأكمله دفعة واحدة، فإنه يعمل كمحقق بشري: يمسح المشهد، يركز على التفاصيل المهمة، يربط النقاط ببعضها، ويتوقف بمجرد حصوله على الدليل. وهذا يجعله أسرع، وأكثر دقة، وأفضل في حل الألغاز المعقدة المخفية في الفيديوهات الطويلة.

الأداء: في الاختبارات، سمح هذا النهج للذكاء الاصطناعي بحل ألغاز الفيديو بدقة أعلى بكثير (على سبيل المثال، 72.1% في أحد المعايير الرئيسية) مقارنة بالطرق القديمة التي كانت تكتفي بـ "إلقاء نظرة خاطفة" على الفيديو.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →