← أحدث الأبحاث
💻 computer science

VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification

يقدم VideoZeroBench معياراً هرمياً يتضمن 500 سؤالاً لأسئلة الفيديو الطويلة تم تعليقها يدوياً وبروتوكول تقييم من خمس مستويات للتحقق بدقة من الأدلة المكانية والزمانية، مما يكشف أن حتى نماذج MLLM للفيديو المتطورة مثل Gemini-3-Pro تفشل في تحقيق الاستدلال المرتكز الدقيق عندما يتطلب الأمر تحديداً زمانياً ومكانياً دقيقاً.

المؤلفون الأصليون: Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren, Weisong Liu, Yuhao Wang, Renrui Zhang, Yunhai Tong, Haodong Duan

نُشر 2026-04-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren, Weisong Liu, Yuhao Wang, Renrui Zhang, Yunhai Tong, Haodong Duan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك توظف محققاً لحل لغز بناءً على شريط كاميرا مراقبة مدته 20 دقيقة.

الطريقة القديمة (المعايير الحالية):
تسأل المحقق: "من سرق الكعكة؟"
يقول المحقق: "إنه الخادم!"
تتحقق من نموذج الإجابة: إجابة صحيحة! فتعطيه نجمة ذهبية.
المشكلة: ليس لديك أدنى فكرة كيف عرف ذلك. هل شاهد الشريط بالفعل؟ هل رأى آثار أقدام الخادم الموحلة؟ أم أنه خمن فقط لأن الخدام يظهرون كثيراً في الأفلام؟ الاختبارات الحالية لنماذج الفيديو بالذكاء الاصطناعي تشبه هذا: فهي تتحقق فقط مما إذا كانت الإجابة النهائية صحيحة، متجاهلةً ما إذا كان الذكاء الاصطناعي قد "رأى" الأدلة بالفعل.

الورقة البحثية الجديدة (VideoZeroBench):
قرر مؤلفو هذه الورقة البحثية، "VideoZeroBench"، التوقف عن إعطاء النجوم الذهبية للتخمينات المحظوظة. لقد صمموا اختباراً أصعب بكثير لمعرفة ما إذا كانت نماذج الذكاء الاصطناعي تشاهد الفيديو حقاً أم أنها مجرد "هلوسة" (تختلق أشياء من خيالها).

فكر في اختبارهم كأنه امتحان محقق مكون من خمس مستويات:

  • المستوى 1 (ورقة الغش): تعطي المحقق الفيديو، بالإضافة إلى ملاحظة لاصقة تقول: "انظر في الدقيقة 5:00 والدقيقة 12:00، وانظر إلى الرجل ذو القبعة الحمراء".
    • النتيجة: حتى مع هذه التلميحات، تحقق أفضل نماذج الذكاء الاصطناعي حوالي 25% فقط من الإجابات الصحيحة. لا تزال هذه النماذج تكافح لربط النقاط ببعضها.
  • المستوى 2 (تلميح الوقت): تسحب تلميح "القبعة الحمراء"، لكنك لا تزال تقول: "انظر في الدقيقتين 5:00 و12:00".
    • النتيجة: يرتبك الذكاء الاصطناعي. لا يمكنه العثور على الشيء المحدد في تلك الفترة الزمنية.
  • المستوى 3 (الاختبار القياسي): تقول فقط: "شاهد الفيديو. من سرق الكعكة؟" (وهذا ما تفعله جميع اختبارات الذكاء الاصطنا الأخرى).
    • النتيجة: يحقق أفضل ذكاء اصطناً (Gemini-3-Pro) حوالي 17% فقط. وهذا أفضل قليلاً من التخمين العشوائي!
  • المستوى 4 (إثبات الوقت): تطلب منه: "أخبرني بالإجابة، وَأرني الثواني الدقيقة في الشريط حيث رأيت ذلك".
    • النتيجة: ينهار الذكاء الاصطناعي. تنخفض الدقة إلى 8%. لا يمكنه الإشارة إلى الوقت الصحيح.
  • المستوى 5 (الاختبار النهائي): تطلب منه: "أخبرني بالإجابة، وأرني الثواني الدقيقة، وَارسم مربعاً حول الشيء المحدد في الإطار".
    • النتيجة: فشل كارثي. يحقق أفضل ذكاء اصطناً 1% فقط. وتصل نسبة معظم النماذج إلى 0%.

الخلاصة الكبرى: مشكلة "الإبرة في كومة القش"

تكشف الورقة حقيقة صادمة: نماذج الذكاء الاصطنا sticks الحالية سيئة جداً في العثور على التفاصيل الصغيرة في الفيديوهات الطويلة.

تخيل أن فيديو مدته 20 دقيقة هو كومة قش ضخمة. الإجابة على السؤال هي إبرة صغيرة مخبأة في مكان ما داخلها.

  • الذكاء الاصطناعي الحالي: ينظر إلى كومة القش، ويخمن "من المحتمل أن تكون إبرة"، ويصيب أحياناً بالصدفة. لكن إذا طلبت منه إيجاد الإبرة، فإنه يفشل.
  • الصعوبات المحددة:
    • العد: إذا سألته: "كم عدد الكرات الحمراء التي تدحرجت؟"، غالباً لا يستطيع الذكاء الاصطناعي عدها بدقة.
    • الأشياء الصغيرة: إذا كان الدليل عبارة عن لافتة صغيرة على حائط بعد 10 دقائق من الفيديو، فإن الذكاء الاصطناعي سيفقدها تماماً.
    • الاتجاه: إذا انعطفت سيارة يساراً، فقد يعتقد الذكاء الاصطناه أنها انعطفت يميناً.

لماذا يهم هذا؟

يجادل المؤلفون بأننا ندخل "النصف الثاني" من تطوير الذكاء الاصطناعي. لا يكفي أن يكون النموذج "مخمّناً ذكياً". لكي يكون الذكاء الاصطناعي مفيداً حقاً (مثل السيارات ذاتية القيادة أو أدوات التشخيص الطبي)، يجب أن يكون قادراً على إثبات استنتاجاته. يحتاج أن يقول: "أنا أعرف هذا لأنني رأيت هذا الإطار المحدد في هذا الوقت المحدد".

المقارنة مع البشر

حتى أن الباحثين اختبروا البشر في جزء صغير من هذا الامتحان.

  • البشر: حققوا 67% صح.
  • أفضل ذكاء اصطناً: حقق 22% صح.

هذه الفجوة الكبيرة تظهر أنه بينما يتفوق الذكاء الاصطناعي في تلخيص فيلم أو التحدث عن الحبكة العامة، إلا أنه لا يزال سيئاً جداً في كونه مراقباً دقيقاً وموجهاً بالتفاصيل.

الخاتمة

VideoZeroBench هو بمثابة جرس إنذار. إنه يخبرنا أن نماذح الفيديو "الذكية" التي نراها في الأخبار هي في الواقع "عمياء" تماماً عندما يتعلق الأمر بالتفاصيل الدقيقة. لبناء ذكاء اصطناعي موثوق حقاً، يحتاج الباحثون إلى التوقف عن التركيز فقط على الحصول على الإجابة الصحيحة والبدء في تعليم النماذج كيفية إيجاد و الإشارة إلى الأدلة فعلياً. وإلى أن يتمكنوا من فعل ذلك، فسيظلون مجرد مخمنين واثقين من أنفسهم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →