← أحدث الأبحاث
💻 computer science

VidNum: Diagnosing VLM Failure Modes in Video-Grounded Numerical Reasoning

تقدم هذه الورقة VidNum، وهو معيار مرجعي تم تنسيقه يدويًا ويتكون من 1,167 سؤالاً صُممت لتشخيص أوضاع فشل محددة في الاستدلال العددي القائم على الفيديو في نماذج الرؤية واللغة، مما يكشف عن فجوات أداء كبيرة مقارنة بالبشر ويحدد بناء الهدف المهيكل والاستدلال التركيبي القائم على الأفعال كعقبات رئيسية لا يتم حلها بشكل موثوق عبر التلقين بسلسلة الأفكار (chain-of-thought) دون تدريب مسبق.

المؤلفون الأصليون: Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He

نُشر 2026-07-30
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تشاهد برنامج طبخ سريع الإيقاع. يقوم المضيف بتقطيع البصل، ويقلب فطيرة، ثم يضيف ثلاث توابل، وبعد ذلك يسأل: "كم مرة قلبتُ الفطيرة؟". يمكن للمشاهد البشري تتبع الحركة بسهولة، وعدّ عدد القلبات، وربما مقارنة هذا العدد بعدد التوابل التي أضيفت. لكن بالنسبة للكمبيوتر، يعد هذا كابوساً؛ إذ يتعين على الكمبيوتر ليس فقط "رؤية" الفيديو، بل أيضاً فهم الوقت، وتتبع الأشياء أثناء حركتها، وإجراء عمليات حسابية بناءً على ما يراه. هذا هو عالم نماذج الرؤية واللغة (VLMs). هذه أنظمة ذكاء اصطناعي يمكنها النظر إلى الصور أو الفيديوهات والتحدث عنها. إنها تصبح جيدة جداً في وصف ما يحدث، ولكن عندما يتعلق الأمر بإجراء عمليات حسابية دقيقة بناءً على فيديو — مثل عدّ كم مرة حدث فعل معين بالضبط — فإنها غالباً ما تتعثر. نحن نهتم بهذا لأننا إذا أردنا للذكاء الاصطناعي أن يساعدنا في العالم الحقيقي، من عدّ المخزون في المستودعات إلى تحليل اللعبات الرياضية، فإنه يحتاج إلى أن يكون قادراً على العد والاستنتاج بدقة، وليس مجرد التخمين.

إليك VidNum، وهي أداة تشخيصية جديدة ابتكرها باحثون لمعرفة السبب الدقيق وراء فشل نماذج الذكاء الاصطناعي هذه في رياضيات الفيديو. فكر في VidNum ليس كاختبار نهائي، بل كفحص طبي مفصل لأدمغة الذكاء الاصطناعي. فبدلاً من مجرد إعطاء درجة واحدة مثل "حصلت على 60%"، يقوم VidNum بتفكيك الاختبار إلى أنواع محددة من التحديات. لقد بنى الباحثون مجموعة من 1,167 سؤالاً من نوع الاختيار من متعدد بناءً على فيديوهات حقيقية، وصنفوا هذه الأسئلة إلى ثلاث فئات رئيسية: العد المباشر (مجرد عد الأشياء التي يمكنك رؤيتها بوضوح، مثل "كم عدد السيارات الحمراء؟")، والعد المشروط (عد الأشياء التي تستوفي قواعد محددة، مثل "كم عدد السيارات الحمراء التي مرت بجانب الشجرة؟")، والاستدلال التركيبي (إجراء عمليات حسابية باستخدام الأعداد، مثل "كم عدد السيارات الحمراء أكثر من السيارات الزرقاء؟").

عندما وضع الباحثون 25 نموذجاً مختلفاً من نماذج الذكاء الاصطناعي تحت هذا الاختبار الصارم، كانت النتائج مذهلة. تمكن أفضل نموذج ذكاء اصطناعي من الإجابة بشكل صحيح على حوالي 59.8% من الأسئلة، بينما سجل المقيّمون البشريون نسبة تقارب المثالية بلغت 98.2%. هذه الفجوة هائلة. لكن القصة الحقيقية ليست فقط في أن الذكاء الاصطناعي سيء في الرياضيات؛ بل في أين يفشل. تشير الدراسة إلى أن العائق الأكبر لمعظم النماذج هو العد المشروط. الأمر يشبه كون الذكاء الاصطناعي يستطيع عد التفاح، ولكن إذا سألته عن "التفاح الذي سقط من فوق الطاولة"، فإنه يرتبك بشأن أي التفاحات يجب تضمينها. علاوة على ذلك، وجد الباحثون نمطاً محدداً: عندما تعتمد الرياضيات على عد الأفعال (مثل القلبات أو القفزات) بدلاً من الأشياء الثابتة، تعاني النماذج أكثر، خاصة عندما يتعين عليها دمج عد تلك الأفعال مع أرقام أخرى.

كما اختبرت الورقة البحثية حيلة شائعة تسمى سلسلة الأفكار (CoT)، حيث تطلب من الذكاء الاصطناعي أن "يفكر خطوة بخطوة" قبل إعطاء الإجابة. قد تتوقع أن هذا سيصلح الأخطاء، لكن النتائج كانت فوضوية. لم تكتفِ طريقة CoT بإصلاح الأخطاء فحسب، بل أفسدت أيضاً الإجابات التي كان الذكاء الاصطناعي قد أجاب عليها بشكل صحيح من قبل. الأمر كما لو أن طلب شرح عمله جعل الذكاء الاصطناعي يفرط في التفكير في المهام البسيطة. تشير الدراسة إلى أن عملية "التفكير" هذه تقوم فقط بإعادة توزيع الأخطاء بدلاً من حل المشكلة الأساسية. باختصار، يكشف VidNum أن نماذج الذكاء الاصطناعي الحالية ليست فقط "سيئة في الرياضيات"؛ بل لديها نقاط عمياء محددة ومتوقعة عندما تحاول تحويل مشاهد الفيديو المتحركة إلى أرقام. ويأمل الباحثون أن تساعد هذه الخريطة المفصلة للإخفاقات نماذج المستقبل على التتبع والعد والحساب بنفس الموثوقية التي يتمتع بها البشر عند مشاهدة برنامج طبخ.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →