← أحدث الأبحاث
💻 computer science

Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning

تقدم هذه الورقة البحثية Know-Show، وهو معيار جديد وطريقة خالية من التدريب تسمى GRAM، لتقييم وتحسين قدرات الاستنتاج المكاني-الزماني المرتبط بالتموضع في نماذج اللغة والفيديو من خلال توحيد الاستنتاج مع التموضع البصري والزماني عبر سيناريوهات متنوعة.

المؤلفون الأصليون: Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

نُشر 2026-04-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تشاهد فيديو من كاميرا مراقبة منزلية. يدخل شخص إلى المطبخ، يفتح الثلاجة، يخرج علبة حليب، ثم يصب الحليب في كوب.

إذا سألت بشراً: "من الذي صبّ الحليب ومتى فعل ذلك؟"، يمكنه فوراً الإشارة إلى الشخص، وقول: "إنه الرجل الذي يرتدي القميص الأزرق"، وتحديد اللحظة بدقة على الساعة. إنه يعرف الإجابة ويمكنه إظهار الدليل لك.

الآن، تخيل أنك تسأل روبوتاً ذكياً جداً يعمل بالذكاء الاصطناعي نفس السؤال. تكشف لك الورقة البحثية التي شاركتها، بعنوان "Know-Show"، عن مشكلة مضحكة ولكنها خطيرة: قد يقول الروبوت: "قام شخص بصب الحليب!" (جزء الـ Know أو "المعرفة" سليم). ولكن إذا سألته: "أرني بالضبط من ومتى"، فقد يشير إلى الشخص الخطأ، أو يخمن الوقت الخطأ، أو يكتفي بالنظر إليك بجمود. إنه يعرف القصة، لكنه لا يستطيع ربطها (Grounding) بوقائع الفيديو الفعلية.

إليك تفصيل بسيط لما فعله الباحثون لإصلاح ذلك.

1. المشكلة: المحقق "المُهلوس"

نماذج الذكاء الاصطناعي للفيديو الحالية تشبه المحققين الذين قرأوا رواية غموض لكنهم لم يزوروا مسرح الجريمة قط. إنهم بارعون في تخمين الحبكة ("الخادم هو الفاعل!") لأنهم قرأوا ملايين القصص. ولكن عندما تطلب منهم الإشارة إلى اللحظة المحددة التي التقط فيها الخادم المسدس، فإنهم يتوهون.

  • الفجوة: يمكنهم التعرف على الأشياء (ثلاجة، يد) وفهم الزمن (أولاً هذا، ثم ذاك)، لكنهم يعانون في ربطها معاً. لا يمكنهم قول: "اليد اليسرى للشخص (أ) لمست مقبض الثلاجة في الساعة 12:05 ظهراً".
  • النتيجة: في العالم الحقيقي (مثل السيارات ذاتية القيادة أو المراقبة الطبية)، يعد هذا أمراً خطيراً. فإذا اعتقد ذكاء اصطناعي في سيارة أن أحد المشاة يعبر الطريق لكنه لا يستطيع تحديد أين أو متى، فقد يتسبب في حادث.

2. الحل: معيار "Know-Show"

أنشأ الباحثون اختباراً جديداً يسمى Know-Show. فكر في هذا كأنه امتحان نهائي لذكاء الفيديو الاصطناعي، ولكن مع لمسة مختلفة.

بدلاً من مجرد السؤال: "ماذا حدث؟"، يسأل الامتحان:

  1. Know (اعرف): ماذا يحدث؟
  2. Show (أظهر): أشر إلى الشخص أو الشيء أو اليد المعنية بالضبط، وأخبرني بالثانية الدقيقة التي حدث فيها ذلك.

يحتوي الاختبار على خمس مستويات من الصعوبة، مثل ألعاب الفيديو:

  • المستوى 1: أشر إلى الشخص الذي يقوم بالفعل.
  • المستوى 2: أشر إلى الشيء الذي يتم استخدامه.
  • المستوى 3: أشر إلى كلاً من الشخص والشيء معاً.
  • المستوى 4 (مستوى الزعيم): أشر إلى اليد المحددة التي تلمس الشيء. (هذا صعب جداً لأن الأيدي تتحرك بسرعة وصغيرة الحجم).
  • المستوى 5: أخبرني بالترتيب الدقيق للأحداث ومتى بدأت.

الدرجة: يحصل الذكاء الاصطناعي على نقاط فقط إذا أصاب الإجابة وأشار إلى المكان الصحيح في الوقت الصحيح. إذا أصاب الإجابة لكنه أشار إلى الشخص الخطأ، فإنه يحصل على صفر.

3. النتائج: الذكاء الاصطناوي مقابل البشر

عندما أجروا هذا الاختبار على أذكى نماذج الذكاء الاصطناعي المتاحة (مثل GPT-4o وGemini وغيرها)، كانت النتائج متواضعة:

  • البشر: سجلوا أكثر من 75%. نحن نربط الأفعال بالأشخاص والأوقات بشكل طبيعي.
  • نماذج الذكاء الاصطناعي: سجلت درجات منخفضة جداً (غالباً أقل من 20-30%). كانوا بارعين في تخمين الفكرة العامة ولكنهم سيئون جداً في تقديم "الدليل". غالباً ما خلطوا بين من يفعل ماذا، أو فاتتهم اللحظة الدقيقة لبدء الفعل.

4. الإصلاح: GRAM (ملحق "الكشاف الضوئي")

لم يرغب الباحثون في إعادة تدريب نماذج الذكاء الاصطناعي الضخمة (الذي يستغرق سنوات وملايين الدولارات). بدلاً من ذلك، بنوا "ملحقاً" يسمى GRAM.

فكر في GRAM كأنه كشاف ضوئي وعلامة طابع زمني للذكاء الاصطناعي:

  • الكشاف الضوئي (اختيار الانتباه): عندما يبدأ الذكاء الاصطناعي في التفكير المنطقي ("حسناً، من فتح الثلاجة؟")، يجبره GRAM على النظر إلى إطارات الفيديو المحددة حيث يتم فتح الثلاجة فعلياً. إنه يفلتر الخلفية الضبابية ويركز فقط على البكسلات ذات الصلة.
  • علامة الطابع الزمني: عادة ما يخمن الذكاء الاصطناعي الوقت بناءً على شعور غامض. يقوم GRAM بكتابة الوقت حرفياً (مثلاً "5.2 ثانية") داخل عملية التفكير الخاصة بالذكاء الاصطناعي، مما يجبره على مواءمة إجابته مع الساعة الموجودة في الفيديو.

النتيجة: عندما أضافوا هذا "الكشاف الضوئي" إلى الذكاء الاصطناعي، قفز أداؤه بشكل كبير. لم يصبح مثالياً، لكنه بدأ أخيراً في "إظهار ما يعرفه" بدلاً من مجرد التخمين.

الصورة الكبيرة

هذه الورقة البحثية هي بمثابة جرس إنذار. فهي تخبرنا أنه بينما يتحسن الذكاء الاصطناعي في "التحدث" عن الفيديوهات، فإنه لا يزال يعاني في "رؤية" و"إثبات" ما يتحدث عنه.

  • قبل: كان الذكاء الاصطناعي مثل راوٍ للقصص يبتدع التفاصيل.
  • بعد (مع Know-Show و GRAM): نحن نعلم الذكاء الاصطناعي كيف يكون محللاً جنائياً يجب أن يدعم كل ادعاء بدليل بصري وطابع زمني.

هذا أمر بالغ الأهمية للمستقبل. إذا أردنا للروبوتات أن تساعد في المستشفيات، أو تقود السيارات، أو تراقب السلامة، فلا يمكنها مجرد التخمين؛ بل يجب أن تعرف بالضبط من فعل ماذا ومتى، وأن تكون قادرة على إظهار الدليل لنا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →