ENTER: Event Based Interpretable Reasoning for VideoQA
تقدم الورقة البحثية نظام ENTER، وهو نظام لأسئلة وأجوبة الفيديو (VideoQA) قابل للتفسير يستخدم الرسوم البيانية للأحداث لتمثيل أحداث الفيديو وعلاقاتها هيكلياً، مما يتيح استدلالاً قوياً وقابلاً للتفسير من خلال الكود المولد الذي يسد بفعالية الفجوة بين التخطيط من الأعلى إلى الأسفل والمعالجة البصرية من الأسفل إلى الأعلى.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول حل لغز بناءً على مقطع فيديو، مثل معرفة لماذا تحول احتجاج إلى أعمال عنف أو كيف تعلم كلب حيلة جديدة.
معظم أنظمة الذكاء الاصطناعي الحالية التي تحاول القيام بذلك تشبه نوعين مختلفين تمامًا من المحققين، وكلاهما يعاني من العيوب:
المحقق "من الأعلى إلى الأسفل" (Top-Down): هذا المحقق يقرأ السؤال أولاً ويبدأ فوراً في تخمين الإجابة بناءً على المعرفة العامة. قد يقول: "الاحتجاجات عادة ما تكون سلمية"، ويتوقف عند هذا الحد. إنه يتجاهل لقطات الفيديو الفعلية، فإذا أظهر الفيديو أعمال شغب، فسيخطئ في التقدير. هو سريع ويمكنه شرح منطقه، لكنه غالباً ما يكون أعمى عن التفاصيل المحددة.
المحقق "من الأسفل إلى الأعلى" (Bottom-Up): هذا المحقق يشاهد كل إطار في الفيديو، ويحفظ كل شيء. هو بارع في رصد التفاصيل، لكنه سيء للغاية في شرح كيف توصل إلى الإجابة. هو فقط يلقي بالنتيجة كأنها كرة سحرية (Magic 8-ball). لا يمكنك الوثوق به لأنك لا تعرف ما إذا كان يخمن أم أنه يرى الحقيقة بالفعل.
إليك (ENTER) (الاستدلال القائم على الأحداث والقابل للتفسير): وهو نوع جديد من المحققين يجمع بين أفضل ما في العالمين. وإليك كيف يعمل، باستخدام تشبيه بسيط:
"مخطط الأحداث" (السبورة البيضاء للمحقق)
بدلاً من مجرد مشاهدة الفيديو أو مجرد قراءة السؤال، يقوم ENTER أولاً بتحويل الفيديو إلى خريطة حية (تسمى مخطط الأحداث - Event Graph).
- العُقَد (النقاط): تخيل أن كل شيء مهم يحدث في الفيديو هو نقطة على سبورة بيضاء. نقطة هي "متظاهرون يسيرون"، ونقطة أخرى هي "شرطة تطلق الغاز المسيل للدموع"، ونقطة ثالثة هي "جمهور يركض".
- الروابط (الخطوط): الآن، ارسم خطوطاً تربط هذه النقاط.
- خط مكتوب عليه "بعد" يربط بين "السير" و"الإطلاق".
- خط مكتوب عليه "بسبب" يربط بين "الإطلاق" و"الركض".
- خط مكتوب عليه "جزء من" يربط بين "الاحتجاج" و"السير".
هذه الخريطة ليست مجرد قائمة كلمات؛ إنها قصة مهيكلة من السبب والنتيجة.
"الكود" (خطة المحقق)
بمجرد رسم الخريطة، لا يقوم ENTER بمجرد التخمين. بل يكتب برنامجاً حاسوبياً بسيطاً (كود) مصمماً خصي سلسلة لقراءة تلك الخريطة.
- إذا كان السؤال "هل كان الاحتجاج سلمياً؟"، فإن الكود يقول: "اذهب إلى نقطة 'الاحتجاج'. انظر إلى الخطوط المتصلة بها. هل أي منها يقول 'عنيف' أو 'غاز مسيل للدموع'؟ إذا كانت الإجابة نعم، فارجع بـ 'لا'."
- هذا هو الجزء القابل للتفسير (Interpretable). يمكنك حرفياً قراءة الكود ورؤية كيف وصل الذكاء الاصطناعي إلى استنتاجه. الأمر يشبه مشاهدة المحقق وهو يشير إلى الدليل على السبورة ويقول: "انظر، هذا الخط يثبت ذلك".
"التصحيح الذاتي" (نظرة المحقق الثانية)
أحياناً، قد تفتقر الخريطة الأولية إلى قطعة من اللغز. ربما كان الفيديو ضبابياً، أو ربما فات الذكاء الاصطناعي تفصيل دقيق. في الماضي، كان المحقق سيعطي إجابة خاطئة فحسب.
يمتلك ENTER نظام تصحيح ذاتي ذكي:
- تحقق من الخريطة: يعمل الكود ويدرك: "مهلاً، ليس لدي معلومات كافية للإجابة".
- التكبير (مخطط أكثر كثافة): يعود إلى الوصف النصي ويسأل: "هل يمكنك إعطائي المزيد من التفاصيل حول الاحتجاج؟" ثم يعيد رسم الخريطة مع إضافة المزيد من النقاط.
- إعادة مشاهدة الفيديو (متعدد الوسائط): إذا لم يكن النص كافياً، يقول: "حسناً، أحتاج للنظر إلى مقطع الفيديو الفعلي مرة أخرى". يسحب الـ 5 ثوانٍ المحددة التي حدث فيها الفعل للحصول على الدليل النهائي.
تحدث هذه العملية في حلقة مستمرة حتى تصبح الخريطة كاملة بما يكفي للإجابة على السؤال بثقة.
لماذا يعد هذا أمراً بالغ الأهمية؟
- الثقة: لأنه يكتب كوداً ويرسم خريطة، يمكنك رؤية لماذا حصل على الإجابة الصحيحة (أو الخاطئة). إذا أخطأ، يمكنك النظر إلى الخريطة والقول: "آه، لقد فاته الخط الذي يربط بين المسدس والطلقة".
- الدقة: من خلال النظر فعلياً في الفيديو عندما يشعر بالارتباك (بدلاً من مجرد التخمين)، فإنه يحصل على الإجابة الصحيحة في كثير من الأحيان أكثر من محققي "الأعلى إلى الأسفل".
- المرونة: يعمل على المقاطع القصيرة والأفلام الطويلة لأنه يبني خريطة لـ القصة، وليس مجرد قائمة من الإطارات.
باختصار: ENTER يشبه المحقق الذي يرسم خريطة مفصلة لمسرح الجريمة، ويكتب خطة خطوة بخطوة لحل اللغز بناءً على تلك الخريطة، ولا يتردد في العودة وفحص الأدلة مرة أخرى إذا بدت الخريطة غير مكتملة. إنه يعطيك الإجابة الصحيحة ويريك الدليل أيضاً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.