Agentic Very Long Video Understanding
تقدم هذه الورقة البحثية EGAgent، وهو إطار عمل وكيل يعتمد على الرسوم البيانية لمشاهد الكيانات وأدوات بحث هجينة لتمكين الاستدلال التركيبي واسترجاع المعلومات بمستوى رائد فوق تدفقات الفيديو من منظور الشخص الأول المستمرة والمتعددة الأيام، معالجةً بذلك أوجه القصور في النماذج الحالية في فهم الفيديو طويل المدى.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك صديقاً يرتدي نظارات ذكية على مدار الساعة طوال الأسبوع. هذه النظارات تسجل كل ما يراه ويسمعه: كل محادثة، كل وجبة، كل مرة يدخل فيها إلى غرفة، وحتى كل مرة يفقد فيها مفاتيحه.
الآن، تخيل أنك تسأل هذا الصديق: "من كان جالساً بجانبي عندما استقلينا سيارة الأجرة يوم الثلاثاء، وهل تحدثنا عن الكلب قبل ذلك أم بعده؟"
محاولة الإجابة على هذا السؤال عبر مشاهدة 50 ساعة من الفيديو أمر مستحيل على البشر، وهو أصعب حتى بالنسبة للذكاء الاصطناعي الحالي. معظم نماذج الذكاء الاصطناعي تشبه الأشخاص الذين لديهم ذاكرة قصيرة المدى فقط؛ إذ يمكنهم استيعاب بضع دقائق من الفيديو في "عقلهم" في المرة الواحدة. إذا عرضت عليهم أسبوعاً كاملاً، فسيشعرون بالتشتت وينسون البداية بحلول الوقت الذي يصلون فيه إلى النهاية.
تقدم هذه الورقة البحثية EGAgent، وهو نوع جديد من المحققين الآليين المصمم خصيصاً لحل مشكلة "الذاكرة طويلة المدى" هذه.
إليك كيف يعمل، باستخدام بعض التشبيهات البسيطة:
1. المشكلة: "خرطوم المياه" للمعلومات
فكر في تدفق فيديو لمدة أسبوع كأنه خرطوم مياه ضخم (معلومات). يحاول الذكاء الاصطناعي الحالي الشرب من هذا الخرطوم عبر أخذ رشفات متقطعة (أخذ عينات من بعض الإطارات). ولكن إذا كانت الإجابة على سؤالك مخبأة في قطرة صغيرة من الماء حدثت قبل 3 أيام، فإن الذكاء الاصطناعي سيفقدها. الأمر يشبه محاولة العثور على إبرة معينة في كومة قش عبر النظر فقط إلى الطبقة العلوية من القش.
2. الحل: "دليل العلاقات الاجتماعي" (الرسم البياني للكيانات)
بدلاً من محاولة تذكر كل ثانية من الفيديو، يقوم EGAgent ببناء دليل علاقات اجتماعي (يسمى الرسم البياني للمشهد والكيانات - Entity Scene Graph).
تخيل دفتراً رقمياً ضخماً لا يدون فيه الذكاء الاصطناعي كل إطار من الفيديو، بل يدون فقط الروابط المهمة:
- مَن: جيك، لوسيا، شور.
- ماذا: السيارة، الكلب، المطبخ.
- متى: "الثلاثاء الساعة 2 ظهراً".
- كيف يرتبطون ببعضهم: "جيك تحدث إلى لوسيا"، "جيك استخدم السيارة".
هذا الدفتر منظم مثل الخريطة؛ فهو لا يهتم بالمناظر الخلفية، بل يهتم فقط بـ العلاقات بين الأشخاص والأشياء بمرور الوقت. هذا هو "الرسم البياني للكيانات".
3. المحقق: "الوكيل المخطط" (The Planning Agent)
عندما تطرح سؤالاً، لا يقوم EGAgent بالتخمين فحسب، بل يستخدم وكيل تخطيط (مدير مشروع ذكي) يقوم بتفكيك سؤالك الكبير إلى أدلة صغيرة يمكن إدارتها.
التشبيه:
تخيل أنك محقق تحاول حل لغز ما. أنت لا تكتفي بالتحديق في مسرح الجريمة لمدة 10 ساعات، بل تقوم بما يلي:
- تفحص السجلات: "من كان في الغرفة الساعة 2 ظهراً؟" (البحث الصوتي).
- تنظر إلى الصور: "من كان واقفاً بالقرب من السيارة؟" (البحث البصري).
- تراجع دليل العلاقات: "هل تحدث جيك مع شور بخصوص السيارة؟" (البحث في الرسم البياني للكيانات).
يقوم EGAgent بذلك تلقائياً. يسأل نفسه: "للإجابة على هذا، أحتاج لمعرفة من كان في السيارة. دعني أفحص الرسم البياني أولاً". إذا قال الرسم البياني "جيك وشور كانا في السيارة يوم الثلاثاء"، فإنه يذهب بعد ذلك إلى الفيديو للعثور على اللحظة الدقيقة للتأكد.
4. القوة الخارقة: "السفر عبر الزمن"
الجزء الأكثر روعة في هذا النظام هو أنه يفهم الزمن.
- الذكاء الاصطناعي القديم: "أنا أرى سيارة".
- EGAgent: "أنا أرى سيارة، وأعلم أن جيك استخدم تلك السيارة بين الساعة 2:00 و 2:15 ظهراً يوم الثلاثاء، وأن شور كان يتحدث معه خلال ذلك الوقت".
لأنه يخزن هذه العلاقات مع الطوابع الزمنية، يمكنه الإجابة على أسئلة معقدة مثل: "كم مرة شربت الماء هذا الأسبوع؟" أو "مع من تحدثت مباشرة قبل ذهابي إلى البقالة؟".
5. النتائج: أذكى من غيره
اختبر الباحثون EGAgent على مجموعة بيانات تسمى EgoLife، وهي بالضبط فيديو لأسبوع من حياة أشخاص.
- الذكاء الاصطناعي السابق: أجاب على حوالي 36% من الأسئلة بشكل صحيح. لقد تاهوا في التفاصيل أو نسوا من هو الشخص.
- EGAgent: أجاب على 57.5% من الأسئلة بشكل صحيح.
لم يكن الأمر مجرد حظ؛ بل أصبح أفضل في الإجابة على أصعب الأسئلة—تلك التي تتطلب ربط النقاط عبر أيام مختلفة (مثلاً: "من قابلت يوم الاثنين ورأيته أيضاً يوم الجمعة؟").
الملخص
فكر في EGAgent كفرق بين كاميرا تصوير فيديو وبين كاتب سيرة ذاتية.
- كاميرا الفيديو تسجل كل شيء بعشوائية؛ إذا سألتها سؤالاً، فعليها إعادة مشاهدة الشريط بالكامل.
- كاتب السيرة الذاتية (EGAgent) يشاهد الشريط، ويدون ملاحظات حول العلاقات المهمة، ويبني جدولاً زمنياً، وينشئ خريطة. عندما تسأله سؤالاً، لا يحتاج لإعادة مشاهدة الشريط؛ بل ينظر فقط إلى ملاحظاته وخريطته ليعطيك الإجابة فوراً.
هذه التكنولوجيا هي خطوة كبيرة نحو إنشاء مساعدين آليين شخصيين يمكنهم حقاً تذكر حياتك، ومساعدتك في العث_ور على الأشياء المفقودة، أو تذكيرك بمحادثات أجريتها قبل أسابيع، تماماً كما يفعل صديق بشري.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.