← أحدث الأبحاث
💻 computer science

SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration

يُعد SVAgent إطار عمل متعدد الوكلاء عابر للوسائط وموجَّه بالقصة، يعمل على تعزيز الإجابة على الأسئلة المتعلقة بالفيديو من خلال محاكاة التفكير السردي الشبيه بالبشر عبر وكلاء متعاونين يبنون قصصاً متطورة، ويُحسّنون اختيار الإطارات، ويُحاذون التنبؤات البصرية-النصية لتقديم نتائج قوية وقابلة للتفسير.

المؤلفون الأصليون: Zhongyu Yang, Zuhao Yang, Shuo Zhan, Tan Yue, Wei Pang, Yingfang Yuan

نُشر 2026-04-08
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhongyu Yang, Zuhao Yang, Shuo Zhan, Tan Yue, Wei Pang, Yingfang Yuan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حل لغز، ولكن بدلاً من بضع أدلة على مكتب، تم تسليمك فيلمًا وثائقيًا مدته 10 ساعات وطُلب منك: "من سرق الكعكة؟"

إذا قمت بتصفح الفيديو عشوائيًا فقط، فقد تفوت اللحظة الحاسمة التي يسقط فيها الجاني الكعكة. وإذا نظرت فقط إلى أول 5 دقائق، فقد تعتقد أن الخادم هو الفاعل، لتكتشف لاحقًا أن الكلب هو من فعلها. هذه هي المشكلة التي تواجهها أنظمة الذكاء الاصطناعي الحالية مع الفيديوهات الطويلة: فهي تصاب بالارتباك، أو تفقد تتبع الوقت، أو تركز على التفاصيل الخاطئة.

إليك SVAgent، وهو نظام ذكاء اصطناعي جديد مصمم لمشاهدة الفيديوهات الطويلة بنفس الطريقة التي يشاهد بها المحقق البشري. فبدلاً من مجرد "النظر" إلى الفيديو، فإنه يروي قصة أثناء مشاهدته.

إليك كيف يعمل، مقسمًا إلى أجزاء بسيطة:

1. الراوي (وكيل خط السرد - The Storyline Agent)

تخيل أنك تشاهد فيلمًا وسألك صديق: "ماذا يحدث؟" أنت لا تسرد كل إطار (Frame) على حدًا؛ بل تقول: "حسنًا، أولًا يدخل البطل، ثم يرى شبحًا، ثم يهرب".

  • ما يفعله SVAgent: لديه وكيل "راوٍ" خاص يقوم باستمرار بتلخيص الفيديو في سرد مستمر. إنه يتجاهل الأجزاء المملة ويركز على الحبكة. تعمل هذه "القصة" كخريطة، بحيث لا يضل الذكاء الاصطناعي طريقه في منتصف فيديو مدته ساعة واحدة.

2. المحقق والأدلة (وكيل الفرضية - The Hypothesis Agent)

بمجرد أن يكون لدى الراوي فكرة عامة عن الحبكة، يضع "المحقق" تخمينًا: "أراهن أن الكلب هو من سرق الكعكة".

  • المشكلة: كيف نعرف ما إذا كان الكلب مذنبًا؟ نحتاج إلى دليل.
  • الحل: يستخدم المحقق أداة خاصة تسمى DPPs (تخيلها كـ "عدسة مكبرة ذكية"). فبدلاً من النظر في كل إطار، فإنه يختار بذكاء أفضل الإطارات التي تثبت أو تنفي التخمين. إنه يبحث عن آثار أقدام الكلب ووعاء الكعك الفارغ، متجاهلًا المشاهد التي يكون فيها الكلب نائمًا ببساطة.

3. لجنة الحكام (وكلاء القرار عبر الوسائط - Cross-Modal Decision Agents)

الآن، لدى المحقق نظرية، ولكن هل هي صحيحة؟ SVAgent لا يثق برأي واحد فقط. بل يستدعي اثنين من الحكام الخبراء:

  • حكم النص: ينظر إلى التعليقات والأوصاف. "النص يقول إن الكلب كان بالقرب من المطبخ".
  • حكم المرئيات: ينظر بدقة إلى البكسلات. "أرى كلبًا بالقرب من المطبخ".
  • الحَكم الأعلى (الحكم المرجعي): هذا هو المدير. إنه يستمع إلى كلا الحكمين. إذا قال حكم النص "نعم" وقال حكم المرئيات "لا"، فإن الحكم الأعلى يدرك أن هناك خطأ ما. إنه يجبرهما على الاتفاق أو يطلب المزيد من الأدلة. هذا يمنع الذكاء الاصطناعي من "الهلوسة" (اختلاق أشياء غير موجودة).

4. آلية "العودة والتحقق" (وكيل الاقتراح - The Suggestion Agent)

أحيانًا، لا يستطيع الحكام الاتفاق، أو تكون الأدلة ضعيفة. ربما كان الفيديو ضبابيًا، أو كان الكلب مختبئًا خلف أريكة.

  • ماذا يحدث: بدلاً من الاستسلام، يقول وكيل الاقتراح: "انتظر، لقد فاتني شيء ما. لنعد للوراء وننظر تحديدًا إلى الدقيقة 15 حيث كان الكلب مختبئًا".
  • الحلقة: يعود النظام، ويجلب تلك الإطارات الجديدة المحددة، ويحدث "القصة"، ثم يشغل الحكام مرة أخرى. يستمر في القيام بذلك حتى يصبح واثقًا من الإجابة.

لماذا يعد هذا أمرًا بالغ الأهمية؟

معظم نماذج الذكاء الاصطناعي الحالية تشبه الطلاب الذين يحاولون حفظ كتاب مدرسي صفحة بصفحة. إذا كان سؤال الامتحان عن تفصيل في الصفحة 500، فقد ينسون الصفحة 1.

SVAgent يشبه الطالب الذكي الذي:

  1. يقرأ جدول المحتويات (خط السرد) ليعرف أين يبحث.
  2. يمسح الكلمات المفتاحية (الفرضية) ليجد الصفحات الصحيحة.
  3. يراجع ملاحظاته مقابل الكتاب المدرسي (الحكام) ليتأكد من أنه لم يسيء القراءة.
  4. يعيد قراءة فقرات محددة (الاقتراح) إذا كان لا يزال مرتبكًا.

النتيجة

في الاختبارات، تفوق نهج "المحقق الراوي" هذا على نماذج الذكاء الاصطناعي الرائدة الأخرى بفارق كبير (من 5% إلى 11% أفضل). لم يكتفِ بالحصول على إجابات صحيحة أكثر فحسب، بل كان أكثر اتساقًا وأقل عرضة للارتباك بسبب الفيديوهات الطويلة والمعقدة.

باختًا: SVAgent لا يكتفي بـ "مشاهدة" الفيديوهات؛ بل يفهمها من خلال بناء قصة، والتحقق من عمله، وطلب نظرة ثانية عندما لا يكون متأكدًا. إنه يحول تدفقًا فوضويًا من الصور إلى سرد منطقي واضح.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →