← أحدث الأبحاث
🤖 AI

Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning

تقدم هذه الورقة MOV-Bench، وهو معيار للتحليل والاستنتاج السمعي البصري متعدد الخطوات، وتقترح AOP-Agent، وهو إطار عمل وكيل كفء يعزز قدرات الاستنتاج لنماذج Omni-LLM مفتوحة المصدر من خلال الإدراك النشط لجميع الأنماط دون الحاجة إلى تدريب إضافي.

المؤلفون الأصليون: Ke Xu, Yuhao Wang, Ziyang Cheng, Hongcheng Liu, Yanfeng Wang, Yu Wang

نُشر 2026-05-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ke Xu, Yuhao Wang, Ziyang Cheng, Hongcheng Liu, Yanfeng Wang, Yu Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح للورقة البحثية باستخدام لغة بسيطة وتشبيهات إبداعية.

المشكلة الكبرى: فيديو "الإبرة في كومة القش"

تخيل أنك مُنحت فيديو مدته 30 دقيقة لورشة عمل مزدحمة. ثم سألك أحدهم سؤالاً صعباً: "لماذا وضع الفني ذلك النوع المحدد من الغراء على الشريحة؟"

للإجابة على هذا، لا يمكنك مجرد النظر إلى ثانية واحدة. عليك أن:

  1. تستمع إلى تعليق قيل قبل 5 دقائق عن "شريحة سيئة".
  2. تنظر إلى لقطة بصرية ظهرت قبل 10 دقائق تظهر سلكاً مرتخياً.
  3. تربط بين هاتين المعلومتين المتباعدتين لتدرك أن الغراء هو إصلاح مؤقت لوصلة لحام سيئة.

النماذج الحالية للذكاء الاصطناعي (التي تسمى Omni-LLMs) تشبه الطلاب الذين يحاولون حفظ الفيديو بأكمله دفعة واحدة. عندما يكون الفيديو طويلاً، يشعرون بالارتباك؛ فينسون الدليل من 5 دقائق مضت، أو يغفلون عن الدليل البصري من 10 دقائق مضت. إنهم يحاولون تخمين الإجابة بناءً على الفوضى الكاملة، وغالباً ما يخطئون لأن الأدلة مشتتة ومتباعدة.

الحل 1: MOV-Bench (الاختبار الصعب)

قام الباحثون أولاً ببناء اختبار جديد يسمى MOV-Bench.

  • ما هو: مجموعة من 519 سؤالاً صعباً تعتمد على فيديوهات حقيقية.
  • العقبة: كل سؤال يتطلب استنتاجاً "متعدد الخطوات" (multi-hop). لا يمكنك الإجابة بمجرد مشاهدة مقطع واحد؛ بل يجب أن تنتقل بين أوقات مختلفة في الفيديو وتتنقل بين الاستماع (الصوت) والنظر (البصر).
  • النتيجة: عندما اختبروا نماذج الذاء الاصطناعي الحالية في هذا الاختبار، فشلت النماذج. لقد عانوا في العثور على الأدلة المشتتة وربط النقاط ببعضها.

الحل 2: AOP-Agent (المحقق)

بدلاً من إجبار الذكاء الاصطناعي على حفظ الفيديو بأكمله دفعة واحدة، ابتكر الباحثون نظاماً جديداً يسمى AOP-Agent. لا تنظر إلى هذا النظام كطالب يحشد معلوماته للامتحان، بل كـ محقق يحل لغزاً.

إليك كيف يعمل المحقق، باستخدام نهج "الموارد المنخفضة" (بمعنى أنه لا يحتاج إلى حواسيب فائقة باهظة الثمن أو تدريب خاص):

  1. خزانة الملفات (الذاكرة الهرمية):
    قبل أن يبدأ المحقق، يتم تنظيم الفيديو في خزانة ملفات ذكية.

    • النظرة العامة: ملخص من صفحة واحدة للفيديو بأكمله.
    • الفصول: يتم تقسيم الفيديو إلى أجزاء مدة كل منها 30 ثانية، مع ملخص قصير وقائمة من "الكلمات المفتاحية" (مثل "غراء"، "شريحة"، "لحام").
    • التفاصيل: إذا لزم الأمر، يمكن للمحقق التكبير والتركيز على مقاطع محددة مدتها 5 ثوانٍ للحصول على تفاصيل عالية الدقة.
  2. الحلقة الثلاثية (الملاحظة، التأمل، إعادة التخطيط):
    المحقق لا يشاهد فحسب؛ بل يبحث بنشاط عن الأدلة باستخدام ثلاثة أدوار:

    • المخطط (The Planner): ينظر إلى السؤال و"خزانة الملفات". يقول: "أحتاج للعثور على المكان الذي تحدثوا فيه عن الغراء. لنبحث في قسم 'الكلمات المفتاحية' أولاً".
    • المراقب (The Observer): يستخدم الأدوات لاستخراج مقاطع الفيديو المحددة التي طلبها المخطط.
    • المتأمل (The Reflector): يفحص الأدلة. "حسناً، وجدنا الغراء، لكننا لم نجد 'الشريحة السيئة' بعد. الأدلة الحالية غير كافية. لنعد ونبحث في قسم 'الصوت' للثلاثين ثانية التالية".

إذا كانت الأدلة لا تزال مفقودة، يقوم المخطط بتغيير الاستراتيجية (إعادة التخطيط) ويجرب أداة بحث مختلفة. تستمر هذه الحلقة حتى يشعر المحقق أن لديه جميع القطع.

  1. الإجابة:
    بمجرد أن يجمع المحقق أدلة كافية من أجزاء مختلفة من الفيديو، يقوم المستنتج (الحكم النهائي) بتجميع اللغز وتقديم الإجابة.

لماذا هذا مهم؟

  • لا يوجد تدريب سحري: يعمل هذا النظام مع نماذج الذكاء الاصطناعي مفتوحة المصدر دون الحاجة لإعادة تدريبها أو استخدام نماذج "الصندوق الأسود" باهظة الثمن والمملوكة لشركات.
  • نشط مقابل سلبي: الأساليب القديمة كانت سلبية (تشاهد الفيديو بأكمله وتأمل في تذكر ما رأيت). أما AOP-Agent فهو نشط (يقرر بالضبط ما الذي ينظر إليه، ومتى ينظر، ومتى يتوقف).
  • النتائج: عند اختباره على "الاختبار الصعب" (MOV-Bench) وغيرها من معايير تقييم الفيديو، تفوق AOP-Agent بشكل كبير على الأساليب القديمة، خاصة في الفيديوهات الطويلة والأسئلة التي تتطلب ربط العديد من الأدلة المختلفة.

القيود (أخطاء المحقق)

تعترف الورقة بأن النظام ليس مثالياً:

  • الهلوسة: إذا وصف "خزانة الملفات" (الذاكرة) مشهداً بشكل خاطئ (على سبيل المثال، ذكر أن شخصاً صرخ بينما لم يفعل)، فقد يبني المحقق نظرية خاطئة بناءً على تلك الكذبة.
  • السرعة: نظرًا لأن المحقق يجب أن يتوقف، ويفكر، ويبحث، ويتحقق عدة مرات، فإنه يستغرق وقتًا أطول من مجرد مشاهدة الفيديو مرة واحدة.
  • الوقت الفعلي: يحتاج النظام إلى معالجة الفيديو بأكمله في خزانة الملفات أولاً، لذا لا يمكنه حالياً العمل على فيديو مباشر (مثل البث المباشر للرياضة) في الوقت الفعلي.

الملخص

تقدم الورقة طريقة جديدة لتعليم الذكاء الاصطناٍء كيفية الاستنتاج من الفيديوهات الطويلة. بدلاً من محاولة ابتلاع الفيديو بأكمله دفعة واحدة، فإنهم يمنحون الذكاء الاصطناعي أدوات المحقق: نظام ملفات ذكي وعملية خطوة بخوة للبحث عن الأدلة المشتتة، والتأمل فيما وجدوه، وعدم الإجابة إلا عندما يتأكدون. هذا يسمح لنماذج الذكاء الاصطناعي القياسية مفتوحة المصدر بحل ألغاز الفيديو المعقدة التي لم يكن بإمكانها التعامل معها سابقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →