← أحدث الأبحاث
🤖 AI

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

يُعد OmniVideo-R1 إطار عمل تعزيزي مبتكر يعزز الاستدلال السمعي البصري في نماذج الفيديو الشاملة عبر توظيف التأسيس كثيف الاستعلام والدمج المنتبه للنماط، محققاً أداءً فائقاً وتعميماً قوياً عبر معايير قياسية متعددة.

المؤلفون الأصليون: Zhangquan Chen, Jiale Tao, Ruihuang Li, Yihao Hu, Ruitao Chen, Zhantao Yang, Xinlei Yu, Haodong Jing, Manyuan Zhang, Shuai Shao, Biao Wang, Qinglin Lu, Ruqi Huang

نُشر 2026-02-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhangquan Chen, Jiale Tao, Ruihuang Li, Yihao Hu, Ruitao Chen, Zhantao Yang, Xinlei Yu, Haodong Jing, Manyuan Zhang, Shuai Shao, Biao Wang, Qinglin Lu, Ruqi Huang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حل لغز في غرفة ما. قد ينظر الذكاء الاصطناعي العادي إلى الأدلة (الفيديو) ويخمن الإجابة. لكن أحياناً، يكون أهم دليل هو الصوت — صرير لوح خشبي، أو همس، أو أغنية محددة تعمل في الخلفية.

النماذج الحالية "متعددة الوسائط" (Omnimodal) (وهي النماذج التي يمكنها الرؤية والسمع) تشبه المحققين الذين تم تدريبهم على النظر إلى الصور، ولكن عندما تقدم لهم مقطع فيديو مع صوت، يصابون بالارتباك. غالباً ما يتجاهلون الصوت، أو والأسوأ من ذلك، يجعلهم الصوت ينسون ما رأوه. وينتهي بهم الأمر بالتخمين بشكل خاطئ لأنهم لا يستخدمون آذانهم وعيونهم معاً بفعالية.

OmniVideo-R1 هو أسلوب تدريب جديد مصمم لإصلاح هذا الأمر. إنه يعلم الذكاء الاصطناعي كيف يصبح "محققاً" حقيقياً يستخدم كلاً من عينيه وأذنيه لحل المشكلات. إليك كيف يعمل ذلك، مقسماً إلى مفاهاهيم بسيطة:

1. المشكلة: "المحقق المشتت"

تخيل محققاً اعتاد كثيراً على النظر إلى صور مسرح الجريمة، لذا عندما تشغل له تسجيلاً للجريمة، يتشتت انتباهه. قد يقول: "أرى سيارة حمراء"، لكنه يغفل عن حقيقة أن محرك السيارة كان يصدر صوتاً معيناً (طقطقة) يحدد طراز السيارة بدقة.

تظهر الورقة البحثية أن حتى أذكى نماذج الذكاء الاصطناعي الحالية (مثل Qwen3-Omni) غالباً ما يكون أداؤها أسوأ عندما تحاول استخدام الصوت والفيديو معاً مقارنة باستخدام الفيديو وحده. لديها "تحيز" حيث تتجاهل الصوت.

2. الحل: تدريب من خطوتين

ابتكر المؤلفون معسكراً تدريبياً من خطوتين لتعليم الذكاء الاصطناعي كيف يفكر بشكل صحيح.

الخطوة 1: لعبة "التظليل" (الربط القائم على الاستعلام)

التشبيه: تخيل أنك تقرأ كتاباً طويلاً ومملاً ثم سألك شخص ما سؤالاً محدداً. قبل أن تجيب، عليك تظليل الجمل الدقيقة في الكتاب التي تثبت إجابتك.

كيف يتعلم الذكاء الاصطناعي:
بدلاً من مجرد إعطاء الإجابة للذكاء الاصطناعي، علم الباحثون النموذج أن يتوقف ويقول: "انتظر، دعني أجد الجزء من الفيديو حيث يختبئ الجواب".

  • يتعلم الذكاء الاصطناعي الإشارة إلى لحظات محددة في الفيديو (مثلاً: "بين الدقيقة 0:10 و0:15، يسقط الشخص الكوب").
  • ثم يكتب وصفاً قصيراً لتلك اللحظة.
  • الخدعة: لم يحتاجوا إلى بشر للقيام بهذا التظليل. استخدموا نظام "التحقق الذاتي". إذا قام الذكاء الاصطناعي بتظليل جزء من الفيديو وكان الوصف الذي كتبه يطابق ما حدث بالفعل في ذلك المقطع، فإنه يحصل على مكافأة. وإذا ظلل الجزء الخطأ، فإنه يتعلم أن يحاول مرة أخرى. هذا يعلم الذكاء الاصطناعي البحث عن الأدلة قبل التخمين.

الخطوة 2: "اختبار عصب العينين" (الدمج المنتبه للوسائط)

التشبيه: تخيل طباخاً يتذوق الحساء. إذا تذوقه وعيناه مغمضتان فقط (بالشم فقط)، فسيكون الأمر جيداً. إذا تذوقه وأنفُه مغطى فقط (بالتذوق فقط)، فسيكون الأمر جيداً أيضاً. لكن أفضل حساء هو الذي يتم تذوقه بكل الحواس وهي تعمل معاً.

كيف يتعلم الذكاء الاصطناعي:
لعب الباحثون لعبة مع الذكاء الاصطناعي:

  1. السيناريو (أ): عرض الفيديو على الذكاء الاصطناعي مع الصوت.
  2. السيناريو (ب): عرض الفيديو على الذكاء الاصطناعي بدون صوت (صامت).
  3. السيناريو (ج): عرض الصوت فقط على الذكاء الاصطناعي (بدون فيديو).

يحصل الذكاء الاصطناعي على نقطة إضافية خاصة فقط إذا حل اللغز بشكل أفضل في السيناريو (أ) (فيديو + صوت) مقارنة بالسيناريو (ب) أو (ج). هذا يجبر الذكاء الاصطناعي على الإدراك: "مهلاً، لا يمكنني حل هذا بمجرد النظر! أحتاج للاستماع إلى الصوت للحصول على الصورة الكاملة". هذا يجبر الحاستين على العمل كفريق بدلاً من أن تتصارعا.

3. النتيجة: "محقق خارق"

بعد هذا التدريب، أصبح الذكاء الاصطناعي (OmniVideo-R1) أفضل بكثير في:

  • إيجاد الأدلة الصحيحة: يعرف تماماً متى ينظر ومتى يستمع.
  • الدمج بين الحواس: يفهم أن "الصرخة" في الصوت تغير معنى "الشخص الذي يركض" في الفيديو.
  • عدم نسيان كيفية الرؤية: على الرغم من أنه تعلم الاستماع، إلا أنه لم ينسَ كيفية المشاهدة. بل في الواقع، أصبح أفضل في مشاهدة الفيديوهات أيضاً، لأنه تعلم التركيز على الأجزاء الأكثر أهمية.

لماذا يهم هذا؟

فكر في العالم كفيلم سينمائي، وليس فيلماً صامتاً. الحياة الواقعية تحتوي على صوت وصورة يحدثان في نفس الوقت. يعد OmniVideo-R1 طفرة لأنه يعلم الذكاء الاصطناعي التوقف عن معاملة الصوت كـ "إضافة" والبدء في معاملته كـ شريك حيوي في فهم ما يحدث.

باختختصار: يعلم OmniVideo-R1 الذكاء الاصطناعي التوقف عن التخمين والبدء في التحقيق، مستخدماً عينيه وأذنيه معاً للعثور على الحقيقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →