Active Perception Agent for Omnimodal Audio-Video Understanding
يقدم OmniAgent أول وكيل إدراك نشط بالكامل يقوم بتنسيق أدوات أحادية النمط متخصصة ديناميكياً ويستخدم نموذجاً مبتكراً موجهاً صوتياً من الخشن إلى الناعم لتحقيق فهم صوتي وفيديو شامل ومتعدد الأنماط يتصدر المعايير الحالية دون الحاجة للتدريب.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول حل لغز في فيلم طويل وصاخب. لديك سؤال: "ما هو اسم لافتة المتجر التي ذكرتها الشخصية قبل أن تبدأ القطة بالمواء؟"
إذا سألت ذكاءً اصطناعيًا قياسيًا (مثل "OmniLLM" التقليدي)، فالأمر يشبه أن تطلب من شخص مشاهدة الفيلم بأكمله في وقت واحد، والاستماع إلى الموسيقى التصويرية بأكملها في وقت واحد، ثم تخمين الإجابة. قد يشعرون بالارتباك، أو قد يفوتهم اللحظة المحددة التي مواءت فيها القطة، أو قد يخلطون بين لافتة المتجر وشيء آخر. إنهم يحاولون معالجة كل شيء في آن واحد، مما يؤدي غالبًا إلى الأخطاء.
إليك OmniAgent.
تقدم الورقة البحثية OmniAgent، وهو يشبه محققًا ذكيًا للغاية لا يكتفي فقط بـ "مشاهدة" الفيلم بشكل سلبي، بل يحقق في المشهد بنشاط خطوة بخوة، ويقرر بالضبط متى ينظر ومتى يستمع.
إليك كيف يعمل OmniAgent، باستخدام تشبيهات بسيطة:
1. أدوات المحقق (الأدوات)
بدلاً من امتلاك عقل واحد ضخم يحاول القيام بكل شيء في وقت واحد، يمتلك OmniAgent صندوق أدوات يحتوي على أجهزة متخصصة:
- "الأذنان" (أدوات الصوت): يمكنها نسخ ما يقوله الناس فورًا، والأهم من ذلك، إخبار المحقق بالوقت الدقيق الذي حدث فيه صوت ما (مثل مواء قطة).
- "العينان" (أدوات الفيديو): يمكنهما مسح الفيلم بأكمله بسرعة لأخذ فكرة عامة، أو التركيز (Zoom in) على مقطع مدته 10 ثوانٍ محددة لرؤية التفاصيل الدقيقة (مثل قراءة لافتة على حائط).
- "محرك البحث" (أدوات الأحداث): هذا هو السلاح السري للمحقق. فهو يستمع إلى الصوت وينشئ خريطة لـ "اللحظات الهامة" (مثل: "مواء عند 1:48"، "ضحك عند 2:10").
2. عملية التحقيق (الدورة)
يتبع OmniAgent دورة تسمى "فكر-تصرف-لاحظ-تأمل". إليك كيف يحل اللغز من مثال الورقة البحثية:
- الخطوة 1: الدليل (فكر وتصرف): يتلقى المحقق السؤال حول "القطة". بدلاً من إعادة مشاهدة الفيلم بأكمله، يستخدم محرك البحث الصوتي الخاص به. يمسح الصوت ويقول: "آه! أنا أسمع مواء قطة بين 1:48 و1:49".
- الخطوة 2: السياق (لاحظ): الآن أصبح يعرف متى ينظر. يسأل أداة الصوت: "ماذا كان يُقال قبل المواء مباشرة؟". ترد الأداة: "الشخصية قالت: 'أوه، نان كي (Nán Kē)، لقد رأيت كونان (Conan)...'".
- الخطوة 3: التحقق (تأمل وتصرف): الآن أصبح لدى المحقق حدس حول الكلمات "نان كي" و"كونان". يقرر التركيز (Zoom in) على الفيديو في تلك اللحظة تحديدًا (1:30–1:40) باستخدام أداة مقطع الفيديو. ينظر بدقة إلى الشاشة ويرى لافتة مكتوب عليها "نان كي".
- الخطوة 4: الاستنتاج (تأمل): يربط المحقق الخيوط ببعضها: الصوت ذكر "نان كي"، والفيديو أظهر لافتة تقول "نان كي". يدرك أن "نان كي" هي إشارة إلى قصة صينية قديمة، وأن "كونان" هو أنمي ياباني. يجيب على السؤال بثقة.
3. لماذا هو أفضل من الآخرين؟
تقارن الورقة البحثية بين OmniAgent والنماذج الأخرى (مثل Qwen3-Omni أو Gemini) وتجد أن OmniAgent أفضل بكثير في الفهم الدقيق (Fine-grained understanding).
- الطريقة القديمة (السلبية): تخيل أنك تحاول قراءة كتاب بينما يصرخ شخص ما فوق رأسك، وعليك تخمين الإجابة دون التوقف للتحقق من صفحة معينة. قد تخطئ.
- طريقة OmniAgent (النشطة): تخيل محققًا يقول: "انتظر، أحتاج للتحقق من الصوت أولًا للعثور على الوقت. حسنًا، الآن عرفت الوقت. دعني أوقف الفيديو عند تلك اللحظة وأقوم بالتركيز (Zoom in) لقراءة النص".
الخلاصة الكبرى
تزعم الورقة البحثية أنه من خلال السماح للذكاء الاصطناعي بالاختيار بنشاط ما إذا كان سيستمع أم ينظر، ومن خلال استخدام الصوت للعثور على الوقت الدقيق للنظر إلى الفيديو، فإنه يحل المشكلات التي تخطئ فيها النماذج الأخرى.
في الاختبارات التي أجروها (على معايير مثل Daily-Omni و WorldSense)، أجاب OmniAgent على أسئلة أكثر بنسبة 10% إلى 20% من أفضل النماذج الموجودة، حتى دون الحاجة إلى إعادة تدريبه. لقد أثبت أن كونك "محققًا ذكيًا" يعرف متى يستخدم أذنيه ومتى يستخدم عينيه هو أمر أفضل من مجرد امتلاك "عقل كبير" يحاول القيام بكل شيء في وقت واحد.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.