← أحدث الأبحاث
💻 computer science

AV-Unified: A Unified Framework for Audio-visual Scene Understanding

تقترح الورقة البحثية AV-Unified، وهو إطار عمل مبتكر يوحد مهام فهم المشاهد السمعية البصرية المتنوعة في بنية واحدة من خلال تحويل المدخلات والمخرجات غير المتجانسة إلى تسلسلات رمزية منفصلة وتوظيف وحدات إدراك مكاني-زماني متعددة المقاييس لالتقاط الارتباطات عبر الوسائط بفعالية.

المؤلفون الأصليون: Guangyao Li, Xin Wang, Wenwu Zhu

نُشر 2026-03-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Guangyao Li, Xin Wang, Wenwu Zhu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تسير في ساحة مدينة مزدحمة. أنت لا تكتفي فقط برؤية عازف كمان في الشارع؛ بل "تسمع" الموسيقى، و"ترى" حركة القوس، ويقوم دماغك فوراً بربط الاثنين معاً. أنت تعلم أن الصوت يصدر من هذا الشخص تحديداً، وليس من حركة المرور خلفه. يمكنك حتى تخمين مدة الأغنية أو ما إذا كان على وشك التوقف.

البشر يفعلون ذلك بسلاسوة. نحن لا نفصل "الرؤية" عن "السمع" في مجلدات ذهنية مختلفة. لكن لعقود من الزمن، كان علماء الكمبيوتر يعلمون الذكاء الاصطناعي القيام بهذه الأشياء بشكل منفصل. برنامج يتعلم متى يحدث الحدث (مثل نباح كلب)، وبرنامج آخر يتعلم أين يحدث (موقع الكلب)، وثالث يتعلم الإجابة على أسئلة حوله. الأمر يشبه امتلاك ثلاثة متخصصين لا يتحدثون مع بعضهم البعض أبداً، يحاولون حل لغز واحد كبير.

إليك "AV-Unified".

فكر في AV-Unified كأنه قائد أوركسترا فائق الذكاء ومتعدد المواهب، يمكنه قيادة أوركسترا كاملة في وقت واحد، بدلاً من استئجار قادة منفصلين للآلات الوترية، والآلات النحاسية، وآلات الإيقاع.

إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:

١. المترجم العالمي (سحر "التتابع إلى التتابع")

المشكلة الكبرى في الذكاء الاصطناعي الحالي هي أن المهام المختلفة تتحدث "لغات" مختلفة.

  • تحديد وقوع الحدث (Event Localization) يقول: "نبح الكلب من الثانية ٢ إلى الثانية ٥".
  • التقطيع (Segmentation) يقول: "هذه هي البكسلات الدقيقة للكلب".
  • الإجابة على الأسئلة (Question Answering) تقول: "الكلب موجود على اليسار".

يعمل AV-Unified كمترجم عالمي. فهو يأخذ كل هذه التنسيات المختلفة ويحولها إلى لغة واحدة موحدة: سلسلة من الرموز (tokens) (تخيلها مثل الكلمات في جملة).

  • بدلاً من قول "من ٢ إلى ٥ ثوانٍ"، قد يقول: [حدث] [كلب] [نباح] [بداية] [نهاية].
  • وبدلاً من رسم قناع، قد يقول: [بكسل] [كلب] [هنا].

لأن كل شيء أصبح الآن مجرد "جملة" من البيانات، يمكن للذكاء الاصطناعي استخدام عقل واحد فقط لتعلم كل هذه المهام في نفس الوقت، تماماً كما يتعلم الإنسان القراءة والكتابة والتحدث في آن واحد.

٢. آلة الزمن متعددة المقاييس (الإدراك الزمني)

تخيل أنك تشاهد فيديو. بعض الأشياء تحدث بسرعة (تصفيق)، بينما تستغرق أشياء أخرى وقتاً طويلاً (محادثة).

  • نماذج الذكاء الاصطناعي القديمة غالباً ما كانت تنظر إلى الفيديو في قطع ثابتة مدتها ثانية واحدة. هذا يشبه محاولة فهم فيلم عبر النظر إلى إطار واحد كل ثانية؛ ستفقد تدفق الأحداث.
  • يمتلك AV-Unified آلة زمن متعددة المقاييس. يمكنه التكبير لرؤية التفاصيل الصغيرة والسريعة (مثل ضربة طبل)، ويمكنه التصغير لرؤية الصورة الكبيرة (مثل أداء أغنية كاملة). إنه يفهم أن للأحداث "مدد زمنية" مختلفة ويعدل تركيزه بناءً على ذلك، مما يضمن عدم تفويت بداية الحد actually أو نهايته.

٣. المحقق عبر الوسائط (الإدراك المكاني)

هنا يلتقي "السمع" و"الرؤية" حقاً.

  • المشكلة: في فيديو ما، قد ترى شخصاً يعزف على الغيتار، لكن الذكاء الاصطناعي لا يعرف تلقائياً أي صوت ينتمي لأي شخص إذا كان هناك عدة آلات موسيقية.
  • الحل: يستخدم AV-Unified محققاً عبر الوسائط (Cross-Modal Detective). فهو يستخدم الصوت لتوجيه العين، والعين لتوجيد الأذن.
    • إذا سمع "كمان"، فإنه يمسح فوراً الأجزاء المرئية (قطع صغيرة من الصورة) للعثور على الكمان.
    • إذا رأى كماناً، فإنه يستمع لصوت الكمان تحديداً.
    • هما يساعدان بعضهما البعض، مثل محقق يستخدم دليلاً من شاهد لإيجاد موقع شاهد آخر. هذا يحل مشكلة "من أين يأتي هذا الصوت؟" دون الحاجة إلى تدخل بشري لرسم مربع حول المصدر أولاً.

٤. التوجيه الخاص بالمهمة (قائمة الطعام للدماغ)

بما أن الذكاء الاصطناعي يقوم بكل شيء في وقت واحد، فكيف يعرف على ماذا يركز الآن؟

  • تخيل أنك في مطعم. لديك قائمة طعام تحتوي على كل شيء (مقبلات، أطباق رئيسية، حلويات).
  • يستخدم AV-Unified توجيهات المهام (Task Prompts) كـ "طلب الطعام".
    • إذا كنت تريد معرفة متى حدث شيء ما، فإن التوجيه هو: "أخبرني بالوقت". هنا يتجاهل الذكاء الاصطناعي الموقع المكاني ويركز على الخط الزمني.
    • إذا كنت تريد معرفة أين يوجد الشيء، فإن التوجيه هو: "أرني الموقع". هنا يتجاهل الذكاء الاصطناعي التوقيت ويركز على البكسلات.
    • إذا كنت تريد الإجابة على سؤال، فإن التوجيه هو السؤال نفسه.

يسمح هذا للنموذج الواحد بتبديل مساره فوراً، ليعمل مثل "السكين السويسري" الذي يغير أداته بناءً على المهمة التي تعطيها له.

لماذا يهمنا هذا؟

قبل AV-Unified، إذا أردت من الذكاء الاصطناعي القيام بكل هذه الأشياء، كان عليك بناء وتدريب وصيانة خمسة نماذج مختلفة. كان الأمر مكلفاً، بطيئاً، ولم تكن النماذج قادرة على مشاركة المعرفة.

AV-Unified يشبه الترقية من صندوق أدوات مليء بأدوات أحادية الاستخدام إلى ذراع روبوت ذكي واحد يمكنه اللحام والطلاء والربط في آن واحد.

من خلال التدريب على مزيج من مجموعات البيانات (فيديوهات لكلاب، عروض موسيقية، مشاهد شوارع)، يتعلم النموذج فهماً أعمق وأكثر شبهاً بالبشر للعالم. إنه يدرك أن "الكلب النابح" ليس مجرد صوت وصورة؛ بل هو حدث موحد له وقت ومكان ومعنى محدد.

باختصار: يعلم AV-Unified الذكاء الاصطناعي التوقف عن معاملة الرؤية والصوت كموضوعات منفصلة، والبدء في معاملتهما كقصة واحدة متدفقة، تماماً كما نفعل نحن.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →