← أحدث الأبحاث
💻 computer science

Look Beyond Saliency: Low-Attention Guided Dual Encoding for Video Semantic Search

تقترح هذه الورقة آلية تضمين الانتباه العكسي التي تعزز البحث الدلالي في الفيديو في المشاهد المزدحمة من خلال التقاط المناطق الخلفية المغفلة بشكل صريح، مما يحسن أداء الاستدعاء دون الحاجة إلى تدريب إضافي.

المؤلفون الأصليون: Faisal Aljehrai, Mohammed A. Alkhrashi, Alreem Almuhrij, Sarah Abuhimed, Noorh Aldossary, Abdullah Aldwyish, Raied Aljadaany, Huda Alamri, Muhammad Kamran J Khan

نُشر 2026-05-08
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Faisal Aljehrai, Mohammed A. Alkhrashi, Alreem Almuhrij, Sarah Abuhimed, Noorh Aldossary, Abdullah Aldwyish, Raied Aljadaany, Huda Alamri, Muhammad Kamran J Khan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول العثور على شخص معين وسط حشد هائل وفوضوي في محطة قطار مزدحمة أو تجمع ديني ضخم. تقول لرجل أمن: "ابحث عن المرأة التي ترتدي الحجاب الأحمر".

تعمل معظم "الكاميرات الذكية" الحالية (نماذج الذكاء الاصطناعي) مثل حراس لا ينظرون إلا إلى الأشياء الأكثر وضوحاً. فهم يرون اللوحة الإعلانية الضخمة، أو الأضواء الوامضة، أو الشخص الواقف في منتصف الإطار تماماً. إنهم يتجاهلون الزوايا، والظلال، والأشخاص المختبئين جزئياً خلف الآخرين. إذا كانت المرأة ذات الحجاب الأحمر تقف خلف عمود أو في جزء "أقل سطوعاً" من الصورة، فإن الكاميرا ستفقدها تماماً. الأمر يشبه امتلاك الكاميرا "رؤية نفقية" تركز فقط على الأشياء الأكثر صخباً وسطوعاً.

تقترح هذه الورقة حلاً ذكياً يسمى الانتباه العكسي (Inverse Attention). فبدلاً من مجرد النظر إلى ما "تريد" الكاميرا رؤيته، يقوم النظام عمداً بالبحث عما "تتجاهله".

إليك كيف يعمل ذلك، خطوة بخوة، باستخدام تشبيهات بسيطة:

1. المشكلة: تأثير "تسليط الضوء" (The Spotlight Effect)

فكر في كاميرا الذكاء الاصطناعي القياسية مثل كشاف مسرح. هي تسلط الضوء بقوة على الممثل الرئيسي (الشيء الأكثر وضوحاً) وتترك بقية المسرح في الظلام. إذا كان هدفك موجوداً في الظلام، فلن تعرف الكاميرا بوجوده. في المشاهد المزدحمة، غالباً ما يتم دفع التفاصيل المهمة (مثل حقيبة صغيرة أو لون ملابس معين) إلى هذه "المنطقة المظلمة" لأنها ليست الشيء الأكبر أو الأكثر سطوعاً في الصورة.

2. الحل: "صائد الظلال" (The Shadow Hunter)

ابتكر المؤلفون أداة جديدة تسمى مشفر الانتباه العكسي (Inverse Attention Encoder). وبدلاً من اتباع تسليط الضوء، تعمل هذه الأداة مثل "صائد الظلال".

  • الخطوة 1: الخريطة الحرارية (خريطة الجهل)
    ينظر الذكاء الاصطناعي أولاً إلى الصورة ويرسم "خريطة حرارية" توضح الأماكن التي يصب تركيزه عليها. النقاط الحمراء الساطعة هي حيث ينظر، والنقاط الزرقاء الباردة هي حيث يتجاهل الأشياء.
  • الخطوة 2: الكاشف (LARD)
    يستخدم النظام كاشفاً (يسمى LARD، أو كاشف المناطق ذات الانتباه المنخفض) للعثور على تلك البقع الزرقاء الباردة. إنه يقول: "مهلاً، الكاميرا تتجاهل هذه الزاوية، دعونا نتفحصها".
  • الخطوة 3: القص (المكبر)
    يقوم النظام بقص تلك الزوايا المهملة، ويكبّر عليها، ويعاملها كصور صغيرة مستقلة.
  • الخطوة 4: التحقق المزدوج
    الآن أصبح لدى النظام عينان:
    1. "العرض الرئيسي" (ما تراه الكاميرا عادةً).
    2. "العرض المهمل" (الزوايا المكبرة التي وجدها للتو).
      يقوم النظام بمقارنة استعلام البحث الخاص بك (مثل "امرأة بحجاب أحمر") مع كلا العرضين. إذا كانت المرأة مختبئة في الزاوية المهملة، فإن مجموعة العينين الثانية ستجدها، ويقول النظام: "وجدتها!".

3. النتيجة: العثور على الإبرة في كومة القش

اختبر الباحثون طريقتهم في ثلاثة أنواع من البيئات "المزدحمة":

  • الصور القياسية (MS-COCO).
  • الصور شديدة الازدحام (مجموعة بيانات جديدة صنعوها تسمى "Dense-Set").
  • الفوضى في العالم الحقيقي (لقطات من الحرم المكي الشريف، حيث يتجمع آلاف الأشخاص معاً).

ما وجدوه:

  • في الصور القياسية، كان أداؤهم مشابهاً لأفضل الأدوات الموجودة حالياً.
  • في الصور المزدحمة، كان أسلوبهم هو الفائز بوضوح؛ فقد وجدوا الأشخاص والأشياء الصحيحة بشكل أكبر بكثير من الكاميرات القياسية.
  • الأمر الأهم: لم يضطروا إلى إعادة تدريب الذكاء الاصطناعي أو تعليمه دروساً جديدة. لقد قاموا فقط بتغيير طريقة نظرهم إلى الصورة أثناء البحث. إنه يشبه إعطاء نفس الحارس نظارات جديدة تجبره على النظر إلى الظلال، دون الحاجة لتوظيف حارس جديد أو دفع تكاليف تدريب إضافية.

الملخص

تجادل الورقة بأنه للعثور على الأشياء في حشد، لا يمكنك مجرد النظر إلى منتصف المسرح. يجب عليك البحث بنشاط في الحواف والظلال. من خلال بناء نظام يبحث خصيصاً عن الأشياء التي يتجاهلها الذكاء الاصطناعي عادةً، جعلوا البحث في الفيديو أفضل بكثير في العثة على أشخاص وأشياء محددة في المشاهد الواقعية الفوضوية والمزدحمة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →