Counting Through Occlusion: Framework for Open World Amodal Counting
تقدم هذه الورقة CountOCC، وهو إطار عمل جديد للعد غير النمطي (amodal counting) يتغلب على قيود الطرق الحالية في ظل وجود الاحتجاب من خلال إعادة بناء ميزات الكائنات الكاملة هرميًا عبر التوجيه متعدد الوسائط وأهداف التكافؤ البصري، محققًا أداءً هو الأفضل في فئته على معايير الاختبار الجديدة المعززة بالاحتجاب.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تقف في غرفة مزدحمة وتحاول عدّ عدد الأشخاص الموجودين هناك.
المشكلة: فشل "الغميضة" (Peek-a-Boo)
معظم برامج الكمبيوتر الحالية تشبه طفلاً يلعب لعبة "الغميضة". إذا استطاع رؤية وجه شخص ما، فإنه يعدّه. ولكن إذا وقف شخص طويل أمامه وحجب الرؤية، يفكر الكمبيوتر: "أوه، هذا الشخص لم يعد موجوداً!"؛ فهو يعد فقط ما هو مرئي بوضوح. إنه يفتقر إلى الخيال الذي يجعله يقول: "مهلاً، أنا أعلم أن هناك شخصاً يقف خلف ذلك الشخص الطويل لأنني أستطيع رؤية حذائه".
في عالم الذكاء الاصطناعي، يُسمى هذا الانسداد (Occlusion). عندما تحجب الأشياء بعضها البعض، يفشل نظام عدّ الأشياء التقليدي تماماً. فهو يرتبك بسبب "الجسم الحاجب" (الشخص الطويل) وينسى الشخص المختبئ.
الحل: CountOCC (المحقق ذو الخيال الواسع)
ابتكر مؤلفو هذه الورقة البحثية نظاماً جديداً يسمى CountOCC. فكر في CountOCC ليس مجرد كاميرا، بل كـ محقق ذو خيال واسع.
بدلاً من مجرد النظر إلى ما هو مرئي، يمتلك CountOCC قوتين خارقتين:
1. وحدة "إعادة بناء الميزات" (الطابعة ثلاثية الأبعاد)
تخيل أن لديك قطعة أحجية (بازل) مكسورة. يحاول الكمبيوتر العادي عدّ الأحجية من خلال النظر إلى الحواف المتعرجة والمكسورة، مما يجعله يرتبك.
أما CountOCC، فينظر إلى القطعة المكسورة ويقول: "أنا أعرف كيف يبدو شكل القطعة الكاملة". إنه يستخدم الأدلة من الأجزاء المرئية (قطعة الأحجية التي تراها) ويدمجها مع "مخطط ذهني" (تم تعلمه من الأوصاف النصية والأمثلة الأخرى) لـ إعادة بناء الجزء المفقود من الشيء في عقله.
- التشبيه: الأمر يشبه رؤية سيارة مركونة خلف سياج. الذكاء الاصطناعي العادي يرى سياجاً ومصدّاً للسيارة فقط. أما CountOCC، فيستخدم ذلك المصد ومعرفته بشكل السيارات لـ "طباعة" الجزء الأوسط والخلفي غير المرئي من السيارة في دماغه الرقمي، مما يسمح له بعدّ السيارة بأكملة، وليس فقط المصد.
2. فحص "التكافؤ البصري" (التحقق المزدوج)
للتأكد من أنه لا يقوم بمجرد "الهلوسة" (اختلاق أشياء من العدم)، يستخدم CountOCC نظام "المعلم والتلميذ".
- المعلم: ينظر إلى صورة واضحة وغير محجوبة ويتعلم كيف يجب أن تبدو "خريطة الانتباه" (المكان الذي يركز عليه الذكاء الاصطناعي).
- التلميذ: ينظر إلى الصورة المحجوبة ويحاول جعل "خريطة الانتباه" الخاصة به مطابقة تماماً لخريطة المعلم.
إذا حاول التلميذ عدّ الأجزاء المرئية فقط، فستبدو خريطة الانتباه الخاصة به مختلفة عن خريطة المعلم، وسيقوم النظام بتصحيحه. هذا يجبر الذكاء الاصطناعي على إدراك أنه: "مهلاً، حتى لو لم أتمكن من رؤية الجزء الخلفي من السيارة، يجب أن يظل تركيزي على السيارة بأكملها، تماماً مثل المعلم".
ميادين التدريب الجديدة
لإثبات نجاح ذلك، لم يكتفِ الباحثون باختبارات الصور العادية، بل أنشأوا اختبارات جديدة وأكثر صعوبة (FSC-147-OCC و CARSK-OCC).
- قاموا بأخذ آلاف الصور للسيارات، والناس، والأشياء.
- رسموا فوقها مربعات سوداء رقمياً لمحاكاة الحجب الشديد.
- طلبوا من الذكاء الاصطناعي عدّ العدد الإجمالي للأشياء، سواء كانت مخفية أو مرئية.
النتائج: قفزة هائلة
عندما أجروا الاختبارات، كان CountOCC نجماً ساطعاً.
- الذكاء الاصطناعي القديم: عدّ السيارات المرئية فقط. إذا كانت هناك 5 سيارات مخفية، فإنه سيفقد 5 سيارات.
- CountOCC: عدّ السيارات المرئية بالإضافة إلى السيارات المخفية.
- النتيجة: قلل أخطاء العد بنسبة تقارب 50% مقارنة بأفضل الطرق السابقة. لقد كان بارعاً لدرجة أنه عمل حتى على مجموعات بيانات لم يسبق له رؤيتها (مثل مواقف السيارات)، مما يثبت أنه تعلم حقاً مفهوم عد الأشياء المخفية، ولم يقم فقط بحفظ الإجابات.
لماذا يهم هذا؟
الأمر لا يقتصر فقط على عد السيارات. تخيل:
- المزارعون: عد المحاصيل المختبئة خلف الأعشاض الطويلة لمعرفة كمية الغذاء التي سيحصدونها.
- المصانع: عد العناصر على حزام ناقل حتى عندما تحجب الصناديق الرؤية.
- سلامة الحشود: تقدير عدد الأشخاص في حشد كثيف، حتى لو كانوا متزاحمين لدرجة أنك لا ترى منهم سوى الرؤوس.
باختصار:
الذكاء الاصطناعي السابق كان مثل شخص يعد فقط ما يمكنه رؤيته بعينين مفتوحتين. أما CountOCC فهو مثل شخص يمكنه إغلاق عينيه، واستخدام ذاكرته ومنطقه، ومع ذلك يخبرك بالضبط عدد الأشخاص الموجودين في الغرفة، حتى لو كان نصفهم يختبئ خلف جدار. إنه يعلم الحواسيب كيف "ترى" ما لا يُرى.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.