CALIPER: Clean Scenes Cannot Rank Physical Inference in Pretrained Visual Representations
تقدم الورقة البحثية CALIPER، وهو معيار قائم على المعايرة يوضح أن تقييمات "المشهد النظيف" القياسية تفشل في التمييز ما إذا كانت المشفرات البصرية سابقة التدريب تستنتج حقاً الخصائص الفيزيائية مثل الكتلة والاحتكاك، حيث يعتمد كفاءتها الظاهرية غالباً على إشارات مباشرة على مستوى البكسل بدلاً من الاستدلال الفيزيائي الحقيقي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لبناء آلات يمكنها التحرك في العالم الحقيقي، يعلم العلماء أجهزة الكمبيوتر ليس فقط رؤية الأشكال والألوان، بل القواعد الخفية التي تحكم كيفية حركة الأشياء. فعندما تدفع الروبوتات صندوقاً، تعتمد المسافة التي ينزلقها على عوامل غير مرئية مثل مدى ثقل الصندوق وكمية الاحتكاك الموجودة بين الصندوق والأرض. لا يستطيع الكمبيوتر رؤية هذه الخصائص مباشرة في صورة فوتوغرافية واحدة؛ فالصندوق الخفيف والصندوق الثقيل يبدوان متطابقين تماماً حتى يتحرك أحدهما. ولجسر هذه الفجوة، يستخدم الباحثون نماذج ذكاء اصطناعي مدربة على مكتبات ضخمة من مقاطع الفيديو لتعمل كأعين لهذه الروبوتات. ويُفترض بهذه النماذج أن تتعلم فيزياء العالم لتتمكن من التنبؤ بما سيحدث بعد ذلك. ولكن لسنوات، كانت الاختبارات المستخدمة لتقييم هذه النماذج بسيطة للغاية بحيث لا تستطيع التمييز ما إذا كانت تتعلم الفيزياء حقاً أم أنها مجرد تحفظ لزوايا الكاميرا.
أجرى فريق من الباحثين المستقلين مؤخراً تجربة جديدة لمعرفة ما إذا كانت هذه العيون الرقمية تستطيع حقاً فهم العالم المادي. لقد أنشأوا محاكاة حيث تصطدم قرص (puck) قياسي بصندوق مجهول الوزن والاحتكاك. أولاً، يشاهد الكمبيوتر ضربتين تجريبيتين حيث يصطدم القرص بالصندوق بسرعات معروفة، وينزلق الصندوق مسافة محددة. هذه هي لحظات المعايرة، التي تمنح الكمبيوتر فرصة لتعلم أسرار الصندوق. بعد ذلك، يشاهد الكمبيوتر ضربة ثالثة بسرعة جديدة، لكن الفيديو ينقطع في اللحظة التي يلمس فيها القرص الصندوق. يجب على الكمبيوتر الآن التنبؤ بالمسافة التي سينزلقها الصندوق بناءً فقط على ما تعلمه من الضربتين الأوليين. اختبر الباحثون ثمانية أنواع مختلفة من أنظمة الرؤية، تتراوح من النماذج المتطورة للغاية المدربة على ملايين مقاطع الفيديو إلى نظام رؤية حاسوبية بأوزان عشوائية وغير مدربة تماماً.
كشفت النتائج عن خلل صارخ في كيفية حكمنا الحالي على هذه الآلات. فعندما أجرى الباحثون الاختبار في غرفة نظيفة وثابتة تماماً مع كاميرا ثابتة، أدى كل نظام تقريباً أداءً مثالياً، بما في ذلك النظام ذو الأوزان العشوائية. لم يكن الكمبيوتر بحاجة لفهم الفيزياء للحصول على الإجابة الصحيحة؛ فقد تعلم ببساطة أنه في عرض الكاميرا الثابت، تخلق المسافة التي يتحركها الجسم نمطاً معيناً من البكسلات. ولأن الكاميرا لم تتحرك أبداً، استطاع الكمبيوتر قياس الانزلاق مباشرة من إحداثيات الشاشة دون الحاجة أبداً لمعرفة كتلة الصندوق أو احتكاكه. كان الأمر أشبه بطالب حفظ نموذج الإجابة لاختبار معين، لكنه لا يستطيع حل المسألة إذا تغيرت الأرقام. ووجد الباحثون أنه في هذه البيئة النظيفة، لم يستطع الاختبار التمييز بين نموذج ذكي وآخر غبي.
ولإصلاح ذلك، قام الباحثون بتغيير البيئة لكل مقطع فيديو. فقد قاموا بتغيير زاوية الكاميرا عشوائياً، وتغيير الإضاءة، وتغيير لون الأرضية، وإضافة أشياء مشتتة للمشهد. فجأة، لم يعد نمط البكسلات يكشف الإجابة. لم يعد بإمكان الكمبيوتر الاعتماد على النظر في إحداثيات الشاشة. وفي هذا العالم الفوضوي وغير المتوقع، انقسمت النتائج بشكل دراماتيكي. فالنماذج الأكثر تقدماً، المدربة على التنبؤ بالفيديو، ظلت تعمل بشكل جيد، حيث تنبأت بمسافة الانزلاق بدقة عالية. ومع ذلك، فإن النماذج التي اعتمدت على النظر في إطارات مفردة أو التي لم تكن مدربة على الإطلاق فشلت تماماً. والنظام غير المدرب، الذي سجل درجة مثالية تقريباً في الغرفة النظيفة، أصبح الآن لا يؤدي أفضل من نظام يتجاهل الجسم تماماً ويخمن بناءً على سرعة الدفع وحدها.
كما بحثت الدراسة في كيفية اختبار هذه النماذج عادةً من قبل علماء آخرين. تتضمن الطريقة الشائعة تغيير خاصية واحدة في المشهد، مثل جعل جسم ما أثقل قليلاً، ورؤية ما إذا كان تمثيل الكمبيوتر الداخلي يتغير. ووجد الباحثون أنه في العديد من الاختبارات الحالية، كان التغيير طفيفاً جداً لدرجة أن رد فعل الكمبيوتر كان مجرد ضجيج عشوائي، مما يعني أن الاختبار لم يكن يقيس شيئاً حقيقياً. كما نظروا أيضاً في "المجسات" (probes)، وهي اختبارات بسيطة تحاول قراءة خاصية معينة، مثل الكتلة، مباشرة من "دماغ" الكمبيوتر. واكتشفوا أن النموذج يمكن أن يجتاز اختبار المجس ويبدو وكأنه يعرف الكتلة، ومع ذلك يفشل في استخدام تلك المعرفة عند إجراء تنبؤ فعلي. وعلى العكس من ذلك، يمكن لنموذج أن يفشل في اختبار المجس ومع ذلك يستخدم المعلومات بفعالية إذا وفر المشهد أدلة أخرى. وقد أثبت هذا أن مجرد القدرة على قراءة خاصية من ذاكرة النموذج لا يعني أن النموذج يستخدمها فعلياً لفهم العالم.
وكان المقياس النهائي للنجاح هو مهمة عملية: طلب تحديد السرعة الدقيقة اللازمة لدفع الصندوق إلى مسافة هدف محددة. في البيئة الفوضوية والمتغيرة، أخطأ أفضل نموذج الهدف بمقدار 4.0 مليمترات فقط. أما النموذج غير المدرب، فقد أخطأ بمقدار 19.6 مليمتر، وهو معدل فشل مطابق لتجاهل الجسم تماماً. وخلص الباحثون إلى أن القدرة على تمييز النماذج الجيدة عن السيئة يجب أن تُثبت، لا أن تُفترض. فإذا لم يستطع الاختبار التمييز بين ذكاء اصطناعي متطور وبين مُخمّن عشوائي، فإن الاختبار نفسه يكون معطلاً. ومن خلال إدخال فوضى العالم الحقيقي والمطالبة من الكمبيوتر باستخدام الأدلة من تفاعلات متعددة، نجحت الطريقة الجديدة في الكشف عن أي النماذج تفهم حقاً فيزياء الحركة وأيها تكتفي فقط بالنظر إلى البكسلات.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.