GroundBench: A Factorized, Counterfactual Benchmark for Locating VLM Affordance Failures
تُعد GroundBench معياراً مرجعياً تحليلياً وضد واقعي، صُمم لعزل وتشخيص الأسباب المحددة لإخفاقات نماذج الرؤية واللغة في إدراك القدرة على التنفيذ (affordance)، وذلك من خلال إثبات أن العديد من نجاحات التوطين الظاهرية مدفوعة في الواقع بالارتباطات بين الفئة والفعل بدلاً من الاستنتاج البصري أو الميكانيكي الحقيقي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل ذراعاً آلياً يمد يده نحو كوب قهوة. لكي ينجح، يجب على الآلة أن تحل ثلاثة ألغاز متمايزة في آن واحد: يجب أن تقرر أي جزء من الكوب هو المهم (المقبض، وليس الحافة)، وتحدد موقع ذلك الجزء بدقة في العالم المرئي، وتفهم ما هو الإجراء الذي يدعو إليه ذلك الجزء (الإمساك، وليس الدفع). لسنوات، اختبر الباحثون أنظمة الذكاء الاصطناعي في هذه المهام عبر سؤالها عن ماهية ما يجب أن تفعله الآلة بجسم ما. وقد اقترحت دراسة مرافقة حديثة أنه إذا أخبرت الذكاء الاصطناعي ببساطة باسم الجزء المستهدف — كأن تقول "أمسك بالمقبض" بدلاً من مجرد "أمسك بالكوب" — فإن أداء النظام يقفز بشكل هائل. أدى هذا إلى استنتاج مفعم بالأمل: أن الذكاء الاصطناعي بدأ أخيراً يتعلم كيف ينظر إلى الصورة ويستنتج الميكانيكا الفيزيائية للجسم.
ومع ذلك، يشير تحقيق جديد يسمى "GroundBench" إلى أن هذا الاستنتاج قد يكون سابقاً لأوانه. فقد اشتبه الباحثون وراء هذه الدراسة، بقيادة ساتيغيري من جامعة مانيبل جايبور، في أن الذكاء الاصطناعي لا يتعلم في الواقع رؤية الجسم بشكل أفضل. بدلاً من ذلك، افترضوا أن النظام قد يعتمد على طريق مختصر: مجرد حفظ أن كلمات معينة، مثل "مقبض"، تقترن دائماً تقريباً بفعل "الإمساك"، بغض النظر عما تظهره الصورة بالفعل. ولاختبار ذلك، قاموا ببناء معيار مرجعي صارم مصمم للفصل بين القدرة على إيجاد جزء في صورة وبين القدرة على تخمين إجراء بناءً على كلمة. لم يكتفوا بسؤال الذكاء الاصطناعي عن أداء مهمة فحسب؛ بل قاموا بتجريد المعلومات بشكل منهجي، قطعة تلو الأخرى، لمعرفة أي دليل محدد كان يقود النجاح فعلياً.
قام الباحثون بإنشاء سلسلة من ستة سيناريوهات مختلفة، أو حالات، لاختبار ثلاث نسخ مختلفة من نموذج رائد للذكاء الاصطناعي. في السيناريو الأول، رأى الذكاء الاصطناعي فقط صورة لجسم ما، مثل لوحة مفاتيح أو باب، دون تعليمات نصية. وفي السيناريو الثاني، أضافوا اسم الجسم، مثل "لوحة مفاتيح". وفي الثالث، سموا الجزء المحدد، مثل "المسافة" (spacebar). وفي الرابع، قدموا الموقع الدقيق للجزء على الشاشة — نقطة محددة ومربع حولها — لكنهم تعمدوا حجب اسم الجزء. وفي الخامس، قدموا الاسم والموقع معاً. وأخيراً، في السيناريو السادس، أضافوا تفاصيل تقنية حول كيفية حركة الجسم، مثل ما إذا كان المفصل من نوع المفصلة أو المنزلق.
كانت النتائج مذهلة ومناقضة للتوقعات. فعندما أعطى الباحثون الذكاء الاصطناعي الموقع الدقيق للجزء المستهدف لكنهم رفضوا إخباره باسم هذا الجزء، انهار أداء النظام. وعبر النماذج الثلاثة التي تم اختبارها، انخفضت دقة اختيار الإجراء الصحيح إلى مستوى التخمين العشوائي، أو حتى أقل. أحد النماذج، عندما أُعطي موقع زر ما ولكن دون اسمه، سجل 0.26 فقط، بينما سجل خط أساس بسيط تجاهل الصورة تماماً 0.53. كان بإمكان الذكاء الاصطناعي إعادة إنتاج الموقع الذي أُظهر له بدقة، واضعاً "إصبعه" تماماً حيث أشار الباحثون، ومع ذلك فشل في فهم ما يجب فعله بهذا الموقع. كان الأمر كما لو أن الروبوت يستطيع رؤية الزر، لكن ليس لديه أدنى فكرة عن أن الأزرار مخصصة للضغط.
وفي تباين صارخ، عندما أعطى الباحثون الذكاء الاصطناعي اسم الجزء مع حجب موقعه، ارتفع الأداء بشكل كبير. فالنماذج ذاتها التي فشلت مع بيانات الموقع فقط، قفزت إلى معدلات دقة تتراوح بين 0.68 و0.74 عندما قيل لها أن الجزء هو "زر" أو "باب"، حتى دون رؤية مكانه. وقد ظل هذا النمط ثابتاً في جميع الحالات: بمجرد أن يُعطى الذكاء الاصطناعي اسم فئة الجزء، يمكنه دائماً تقريباً تخمين الإجراء الصحيح. وجد الباحثون أنه في مجموعتهم المختارة بعناية من الأجسام، كان اسم الجزء وحده كافياً لتحديد الإجابة. لم يكن الذكاء الاصطناعي ينظر إلى الصورة لفهم الفيزياء؛ بل كان يقرأ الكلمة ويسترجع ارتباطاً محفوظاً مسبقاً.
وللتأكد من هذا الاشتباه، أجرى الباحثون اختبار ضبط حيث أزالوا الصورة تماماً وسألوا النماذج بناءً على النص وحده. وبالنسبة لأكثر النماذج تقدماً في الاختبار، لم يؤدِ إزالة الصورة إلى أي تغيير في أدائه في الحالات التي تم فيها تقديم اسم الجزء. فقد سجل النموذج نتائج جيدة بقدر، أو حتى أفضل قليلاً من، الأداء بدون رؤية الجسم. وفر هذا دليلاً قوياً على أن النظام لم يكن يستخدم "التأسيس البصري" (visual grounding) — وهي عملية ربط الكلمات ببيكسلات محددة في صورة — بل كان يعتمد بدلاً من ذلك على اختصار قائم على النص. لقد عرف الذكاء الاصطناعي أن "الباب ذو المفصلة" يعني "السحب" وأن "الزر المنزلق" يعني "الدفع" لأنه رأى تلك الارتباطات في بيانات تدريبه، وليس لأنه فهم ميكانيكا الباب أو الزر المحدد أمامه.
كما اختبرت الدراسة ما إذا كان بإمكان الذكاء الاصطناعي اتباع سؤال مخادع. فقد أخذ الباحثون صورة لجسم يحتوي على أجزاء متعددة، مثل لوحة مفاتيح بها مفاتيح كثيرة، وسألوا الذكاء الاصطناعي عن تنفيذ إجراء على جزء غير تقليدي، مثل مفتاح معين نادراً ما يُستخدم. أرادوا معرفة ما إذا كان الذكاء الاصطناعي سينظر حقاً إلى ذلك المفتاح المحدد أم أنه سيعود إلى الإجراء الأكثر شيوعاً للجسم بأكمله. وبينما اتبعت النماذج التعليمات الجديدة بشكل عام، إلا أنها واجهت صعوبة كبيرة عندما كان الإجراء المطلوب غير معتاد، مثل رفع جزء رأسياً. في هذه الحالات، غالباً ما عادت النماذج إلى الإجراء القياسي، مما يشير إلى أنها لا تزال تعتمد على ارتباطاتها الأكثر شيوعاً بدلاً من تحليل المشهد البصري فعلياً.
ولعل النتيجة الأكثر إثارة للدهشة هي أن إضافة المزيد من المعلومات لم تساعد دائماً. فعندما أعطى الباحثون الذكاء الاصطناعي الموقع واسم الجزء، ثم أضافوا أوصافاً ميكانيكية مفصلة حول كيفية حركة الجسم، انخفض الأداء في الواقع. لم تتحسن النماذج، بل أصبحت أقل دقة. وهذا يشير إلى أن المعلومات الإضافية أربكت النظام أو صرفت انتباهه عن الاختصار البسيط والفعال المتمثل في استخدام اسم الجزء فقط. وخلص الباحثون إلى أنه بالنسبة لهذه المهام المحددة، لم تكن البيانات الأكثر تعني تفكيراً أفضل.
إن تداعيات هذا العمل كبيرة في مجال الروبوتات والذكاء الاصطناعي. فهي تكشف أن الدرجات العالية في بعض الاختبارات قد تكون مضللة. يمكن للذكاء الاصطناعي أن يبدو كخبير في التفكير الفيزيائي بينما هو في الواقع مجرد خبير في الارتباطات اللفظية. وجد الباحثون أن التحسن الهائل الذي شوهد في الدراسات السابقة، حيث أدى تسمية الجزء إلى زيادة الدقة بفارق كبير، لم يكن ناتجاً على الأرجح عن تعلم الذكاء الاصطناعي الرؤية بشكل أفضل، بل لأن الاسم نفسه كان يحتوي على الإجابة. لا تدعي الدراسة أن هذه النماذج غير قادرة على التفكير البصري، لكنها تظهر أنها لم تكن تستخدمه تحت هذه الظروف المحددة.
يعمل "GroundBench" كأداة تشخيصية، وسيلة لتقشير طبقات أداء الذكاء الاصطناعي لمعرفة ما يحدث فعلياً في الأعماق. فمن خلال الفصل بين الموقع البصري والاسم الدلالي، كشف الباحثون عن الفجوة بين ما تبدو عليه النماذج وما تفعله حقاً. لقد وجدوا أنه عند إزالة اسم الجزء، لم تتمكن النماذج من إيجاد الإجراء، حتى عندما كان الموقع واضحاً تماماً. وهذا يشير إلى أنه بالنسبة لهذه الأنظمة، فإن طريق التفكير الميكانيكي الحقيقي أطول مما كان يُعتقد. إنهم لم يتعلموا بعد كيف ينظرون إلى جسم ويفهمون وظيفته؛ بل تعلموا كيف يستمعون إلى كلمة ويخمنون الوظيفة. لا تنتهي الدراسة بإعلان الفشل، بل بخريطة أوضح للمسار الذي يجب أن تسلكه الأعمال: بناء أنظمة يمكنها حقاً ربط الكلمات التي تسمعها بالعالم المادي الذي تراه، بدلاً من الاعتماد على الاختصارات التي خدمتهم جيداً حتى الآن.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.