Contextual Observer Grounding: Evaluating Situated Spatial Reasoning in Vision-Language Models
تقدم هذه الورقة البحثية معيار "نقطة وجهة النظر" (POVBench) لتقييم قدرة نماذج الرؤية واللغة على أداء "تأصيل المراقب السياقي" — أي استنتاج منظور المتحدث الموقعي من خلال القرائن السياقية — وتُظهر أنه في حين تعاني النماذج الحالية في هذه المهمة، فإن التقسيم الصريح للاستدلال المكاني المتعلق بالمراقب يمكن أن يحسن بشكل كبير من تحديد الموقع المستهدف.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول العثور على غرض مفقود في غرفة لم تدخلها من قبل، بناءً فقط على وصف صديق لك لمكان تركه فيه. قد تسمع: "لقد أسقطت مفاتيحي على الطاولة التي تقع إلى يسار المصباح بينما كنت أعد القهوة". لحل هذا اللغز، لا تحتاج فقط إلى معرفة شكل الطاولة والمصباح؛ بل يجب عليك أولاً إعادة بناء موقع صديقك في الغرفة، وتخيل خط رؤيته، ثم وضع المفاتيح ذهنياً بالنسبة لوجهة نظره تلك تحديداً. هذه القدرة على فهم المساحة من منظور شخص آخر، باستخدام أدلة حول نشاطهم والبيئة المحيطة، هي جزء أساسي من التواصل البشري. وهي تتيح لنا التعاون بكفاءة دون الحاجة إلى مشاركة كل تفصيل بصري. ولكي تتمكن الروبوتات والذكاء الاصطناعي من العمل بجانبنا في منازلنا، يجب عليهم إتقان هذه المهارة نفسها، المعروفة باسم الاستدلال المكاني الموقفي.
تبحث دراسة جديدة أجراها باحثون من جامعة طوكيو وجامعة كارنيجي ميلون فيما إذا كانت أنظمة الذاء الاصطناعي الحديثة يمكنها حقاً أداء هذه المهمة. قام الفريق، بقيادة ميمو شيراكا، وهاوتشن تشانغ، ويوناتان بيسك، بإنشاء اختبار صارم يسمى "معيار نقطة النظر" (Point-of-View Benchmark) لمعرفة ما إذا كانت الآلات يمكنها استنتاج موقع المتحدث ومن ثم تحديد موقع كائن بناءً على ذلك المنظور المستنتج. وتكشف أعمالهم أنه بينما تبدو نماذج الذكاء الاصطني الحالي مثيرة للإعجاب في العديد من المهام البصرية، إلا أنها تعاني بشكل كبير عندما يُطلب منها التفكير في المساحة من وجهة نظر لا يمكنها رؤيتها مباشرة، حتى عند تزويدها بتعليمات واضية.
بنى الباحثون اختبارهم باستخدام عالم تم إنشاؤه بواسطة الكمبيوتر من منازل مُنشأة إجرائياً، كاملة بأثاث وتخطيطات واقعية. في هذه البيئة الرقمية، يستكشف روبوت محاكى كل منزل، ملتقطاً سلسلة من الصور من منظور الشخص الأول أثناء انتقاله من غرفة إلى أخرى. ويتمثل جوهر التجربة في جملة باللغة الطبيعية تصف موقع جسم ما، مثل "رأيت الكتاب على يسار السرير". التحدي الملقى على عاتق الذكاء الاصطناعي هو النظر في صور الاستكشاف الخاصة بالروبوت، ومعرفة أين كان يقف الشخص المتحدث عندما قال تلك الجملة، ثم الإشارة إلى مكان وجود الكتاب في تلك الرؤية المحددة. اختبرت الدراسة ثلاثة مستويات مختلفة من الصعوبة لفهم أين تتعثر الآلة بالضبط. في النسخة الأصعب، تعطي الجملة فقط تلميحاً عن النشاط، مثل "أثناء استبدال مصباح"، مما يجبر الذكاء الاصطناعي على تخمين الموقع. وفي النسخة المتوسطة، تذكر الجملة صراحةً الشيء الذي يتفاعل معه الشخص، مثل "أثناء استبدال المصباح في مصباح الأرضية". وفي النسخة الأسهل، يتم عرض الصورة الدقيقة لمنظور المتحدث للذكاء الاصطناعي ببساطة.
كانت النتائج كاشفة. ففي مجموعة واسعة من نماذج الذكاء الاصطناعي المتقدمة، بما في ذلك الأنظمة التجارية والنسخ مفتوحة المصدر، ظل الأداء منخفضاً في جميع السيناريوهات الثلاثة. وحتى عندما قيل للذكاء الاصطناعي صراحةً أي جسم كان المتحدث بالقرب منه، أو عندما أُعطي الصورة الدقيقة من وجهة نظر المتحدث، فشلت النماذج مراراً في تحديد الموقع الصحيح. وكانت الفجوة بين النسختين الصعبة والمتوسطة صغيرة بشكل مفاجئ، مما يشير إلى أن الصعوبة الرئيسية ليست فقط في معرفة أين كان المتحدث واقفاً، بل في فهم كيفية ترجمة وصف مثل "إلى يسار" إلى بقعة محددة في مشهد بصري. غالباً ما اختارت النماذج الغرفة الخاطئة أو خلطت بين الجسم المرجعي، مثل الخلط بين إطار الباب والثلاجة، لأنها لم تستطع الجمع بفعالية بين الأدلة البصرية وسياق النشاط.
ولمعرفة ما إذا كان بإمكان النماذج التحسن بالمساعدة، جرب الباحثون نهجاً مختلفاً. فقد طلبوا من الذكاء الاصطناعي تفكيك عملية تفكيره خطوة بخطوة، مع توضيح كيفية تحديده لموقع المتحدث، وتحديد موقع الجسم المرجعي، ثم تحديد الاتجاه. أدت هذه الطريقة، التي يسميها المؤلفون "الاستدلال المكاني المهيكل"، إلى تحسن ملحوظ في الدقة. فعندما تم توجيه النماذج للتفكير في المشكلة بهذه الطريقة المهيكلة، أصبحت أفضل في تحديد مواقع الأجسام المخفية. وهذا يشير إلى أن الذكاء الاصطناعي يمتلك المعلومات اللازمة، لكنه يكافح لتجميعها في نموذج ذهني متماسك دون توجيه صريح حول كيفية ربط النقاط ببعضها البعض.
كما اختبرت الدراسة هذه الأفكار في العالم الحقيقي باستخدام لقطات فيديو فعلية لأشخاص يسيرون عبر المنازل. وقد عكست النتائج عمليات المحاكاة الحاسوبية: استمرت نماذج الذكاء الاصطناعي في المعاناة من المهمة، حيث سجلت أداءً عند أو تحت نسبة نجاح خمسين بالمائة. ومع ذلك، أظهرت النماذج التي استخدمت نهج التفكير خطوة بخفض نتائج أفضل من تلك التي لم تستخدمه. وهذا يشير إلى أن الصعوبة ليست مجرد خلل في البيئة المُنشأة حاسوبياً، بل هي تحدٍ حقيقي للتكنولوجيا الحالية عند مواجهة الواقع المعقد والفوضوي للمساحات البشرية.
في نهاية المطاف، تسلط هذه الأبحاث الضوء على فجوة حرجة في قدرات الذكاء الاصطناعي المتجسد. فبينما يمكن للآلات التعرف على الأشياء والإجابة على أسئلة حول ما تراه، إلا أنها لم تتعلم بعد كيفية استنتاج منظور المتحدث البشري بشكل طبيعي أو إعادة بناء مشهد من وجهة نظر لم تشاهدها مباشرة من قبل. وتشير النتائج إلى أنه لكي تتمكن الروبوتات من التعاون حقاً مع البشر في حياتنا اليومية، فإنها تحتاج إلى تطوير قدرة أعمق على التفكير في المساحة من وجهة نظر شخص آخر، باستخدام السياق والمنطق السليم لملء القطع المفقودة من اللغز البصري.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.