← أحدث الأبحاث
🤖 machine learning

Part Grounding, Not Action Knowledge: Locating the Bottleneck in VLM Affordance Prediction

تحدد هذه الورقة أن تحديد أجزاء الأجزاء (part grounding)، وليس نقص معرفة الفعل، هو العائق الأساسي في التنبؤ بالإمكانات (affordance prediction) في نماذج الرؤية واللغة، مما يثبت أن التحديد الصريح لجزء الكائن المستهدف يحسن دقة الفعل بشكل كبير عبر جميع النماذج المختبرة.

المؤلفون الأصليون: Sarthak Sattigeri

نُشر 2026-09-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Sarthak Sattigeri

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تتحسن الروبوتات في رؤية العالم من حولها؛ إذ يمكنها تحديد الكرسي، أو الكوب، أو الكاميرا بمجرد النظر إلى صورة فوتوغرافية. ولكن هناك فجوة بين رؤية الشيء ومعرفة كيفية تحريكه. ولجعل الروبوت مفيداً، نحتاج منه أن يفهم "الإمكانيات المتاحة" (affordances)، وهو مفهوم يعني ببساطة معرفة الغرض من الشيء وكيف ينبغي للإنسان أو الآلة التفاعل معه. إذا رأى الروبوت درجاً، يجب أن يعرف أنه يُسحب. وإذا رأى زراً، يجب أن يعرف أنه يُضغط. يبدو هذا أمراً بديهياً للإنسان، لكن بالنسبة للذكاء الاصطناعي، فهو لغز صعب بشكل مفاجئ. وقد اختبر الباحثون نماذج الرؤية واللغة — وهي أنظمة يمكنها النظر إلى صورة والإجابة عن أسئلة حولها — لمعرفة ما إذا كان بإمكانها استنتاج هذه التفاعلات. كانت النتائج مخيبة للآمال، حيث فشلت الآلات غالباً في تقديم التعليمات الصحيحة. وكان السؤال الكبير هو: لماذا؟ هل تفتقر هذه النماذج إلى المعرفة الأساسية بكيفية عمل الأشياء، أم أنها تنظر فقط إلى الجزء الخطأ من الصورة؟

شرع باحث في حل هذا الغموض عبر اختبار ثمانية نماذج مختلفة من الذكاء الاصطناعي في مهمة محددة تتضمن تسعة عشر جسماً مختلفاً، مثل الكاميرات والأدراج والأغطية. وقد طرح على النماذج سؤالاً بسيطاً: بالنظر إلى صورة جسم ما، ما هي الحركة التي يجب أن يقوم بها الروبوت عليه؟ كانت الإجابات الصحيحة مقتصرة على مجموعة صغيرة من الأفعال، مثل الدفع، أو السحب، أو الرفع. وعندما سُمح للنماذج باختيار الجزء الذي ستتحدث عنه من الجسم، كان أداؤها سيئاً للغاية. في الواقع، عندما كانت الإجابة الصحيحة هي "اضغط" شيئاً ما، لم تذكر النماذج هذه الكلمة تقريباً. فمن بين أربع وستين مرة كان فيها "الدفع" هو الحركة الصحيحة، نجحت النماذج في ذلك مرة واحدة فقط. وفي بقية المرات، اقترحت أفعالاً خاطئة تماماً بالنسبة للموقف.

للوهلة الأولى، بدا هذا كفشل كبير في المعرفة؛ إذ بدا أن النماذج ببداً لا تعرف ببساطة أن الأزرار تُضغط والأدراج تُسحب. ومع ذلك، عندما نظر الباحث بتمعن فيما كانت تقوله النماذج بالفعل، وجد قصة مختلفة. لم تكن النماذج مرتبكة بشأن الفعل، بل كانت مرتبكة بشأن "الهدف". فعند عرض كاميرا عليها وسؤالها عما يجب فعله، كانت النماط غالباً تصف كيفية التقاط جسم الكاميرا بأكمله، بدلاً من شرح كيفية الضغط على الزر الموجود في الخلف. لقد كانت تجيب على سؤال منطقي حول الجسم ككل، لكنها كانت تفتقد إلى الجزء المحدد الذي يجب التأثير عليه. كانت النماذج تنظر إلى القطعة الخطأ من اللغز.

ولاختبار هذه النظرية، قام الباحث بتغيير التجربة. فبدلاً من ترك النماذج تختار الجزء الذي ستتحدث عنه، أخبر النماذج بالضبط أي جزء يجب أن تركز عليه. قال لها: "انظري إلى الزر الموجود في هذه الكاميرا. ماذا يجب أن يفعل الروبوت به؟". كان التغيير دراماتيكياً؛ فبمجرد أن سمّى الباحث الجزء المحدد، ارتفعت دقة النماذج بشكل كبير. تحسن كل نموذج، حيث ارتفعت معدلات نجاحها من نسبة منخفضة بلغت حوالي خمسة عشر بالمائة إلى نسبة عالية وصلت إلى قرابة خمسة وتسعين بالمائة. والنماذج التي فشلت سابقاً في اقتراح فعل "اضغط" ولو لمرة واحدة، أصبحت فجأة تصيب في معظم الأحيان. كما بدأت في استخدام اللغة الصحيحة، واصفةً كيف يتحرك الزر للداخل عند ضغطه، حتى دون أن تُعطى قائمة من الكلمات للاختيار منها.

تشير هذه النتيجة إلى أن المشكلة لم تكن نقصاً في المعرفة الفيزيائية، بل كانت فشلاً في ربط السؤال بالموقع الصحيح. كانت النماذج تعرف الغرض من الزر؛ لكنها لم تكن تستطيع الاعتماد على إيجاد الزر في الصورة بمفردها. كما اختبر الباحث قدرة النماذج على الإشارة إلى المكان الدقيق في الجسم الذي يجب أن يمسكه الروبوت. في الصور الفوتوغرافية الحقيقية، أدى بعض النماذج أداءً جيداً، ولكن في الصور المولدة حاسوبياً، لم يستطع أي منها الإشارة إلى مكان أفضل من التخمين العشوائي. وقد أكد ذلك أن الحلقة الضعيفة كانت بالفعل القدرة على تحديد الجزء المحدد من الجسم الذي يهم.

كشفت الدراسة أيضاً عن بعض الأخطاء في كيفية إعداد الباحث لاختباراته الخاصة. فقد أدرك أن طريقته الأولية في قياس النجاح كانت سهلة للغاية في بعض الجوانب، مما سمح للنموذج بالحصول على درجة عالية بمجرد تخمين مركز الصورة، وكانت صارمة للغاية في جوانب أخرى، حيث عاقبت النماذج على أخطاء طفيفة في كيفية تعريف الفعل. وبمجرد إصلاح أخطاء القياس هذه، أصبحت النتائج أكثر وضوحاً؛ فالنماذج لم تكن تفتقر إلى قواعد الفيزياء، بل كانت تفتقر إلى القدرة على تركيز انتباهها على التفصيل الصحيح.

إن الخلاصة لأي شخص يبني روبوتات هي عملية ومحددة: إذا كنت تريد لروبوت أن يتلاعب بجسم ما، فلا يمكنك فقط تسليمه صورة وسؤاله عما يجب فعله. يجب أن يمتلك النظام وسيلة لتحديد الجزء المحدد من الجسم الذي يحتاج إلى الاهتمام أولاً. وبمجرد تسمية هذا الجزء، يمكن للذكاء الاصطناعي أن يخبرك بموثوقية كيف تحركه. النماذج ليست معطلة؛ إنها فقط تحتاج إلى القليل من المساعدة لتعرف أين تنظر. وهذا التمييز يغير طريقة تفكيرنا في مستقبل الروبوتات؛ فبدلاً من محاولة تعليم الآلات كل قاعدة ممكنة من قواعد الميكانيكا، قد نحتاج فقط إلى منحها أدوات أفضل للعثور على الجزء الصحيح من العالم للعمل عليه. المعرفة موجودة، لكنها فقط تحتاج إلى توجيه نحو المسار الصحيح.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →