When Should a Failing Robot Ask? Initiating Corrective Human-Robot Dialogue from Audited Sensor Evidence
تُظهر هذه الورقة أن نماذج الرؤية واللغة المفتوحة تفشل في اتخاذ قرارات مثالية بشأن متى تطلب المساعدة من البشر بسبب اعتمادها على تنسيق الأوامر بدلاً من الأدلة الحسية الفعلية، إلا أن دقتها التشخيصية واتخاذ القرار يمكن تحسينهما بشكل كبير من خلال دمج بيانات حسية متنوعة وتأصيل أفعالها في الموثوقية المقاسة وتكاليف المهام.
عندما يسقط روبوت يعمل بجانب إنسان كوباً أو يفشل في التقاط أداة، تأتي لحظة حرجة قبل أن ينطق أي شخص. يجب على الآلة أن تقرر خطوتها التالية: هل تحاول إصلاح المشكلة بنفسها، أم تفحص مستشعراتها الداخلية بحثاً عن أدلة، أم تتوقف لتطلب المساعدة من الإنسان؟ هذا القرار ليس مجرد مسألة تهذيب؛ بل هو عملية حسابية للمخاطر. فطلب المساعدة يكلف وقتاً ويقطع تركيز الإنسان، لكن التصرف بتهور بناءً على تخمين خاطئ قد يؤدي إلى مزيد من الضرر. لسنوات، افترض الباحثون أنه إذا استطاع الروبوت رؤية الفشل، فبإمكانه فهم سبب حدوثه، أو أنه يجب عليه ببساطة طلب المساعدة كلما شعر بعدم اليقين. ومع ذلك، فإن دراسة جديدة تتحدى هذه الافتراضات، مشيرة إلى أن قدرة الروبوت على تشخيص المشكلة تعتمد كلياً على المستشعرات التي يستخدمها، وأن نماذج الذكاء الاصطناًعي الحالية سيئة بشكل مفاجئ في معرفة متى يجب عليها التوقف وطلب المساعدة.
وللتحقيق في ذلك، بنى الباحثون بيئة محكومة حيث يمكنهم خلق حالات فشل محددة ذات أسباب معروفة. قاموا ببرمجة ذراع روبوتية محاكية لأداء مهمة بسيطة: التقاط جسم ووضعه في مكان ما. ثم أدخلوا ثلاثة أنواع متميزة من المشكلات. أولاً، قد يفشل الروبوت في رؤية الجسم لأنه كان مخفياً، أو مفقوداً، أو بسبب ضعف الإضاءة. ثانياً، قد يحاول الروبوت رفع الجسم لكنه يسقطه لأن قبضته كانت ضعيفة، أو الجسم ثقيل جداً، أو السطح زلق للغاية. ثالثاً، قد يفشل في وضع الجسم لأن الحاوية المستهدفة كانت ممتلئة أو تحركت بعيداً عن المتناول. ولأن الباحثين هم من صنعوا حالات الفشل هذه بأنفسهم، فقد عرفوا السبب الدقيق لكل خطأ، مما سمح لهم باختبار ما إذا كان بإمكان الروبوت بالفعل استنتاج ذلك.
اختبر الباحثون أولاً المعلومات التي يمكن أن توفرها المستشعرات المختلفة. ووجدوا انقساماً حاداً فيما يمكن للروبوت تعلمه. فعندما كان الفشل يتعلق بعدم رؤية الجسم، كانت الكاميرا ممتازة في تشخيص المشكلة، حيث حددت السبب بدقة في كل مرة تقريباً. ومع ذلك، عندما كان الفشل يتعلق بإسقاط الجسم، كانت الكاميرا عديمة الفائدة تقرياً. فمهما بلغت درجة تقدم تحليل الصور، لم تستطع الكاميرا التمييز بين القبضة الضعيفة، أو الجسم الثقيل، أو السطح الزلق، لأن هذه القوى الفيزيائية غير مرئية للعدسة. وفي المقابل، عندما أعطى الباحثون الروبوت بيانات القوة الخاصة به — قياسات لمدى قوة ضغط القابض وكمية الوزن الذي يشعر به — استطاع الروبوت تشخيص عملية الإسقاط بدقة تقترب من المثالية. كشف هذا عن حقيقة جوهرية: لا يمكن للروبوت تشخيص مشكلة إذا كانت المعلومات المتعلقة بتلك المشكلة غير موجودة في البيانات التي ينظر إليها.
ثم انتقلت الدراسة إلى ستة نماذج مختلفة من الذكاء الاصطناًعي مفتوحة المصدر، وهي الأنظمة التي تُستخدم غالباً لمنح الروبوتات القدرة على فهم اللغة والصور. طلب الباحثون من هذه النماذج النظر في لقطات الكاميرا لمحاولة فاشلة وتخمين ما الذي حدث بشكل خاطئ. كانت النتائج مذهلة. لم تتصرف هذه النماذج كعلماء حذرين يعرفون متى تنقصهم المعلومات؛ بل كان سلوكها محكوماً بتنسيق السؤال المطروح عليها. فإذا كان خيار قول "لا أعرف" مدرجاً في النهاية، فإن النماذج كانت ترفض الإجابة دائماً تقريباً، مدعية عدم قدرتها على تحديد السبب. أما إذا نقل الباحثون هذا الخيار نفسه إلى أعلى القائمة، فقد توقفت النماذج فجأة عن الرفض وبدأت في التخمين، وبثقة عالية غالباً، حتى عندما كانت مخطئة. لم تكن مستويات ثقتها تعكس الواقع؛ إذ يمكن للنموذج أن يكون متأكداً بنسبة 100 بالمائة من إجابة خاطئة، أو متأكداً بنسبة 50 بالمائة من إجابة صحيحة، دون وجود نمط يربط بينهما.
كما اختبر الباحثون ما إذا كان تزويد النماذج ببيانات القوة، مكتوبة كنص بسيط، سيساعدها. بالنسبة لأربعة من النماذج الستة، أحدثت هذه المعلومة الإضافية فرقاً هائلاً. فجأة، أصبح بإمكانهم تشخيص حالات إسقاط الأجسام بشكل صحيح، وانتقلوا من التخمين العشوائي إلى الحصول على الإجابة الصحيحة في أكثر من نصف الحالات. أثبت هذا أن النماذج لم تكن عاجزة بطبيعتها عن فهم فيزياء الفشل؛ بل كانت تفتقر ببساطة إلى بيانات المستشعرات الصحيحة. ومع ذلك، حتى مع هذه القدرة الجديدة، لا تزال النماذج تفشل في اتخاذ القرار الصحيح بشأن متى تطلب المساعدة. فهي لم تطلب المساعدة بشكل أكبر عندما كان السؤال "رخيص التكلفة" والمخاطرة بالعمل بمفردها عالية، ولم تتوقف عن الطلب عندما كان السؤال "مكلفاً". كانت استراتيجيتها في الطلب جامدة وتجاهلت تكلفة مقاطعة الإنسان.
إن الاستراتيجية الأكثر فعالية للروبوت، وفقاً للدراسة، لا تعتمد على شعور النموذج بالثقة، والذي غالباً ما يكون مضللاً. بدلاً من ذلك، يجب أن يعتمد قرار الطلب على حقيقتين قابلتين للقياس: مدى دقة تشخيص الروبوت فعلياً، ومدى تكلفة سؤال الإنسان. إذا كانت مستشعرات الروبوت قادرة على إخباره بما هو خطأ بشكل موثوق، فعليه أن يتصرف. أما إذا كانت المستشعرات لا تستطيع تقديم الإجابة، أو إذا كان تشخيص الروبوت نفسه من المرجح أن يكون خاطئاً، فعليه أن يطلب المساعدة. تظهر الدراسة أن سؤالاً واحداً للإنسان يمكن أن يرفع معدل نجاح الروبوت من الصفر تقريباً إلى أكثر من 80 بالمائة، ولكن فقط إذا سأل الروبوت في اللحظة المناسبة. اليوم، غالباً ما يكون قرار الطلب مجرد تخمين، لكن المسار نحو المستقبل واضح: يجب برمجة الروبوتات لتعرف حدود حواسها والتكلفة الحقيقية للسؤال، بدلاً من الثقة في ثقة آلة لا تعرف ما لا تعرفه.
ملخص تقني: متى يجب على الروبوت الفاشل أن يسأل؟
بيان المشكلة
عندما يفشل روبوت في مهمة ما أثناء العمل بجانب إنسان، فإن قراره التواصلي الأول هو ما إذا كان سيعمل بناءً على تشخيصه الخاص، أو يستشير مستشعراً داخلياً، أو يقاطع الإنسان. تفتقر الأنظمة الحالية إلى قدرتين حرجتين لاتخاذ هذا القرار بشكل مثالي: (1) معرفة مدى كشف مستشعراتها المحددة عن السبب الحقيقي للفشل، و(2) معرفة مدى موثوقية تشخيصها الخاص. تفترض الأدبيات الحالية إما أن أسباب الفشل يمكن استردادها من الملاحظات دون تحقق، أو أنها لا يمكن استردادها دون تحديد الفجوة بدقة. تعالج هذه الورقة "الخطوة غير المفحوصة" بين اكتشاف الفشل والإصلاح: وهي تحديد متى ينبغي للروبوت بدء حوار تصحيحي بناءً على أدلة مدققة.
المنهجية
1. معيار مرجعي محاكى مع حقيقة أرضية مدققة
أنشأ المؤلفون معياراً مرجعياً في محاكي الفيزياء LIBERO حيث يتم حقن أسباب الفشل وتكون معروفة بالبناء. تركز الدراسة على ثلاث عائلات من الفشل:
فشل الكشف (العائلة B): لا يستطيع الروبوت العثج على الجسم (الأسباب: الحجب، الغياب، خطأ في التسمية، الإضاءة الخافتة).
فشل الإمساك (العائلة A): ينزلق الجسم أثناء الرفع (الأسباب: قوة قبض منخفضة، كتلة عالية، احتكاك منخفض).
فشل الوضع (العائلة C): لا يمكن وضع الجسم (الأسباب: الحاوية مغلقة، ممتلئة، أو تحركت).
بروتوكول التدقيق: لتحديد ما يكشفه كل مستشعر، قام المؤلفون بتدريب مصنفات وإخضاعها لثلاث فحوصات صارمة لمنع تسرب البيانات:
فحص الخلط (Shuffle Check): يتم خلط الملصقات؛ ويجب أن تنخفض الدقة إلى مستوى الصدفة.
فحص النقل (Transfer Check): تُختبر النماذج على وجهات نظر كاميرا ومظاهر مشاهد محجوزة؛ ويجب أن تظل الدقة قوية.
فحص الفصل (Separation Check): تأتي مجموعات التدريب والاختبار من عمليات محاكاة مختلفة لتجنب التكرار الوشيك. يُطلق على الدرجة التي تجتاز جميع الفحوصات اسم "الشهادة"، وهي تمثل حداً أدنى موثوقاً للمعلومات المتاحة في ذلك النمط من المستشعرات.
2. تقييم النموذج
تم تقييم ستة نماذج رؤية ولغة مفتوحة (بمعلمات تتراوح بين 7 إلى 16 مليار) وهي: Qwen2.5-VL، وCosmos-Reason2، وCosmos3-Nano، وInternVL3، وPixtral، وLlama-3.2-Vision.
ظروف المدخلات: تم اختبار النماذج باستخدام إطارات الكاميرا فقط، وبيانات القوة (القياس عن بعد) كنص، ومجموع منهما.
متغيرات الأوامة (Prompt Variants): شملت الدراسة مسوحات المتانة، مثل نقل خيار "لا يمكن تحديده" من المركز الأخير إلى المركز الأول في قائمة الإجابات، وتقديم أمثلة قليلة (few-shot).
قياس الثقة: تم قيء الثقة عبر التقييمات المصرح بها، واحتمالات الرموز (tokens)، وتكرار العينات عبر عمليات تشغيل متعددة.
3. إطار القرار
يتم صياغة المشكلة كقرار ذي ثلاثة إجراءات: العمل، استشارة المستشعر، أو سؤال الإنسان.
السياسة المثلى: يتم اشتقاق عتبة الاحتمالية p∗ للسؤال تحليلياً بناءً على دقة الوكيل المقاسة (p) والتكاليف المعلنة. الوكيل العقلاني يسأل إذا كان p<p∗.
التسجيل: يتم تسجيل النماذج مقابل "السياسة المرجعية" (أفضل سياسة ثابتة بالنظر إلى الدقة المقاسة) باستخدام "الندم" (التكلفة المحققة ناقص التكلفة المرجعية).
النتائج الرئيسية
1. نتائج تدقيق المستشعرات
فشل الكشف: قابل للتشخيص بدرجة عالية من الصور. حقق المصنف دقة 0.910، مجتازاً جميع فحوصات النقل والخلط.
فشل الإمساك: يمكن تشخيصه بشكل شبه مثالي من بيانات القوة (دقة 0.986) ولكن يكاد يكون مستحيلاً من الصور وحدها. استقرت المصنفات القائمة على الصور عند حوالي 0.55 (مستوى الصدفة لهذا الإعداد المحدد)، وفشلت في التمييز بين أسباب مثل الكتلة مقابل الاحتكاك والتي تكون غير مرئية للكاميرا حتى يحدث التلامس.
فشل الوضع: سجل مصنف 0.998 على الصور ولكنه انهار إلى 0.605 عند زوايا كاميرا محجوزة، مما كشف أنه تعلم موقع الحاوية في الإطار بدلاً من سبب الفشل. هذا يبرز ضرورة بروتوكول التدقيق.
2. سلوك النموذج والتشخيص
حساسية الأوامة (Prompt Sensitivity): تتبع سلوك النموذج تخطيط الأوامة بدلاً من الأدلة. نقل خيار "لا يمكن تحديده" إلى المقدمة أدى إلى انهيار معدلات الرفض من 78-100% إلى 0-6% في ثلاثة أزواج من عائلات النماذج. بدأ أحد النماذج (Qwen) في اختيار الخيار الثاني في القائمة بغض النظر عن المحتوى.
الدقة: تحت جميع متغيرات الأوامة، ظلت الدقة من الإطارات وحدها عند أو تحت مستوى خط الأساس للأغلبية. لم تحمل الثقة المصرح بها أي معلومات حول الصحة (الارتباط ρ≈0).
تأثير بيانات القوة: عند توفير بيانات القوة كنص، حققت أربعة من ستة نماذج دقة تشخيص فوق مستوى خط الأساس (0.45–0.54)، بينما فشلت باستخدام الإطارات وحدها. يشير هذا إلى أن الفشل كان غالباً نقصاً في بيانات المستشعر، وليس نقصاً في القدرة على الاستنتاج.
نماذج Cosmos: رفضت كلا نموذجي Cosmos باستمرار تشخيص حالات فشل الإمساك (رفض يقارب 100%) عبر جميع متغيرات الأوامة، رغم توفر بيانات القوة في ظروف أخرى.
3. أداء اتخاذ القرار
سلوك السؤال: لم تتبع النماذج السياسة المثلى. كانت معدلات السؤال لديها غير حساسة إلى حد كبير لتكلفة السؤال (Ca).
نموذج Qwen سأل بنسبة 100% بغض النظر عن التكلفة.
Pixtral وCosmos3-Nano سألا أيضاً في معظم الأوقات.
نموذج Llama قلل من السؤال، مما أدى إلى ندم عالٍ عندما كانت الأسئلة رخيصة.
قيمة السؤال: عندما سألت النماذج، رفعت إجابة الإنسان (الموثوقة بنسبة 80%) دقة المهمة النهائية إلى 0.70–0.81، وهو ما يطابق تقريباً موثوقية الإنسان. ومع ذلك، لأنها سألت دون تمييز، فقد تكبدت تكاليف غير ضرورية.
الثقة كإشارة: لم ترتبط الثقة بمعدلات الخطأ، مما يعني أنه لا يمكن استخدامها لتفعيل السؤال بشكل انتقائي.
المساهمات
قياسات المستشعرات المدققة: معيار مرجعي يحدد أنواع الفشل القابلة للتشخيص من كل مستشعر، بما في ذلك حالة خاصة (فشل الإمساك) حيث تكون بيانات القوة كافية (0.99) والصور غير كافية (<0.55).
دليل على تحيز الأوامة: إثبات أن سلوك التشخيص لنماذج الرؤية واللغة المفتوحة يتبع تخطيط الأوامة (ترتيب الخيارات) بدلاً من الأدلة، مع بقاء الدقة عند أو تحت مستويات خط الأساس للأغلبية عند الاعتماد فقط على الإطارات.
سياسة القرار المثلى: إطار لاتخاذ القرار بين العمل، والاستشعار، والسؤال بناءً على الدقة المقاسة والتكاليف الصريحة، مما يوفر سياسة مرجعية لتقييم النماذج الجاهزة.
قياس قيمة السؤال: كمي-تحديد يظهر أنه بينما يمكن لسؤال بشري واحد استعادة الموثوقية العالية (0.70–0.81)، تفشل النماذج الحالية في ضبط معدلات السؤال الخاصة بها بناءً على تكلفة المقاطعة.
الأهمية والادعاءات
تدعي الورقة أن قرار سؤال الإنسان يجب أن يكون "مرتبطاً بالدقة المقاسة والتكاليف المعلنة، وليس بثقة النموذج". وتجادل بأن النماذج الحالية تفتقر إلى الوعاء الذاتي لمعرفة متى تكون غير متأكدة. توضح الدراسة أن جزءاً كبيراً من عدم القدرة المتصورة على تشخيص الفشل هو في الواقع نقص في نمط المستشعر (بيانات القوة) وليس عجزاً في الاستنتاج. علاوة على ذلك، تؤسس الورقة أنه بدون تدريب صريح واعٍ للتكلفة أو فرض سياسة خارجية، ستسأل النماذج إما بشكل متكرر جداً (مما يهدر انتباه الإنسان) أو نادراً جداً (مما يتسبب في تكاليف إصلاح عالية)، مما يؤدي إلى الفشل في تحسين حلقة التفاعل بين الإنسان والروبوت. يخلص المؤلفون إلى أنه لكي يبدأ الروبوت الحوار بفعالية، يجب فصل منطق القرار عن ثقة النموذج الداخلية وجعله مرتكزاً على قدرات المستشعرات المقاسة تجريبياً وتكاليف المهام.