VISOR: A Vision-Language Model-based Test Oracle for Testing Robots
تقدم هذه الورقة VISOR، وهو نموذج اختبار قائم على نماذج الرؤية واللغة (Vision-Language Model) يعمل على أتمتة تقييم صحة وجودة مهام الروبوت مع قياس عدم اليقين، مما يوضح أنه في حين تقدم نماذج مثل Gemini وGPT نقاط قوة أداء متكاملة، فإن تقديرات عدم اليقين الخاصة بها تفشل حاليًا في التنبؤ بشكل موثوق بصحة التقييم.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك أسطولاً من الأذرع الروبوتية في مصنع، ومهمتك هي التأكد من أنها تؤدي وظائفها بشكل صحيح. في الأيام الخوالي، كان التحقق مما إذا كان الروبوت قد أدى عملاً جيداً يشبه وجود حكم بشري يجلس أمام شاشة، يشاهد كل فيديو للروبوت وهو يعمل. إذا أسقط الروبوت كوباً أو أخطأ الهدف، كان على الإنسان أن يقول: "فشل". وإذا نجح، يقول: "نجاح".
كان هذا الأمر بطيئاً ومكلفاً، كما أن البشر يصابون بالتعب أو الملل، مما يؤدي إلى أحكام غير متسقة. فأحياناً يرى شخص ما أن المهمة "جيدة"، بينما يراها آخر "مقبولة". وهذا ما يُعرف في عالم التكنولوجيا بـ "مشكلة أوراكل الاختبار" (test oracle problem) — أي معرفة من أو ما الذي يقرر ما إذا كان البرنامج (أو الروبوت) قد اجتاز الاختبار.
حاول مؤلفو هذه الورقة البحثية، VISOR، حل هذه المشكلة عبر توظيف نوع جديد من القضاة: ذكاء اصطناعي يمكنه الرؤية والقراءة.
القاضي الجديد: نموذج "الرؤية واللغة"
فكر في نماذج الذكاء الاصطناعي هذه (مثل GPT وGemini) كطلاب أذكياء جداً قرأوا ملايين الكتب وشاهدوا ملايين الفيديوهات. يمكنهم النظر إلى فيديو لذراع روبوتية وهي تلتقط برتقالة وفهم ليس فقط ما يحدث، بل مدى جودة ما يحدث.
بدلاً من أن يشاهد الإنسان الفيديو، يتم تغذية الذكاء الاصطناعي بالفيديو ويسأله سؤالين:
- هل نجح العمل؟ (نجاح أم فشل؟)
- ما مدى جودة العمل؟ (جودة عالية، متوسطة، أم منخفضة؟)
بعد ذلك، يخرج الذكاء الاصطناعي رمز JSON (تنسيق حاسوبي بسيط) يقول "نجاح" أو "فشل"، أو يقيم الجودة.
التجربة: ماراثون سينمائي ضخم
لمعرفة ما إذا كان هذا القاضي الآلي جيداً، وضع الباحثون اختباراً ضخماً. استخدموا محاكياً (عالم روبوتات افتراضي) لإنشاء أكثر من 1,000 فيديو لروبوتات تقوم بأربع مهام مختلفة، مثل التقاط الأشياء، أو وضعها في سلة، أو تحريكها بالقرب من هدف ما.
استخدموا اثنين من "قضاة الذكاء الاصطناعي":
- Gemini: بطل "الاستدعاء" (Recall). هذا القاضي حريص جداً على رصد الأخطاء. نادراً ما يفوت حالة فشل، لكنه أحياناً يصرخ "ذئب!" عندما يكون الروبوت قد قام بعمل جيد بالفعل (إنذارات كاذبة).
- GPT: بطل "الدقة" (Precision). هذا القاضي صارم للغاية. إذا قال "نجاح"، يمكنك المراهنة على أنه نجاح بالفعل. لكنه أحياناً يغفل عن بعض حالات الفشل الطفيفة، معتقداً أن المهمة تمت بشكل صحيح رغم عدم دقتها تماماً.
النتيجة: لم يكن أي من القاضيين مثالياً بمفرده. Gemini رصد المزيد من الأخطاء ولكن كان لديه المزيد من الإنذارات الكاذبة. أما GPT فكان دقيقاً جداً عندما يتحدث، لكنه فاتته بعض الأخطاء. تشير الورقة إلى أنه إذا استخدمت كلاهما معاً (مثل لجنة من القضاة يصوتون)، فقد تحصل على أفضل ما في العالمين.
فخ "الثقة"
إليك المفاجأة: سأل الباحثون الذكاء الاصطناعي أيضاً: "ما مدى تأكدك؟" وقاسوا "عدم اليقين" (uncertainty) لدى الذكاء الاصطناعي (مدى تذبذب ثقته).
توقعوا أنه عندما يخطئ الذكاء الاصطناعي، فسيشعر بـ "عدم اليقين" أو "الارتباك". وكانوا يأملون أن يقول: "أنا لست متأكداً بنسبة 100% أن هذا الروبوت فشل"، مما يعطيهم إشارة بأن الإجابة قد تكون خاطئة.
لكن هذا لم يحدث.
لقد كان الذكاء الاصطناعي مفرط الثقة. حتى عندما ارتكب خطأً، كان متأكداً بنسبة 99% من صحة إجابته. كان الأمر أشبه بطالب يخطئ في سؤال الاختبار ولكنه يرفع يده بكل ثقة، مصراً على أنه على صواب. وجدت الورقة أن "درجة الثقة" لدى الذكاء الاصطناعي كانت مؤشراً سيئاً لمعرفة ما إذا كان محقاً أم مخطئاً. لا يمكنك الوثوق بالذكاء الاصطناعي لمجرد أنه يقول: "أنا متأكد!".
الخلاصة
- ما ينجح: استخدام الذكاء الاصطناعي لمراقبة فيديوهات الروبوت هو طريقة سريعة وقابلة للتوسع للتحقق مما إذا كانت الروبوتات تؤدي وظائفها. وهو أرخص بكثير من توظيف إنسان لمشاهدة كل فيديو.
- ما لا ينجح: لا يمكنك الاعتماد على "ثقة" الذكاء الاصطناعي لتعرف ما إذا كان يرتكب خطأً. فهو غالباً ما يشعر بثقة شديدة حتى عندما يكون مخطئاً.
- العقبة: أُجري هذا الاختبار في محاكاة (عالم ألعاب فيديو)، وليس مع روبوتات حقيقية مادية. يحذر المؤلفون من أن الروبوتات في العالم الحقيقي قد تواجه كاميرات غير واضحة أو فيديوهات مشوشة قد تربك الذكاء الاصطناعي أكثر مما فعلت فيديوهات المحاكاة النظيفة.
باختة، يعد VISOR أداة واعدة يمكن أن تعمل كمشرف آلي لا يكل للروبوتات، ولكن يجب استخدامه بحذر. إنه بارع في رصد الصورة الكبيرة، لكن يمكن أن يكون واثقاً بعناد حتى عندما يكون مخطئاً، لذا لا يزال يتعين على البشر مراقبة الصورة الكبيرة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.