MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation
تقدم هذه الورقة ManiGuard، وهو معيار ومجموعة بيانات شاملة تعمل على تقييم وتحسين سلامة سياسات التلاعب الروبوتي بصرامة من خلال فصل مواصفات السلامة عن نجاح المهمة، باستخدام المراقبة الرسمية أثناء التشغيل للكشف عن أنه بينما يعزز الضبط الدقيق السلامة، إلا أن فجوات كبيرة لا تزال قائمة حتى مع زيادة البيانات وتحولات التوزيع.
المؤلفون الأصليون:Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xinyu Cao, Huajie Shao, Manling Li, Ruohan Zhang, Qi Zhu
تتعلم الروبوتات كيفية القيام بأعمالنا المنزلية، منتقلةً من الحركات البسيطة والمتكررة إلى مهام معقدة مثل تنظيف الطاولة أو تنظيم المطبخ. ويعتمد هذا التقدم على "نماذج التأسيس"، وهي نوع من الذكاء الاصطناعي الذي يتعلم من كميات هائلة من البيانات لفهم اللغة والرؤية والحركة في آن واحد. وتتحسن هذه الأنظمة في إنجاز المهام، ولكن يظل هناك سؤال جوهري: هل يمكنها القيام بذلك دون التسبب في ضرر؟ ففي العالم الحقيقي، قد يؤدي الروبوت الذي ينجح في وضع كوب في الخزانة أيضاً إلى إسقاط مزهرية، أو سكب مشروب، أو كسر شيء هش أثناء وصوله إلى هدفه. ولكي تنتقل الروبوتات من مختبرات الأبحاث إلى منازلنا، نحتاج إلى معرفة ليس فقط ما إذا كانت ستنجح، بل ما إذا كانت ستنجح بأمان. وهذا يتطلب وسيلة لقياس السلامة تكون بدقة مقياس النجاح، عبر فحص كل حركة مقابل مجموعة واضحة من القواعد بدلاً من مجرد النظر إلى النتيجة النهائية.
لقد قدم فريق من الباحثين إطار عمل جديداً يسمى "ManiGuard" للإجابة على هذا السؤال. فقد بنوا بيئة اختبار صارمة تتعامل مع السلامة كهدف منفصل وغير قابل للتفاوض، وبشكل مستقل عن ما إذا كان الروبوت سينهي المهمة أم لا. وبدلاً من الاعتماد على مراقبين بشريين لتخمين ما إذا كان الروبوت آمناً، أو على أحكام ذكاء اصطناعي قد تكون متحيزة، استخدم الباحثون نظاماً رياضياً رسمياً لتحديد قواعد السلامة. لقد ترجموا هذه القواعد إلى مجموعة من القيود المنطقية، مثل "يجب أن تظل الجرة مغلقة حتى يتم رفعها" أو "لا تلمس الطعام أثناء تنظيف القدر". وبينما يتحرك الروبوت في محاكاة عالية الدقة، يقوم مراقب رقمي بفحص كل خطوة مقابل هذه القواعد في الوقت الفعلي. فإذا اصطدم الروبوت بشيء لا ينبغي لمسه أو أسقط جسماً ما، فإن النظام يحدد المخالفة فوراً، بغض النظر عما إذا كان الروبوت قد أتم مهمته الرئيسية في النهاية.
نظم الباحثون مائتي مهمة منزلية مختلفة في ست فئات، تتراوح من إجراءات الالتقاط والوضع البسيطة إلى المهام المعقدة متعددة الخطوات التي تتضمن الأدراج والأطباق المتراكمة. ولكل مهمة، أنشأوا قاعدة سلامة محددة تكون متعامدة مع الهدف، مما يعني أنه يمكن للروبوت تقنياً إنهاء المهمة مع الاستمرار في كسر قاعدة السلامة. ثم اختبروا عدة سياسات ذكاء اصطناعي متقدمة في هذه المهام، أولاً دون أي تدريب خاص، ثم بعد تدريبها على مجموعة بيانات جديدة. كانت مجموعة البيانات هذه فريدة من نوعها لأنها بُنيت باستخدام نفس مراقب السلامة؛ حيث جمع الباحثون آلاف العروض التوضيحية حيث أكملت الروبوتات المهام بنجاح دون انتهاك قاعدة السلامة أبداً، مما خلق مكتبة من السلوك "الآمن" ليتعلم منها الذكاء الاصطناعي.
كشفت النتائج عن واقع صارخ حول الذكاء الروبوتي الحالي. فعند اختبارها بدون تدريب، نادراً ما انخرطت الروبوتات في المهام، حيث كانت غالباً ما تختار عدم فعل شيء بدلاً من المخاطرة بارتكاب خطأ. وعندما كانت تتحرك، كانت غير آمنة في كثير من الأحيان. وحتى بعد التدريب على العروض التوضيحية الآمنة، تحسنت الروبوتات بشكل ملحوظ، لكن فجوة كبيرة ظلت قائمة. ووجد الباحثون أن ما بين 6% و21% من المهام الناجحة كانت في الواقع غير آمنة؛ أي أن الروبوتات وصلت إلى أهدافها ولكنها انتهكت قواعد السلامة في الطريق. علاوة على ذلك، يمكن لروبوتين بمتوسط نجاح متطابق تقريباً أن يكون لهما سجلات سلامة متفاوتة تماماً، مما يثبت أن إنهاء المهمة لا يضمن القيام بها بأمان.
ساعد تدريب الروبوتات على البيانات الجديدة الملحقة بعلامات السلامة في تحسين النتائج، حيث ارتفع معدل إكمال المهام بأمان من ما يقرب من الصفر إلى ما بين 7% و30%. ومع ذلك، اكتشف الباحثون أن مجرد إضافة المزيد من العروض التوضيحية الآمنة نفسها لم يحل المشكلة. فعندما واجهت الروبوتات تغييرات طفيفة في البيئة، مثل خلفية مختلفة أو جسم تم تحريكه، انخفض أداؤها من حيث السلامة. وظلت بعض المهام، خاصة تلك التي تتضمن الأدراج أو التراكم الدقيق، صعبة للغاية، حيث ظل معدل النجاح الآمن أقل من 2% لكل السياسات المختبرة. كما أظهرت الدراسة أنه بينما تنبأت نتائج المحاكاة بشكل عام بالروبوتات الأكثر أماناً، فإن وتيرة الحوادث الدقيقة لم تتطابق دائماً مع ما حدث في الروبوت الفيزيائي، مما يشير إلى أن المحاكة هي دليل مفيد ولكنها ليست بلورة سحرية مثالية.
في نهاية المطاف، يوضح هذا العمل أن السلامة تحدٍ متميز لا يمكن حله بمجرد جعل الروبوتات أفضل في إنهاء المهام. فقد أظهر الباحثون أن نماذج الذكاء الاصطناعي الحالية لا تفهم تماماً القيود الفيزيائية للعالم أو قواعد السلامة المحددة المعطاة لها. وبينما يساعد الضبط الدقيق باستخدام بيانات مختارة بعناية، إلا أنه ليس حلاً سحرياً. إن الإخفاقات المستمرة، حتى بعد التدريب، تشير إلى أن التقدم المستقبلي سيتطلب طرقاً جديدة لتعليم الروبوتات ليس فقط ما يجب فعله، بل كيفية القيام به دون كسر قواعد العالم المادي. يوفر إطار عمل "ManiGuard" الأدوات لقياس هذا التقدم بصرامة، مما يوفر مساراً واضحاً لتطوير روبوتات ليست قادرة فحسب، بل آمنة حقاً.
ملخص تقني: ManiGuard
بيان المشكلة
أظهرت سياسات النماذج التأسيسية للمناولة الروبوتية تقدماً سريعاً في نجاح المهام والتعميم عبر مشاهد وهياكل متنوعة. ومع ذلك، لا يزال التقييم الصارم لما إذا كانت هذه الأنظمة تنجح "بأمان" يفتقر إلى الكفاية. تقيس المعايير الحالية بشكل أساسกับ إتمام المهمة أو تعتمد على مصنفات متعلمة ونماذج لغوية كبيرة (LLMs) للحكم على السلامة، والتي غالباً ما تفشل في رصد المخاطر الفيزيائية المرتبطة بالتلامس والمسارات. علاوة على ذلك، غالباً ما تخلط تقييمات السلامة الحالية بين نجاح المهمة والسلامة، مما يفشل في الإدراك بأن السياسة يمكن أن تنجز مهمة مع انتهاك قيود السلامة (مثل السكب، أو الانقلاب، أو الاصطدام) أو تبدو آمنة بمجرد بقائها خاملة. تجادل الورقة بأن إخفاقات السلامة الفيزيائية في السيناريوهات العادية ذات العالم المفتوح تتطلب تقييماً قائماً على الفيزياء وموجهاً بالمواصفات، ويكون مستقلاً عن نجاح المهمة.
المنهجية
يقدم المؤلفون ManiGuard، وهو إطار عمل قائم على المواصفات يتكون من مجموعة اختبار (ManiGuard-Bench) ومسار لتوليد البيانات المقترنة.
1. ManiGuard-Bench
تصميم المهام: ينظم معيار الاختبار 200 مهمة أساسية مغلقة ضمن ست عائلات من مهام المناولة المنزلية الغنية بالتلامس (الفوضى Clutter، الخزانة Cabinet، الغطاء Lid، التكديس Stack، الجرة Jar، الغبار Dusty). وهي مهيكلة وفق تصنيف (المهارة × القيد)، حيث تجمع بين ثلاثة مستويات من المهارة (الالتقاط والوضع، التفاعل مع الأجسام المفصلية، والمهام طويلة الأمد) مع فئتين من القيود الرسمية (الثوابت المكانية والترتيب الزمني).
استقلالية السلامة: يتم تحديد السلامة بشكل مستقل عن نجاح المهمة. يمكن للسياسة أن تنجح بشكل غير آمن، أو تفشل بشكل آمن، أو تحقق كليهما.
المواصفات الرسمية: تُعرف متطلبات السلامة كصيغ المنطق الزمني الخطي على المسارات المحدودة (LTLf) فوق محمولات (predicates) قائمة على الفيزياء (مثل dropped (سقط)، spilled (انسكب)، intact (سليم)، upright (منتصب)). ويتم تجميع هذه الصيغ في آلات حالات محددة (DFA) تعمل كمراقبين في وقت التشغيل.
بروتوكول التقييم:
المراقبة في وقت التشغيل: بدلاً من الحكام المتعلمين، تقوم مراقبات الـ DFA باستهلاك حالات المحاكي خطوة بخطوة لإصدار تسميات سلامة فئوية (آمن/انتهاك).
انزياحات التوزيع: يتم تقييم كل مهمة أساسية تحت حالة واحدة داخل التوزيع (ID) وأربعة انزياحات أحادية المحور خارج التوزيع (OOD): مظهر الهدف، اللغة التعليمية، موقع الكائن، وخلفية البيئة. تظل مواصفة السلامة ϕ ثابتة عبر جميع الانزياحات.
المقاييس: يحدد الإطار أربع فئات للنتائج: النجاح الآمن (SSR)، النجاح غير الآمن، الفشل الآمن، والفشل غير الآمن. كما يقدم مقاييس واعية بالارتباط (Engagement-Aware) (مثل Safe | Eng.) للتمييز بين السياسات التي هي آمنة لأنها تعمل بأمان مقابل تلك التي هي آمنة لأنها لم تتفاعل مع المهمة أبداً.
من المحاكاة إلى الواقع (Sim-to-Real): يتم إجراء التقييم في Isaac Sim/OmniGibson مع استخدام PhysX لديناميكيات التلامس والسوائل، ويتم التحقق منه على منصة Franka Panda فيزيائية تحت ظروف مطابقة.
مصادر مزدوجة: يتم توليد المسارات عبر مخطط حركة آلي cuRobo وعبر التحكم عن بعد بواسطة البشر (باستخدام أذرع التحكم GELLO أو SO-101).
الوسم الموحد: يتشارك كلا المصدرين نفس بيئة التنفيذ ويتم تصفيتها وتوسيمها بواسطة نفس مراقب وقت التشغيل LTLf المستخدم في التقييم.
المخرج: يتم الاحتفاظ فقط بالمسارات التي تنجز المهمة وتلبي مواصفة السلامة. ينتج عن ذلك 8,000 عرض توضيحي موسوم بالسلامة (40 لكل مهمة أساسية) بتنسيق LeRobot الأصلي المشترك.
المساهمات الرئيسية
ManiGuard-Bench: معيار يركز على السلامة يحتوي على 200 مهمة منظمة بتصنيف (المهارة × القيد)، ويتميز بمواصفات LTLf يتم التحقق منها بواسطة مراقبات تشغيل قائمة على الآلات (automaton). يتضمن 1,000 سيناريو تقييم مغلق (ID + 4 محاور OOD) ويمتد إلى تقييم الروبوت الفيزيائي.
مجموعة بيانات موسومة بالسلامة: مسار لتوليد العروض التوضيحية ينتج 8,000 عرض توضيحي حيث تضمن السلامة من خلال البناء باستخدام نفس المراقب المستخدم للتقييم. وهذا يتيح الضبط الدقيق تحت الإشراف (SFT) لسلوك واعٍ بالسلامة.
التقييم المنهجي لأنماط الفشل: دراسة معيارية واسعة النطاق (أكثر من 23,000 عملية تشغيل) لنماذج الرؤية-اللغة-الأفعال (VLA) (صفرية التقدير والمضبوطة بدقة)، والتي حددت أنماط فشل متسقة ومحدودية مناهج التوسع الحالية.
السلامة مقابل النجاح: نجاح المهمة لا يعني بالضرورة السلامة. بين 6-21% من عمليات التشغيل الناجحة للسياسات المضبوطة دقةً انتهكت مواصفات السلامة. وعلى العكس من ذلك، بدت السياسات صفرية التقدير "آمنة" (بمعدل سلامة 77-83%) نتيجة لـ السلامة الفارغة (vacuous safety) (أي عدم التفاعل مع المهمة)، بينما كانت معدلات "التفاعل-والسلامة" الفعلية منخفضة بنسبة 16%.
تأثير الضبط الدقيق: أدى الضبط الدقيق على مجموعة البيانات الموسومة بالسلامة إلى تحسين السلامة بشكل كبير. ارتفع إتمام المهمة الآمن (SSR) من قرب الصفر إلى 7.5-29.8%، وزاد السلوك "المتفاعل-والآمن" من 16-40% إلى 51-72%.
الفجوات المستمرة: رغم الضبط الدقيق، لا تزال هناك فجوة سلامة كبيرة:
21-42% من عمليات التشغيل المتفاعلة لا تزال تنتهك المواصفات.
ظلت عائلتان من المهام (الخزانة والغبار) دون نسبة 2% لنجاح آمن لجميع السياسات.
تدهورت أداء السلامة تحت انزياحات التوزيع أحادية المحور (مثل تغيير مظهر الكائن أو اللغة)، حتى عندما كانت مواصفة السلامة ϕ ثابتة.
مجرد زيادة عدد العروض التوضيحية (من 8 إلى 40) لم يغلق الفجوة للمهام الصعبة الغنية بالتلامس (مثل الخزانة)، مما يشير إلى الحاجة لأنواع مختلفة من البيانات وليس مجرد المزيد منها.
من المحاكاة إلى الواقع (Sim-to-Real): أظهرت النتائج المحاكية والفيزيائية ارتباطاً قوياً في ترتيب نجاح المهمة والنجاح الآمن (r≈0.88–0.91)، ولكن ارتباطاً ضعيفاً في معدلات الانتهاك (r≈0.09). ومع ذلك، لوحظت سلوكيات غير آمنة محددة (مثل قلب الأشياء) في كلا المجالين.
الأهمية والادعاءات
تدعي الورقة أن ManiGuard يوفر واجهة صارمة وموجهة بالمواصفات لتقييم وتحسين سلامة الروبوتات. تكمن أهميتها الأساسية في:
فك الارتباط بين السلامة والنجاح: إثبات أن السلامة يجب أن تُقيم كهدف من الدرجة الأولى مستقل عن إتمام المهمة.
التشخيصات القابلة للتنفيذ: يسمح استخدام مراقبات الآلات (automaton monitors) بالإبلاغ عن الانتهاكات لكل خطوة ولكل قيد، مما يجعل إخفاقات السلامة قابلة للتشخيص من أجل جمع البيانات والتدريب بدلاً من مجرد مقاييس إجمالية.
محدودية التوسع الحالي: تشير النتائج إلى أن النماذج التأسيسية الحالية لا تزال غير قادرة على ربط سلوكها بقوة بمواصفات السلامة أو التكوينات الفيزيائية. إن توسيع نطاق نفس نوع العروض التوضيحية لا يحل تلقائياً فجوات السلامة في المهام الغنية بالتلامس وطويلة الأمد.
أساس للعمل المستقبلي: من خلال إصدار المعيار، ومكتبة المواصفات، ومسار توليد المسارات، يهدف المؤلفون إلى دعم الأبحاث المستقبلية في جمع البيانات الواعية بالمواصفات، والتعلم الواعي بالقيود، والتقييم الأكثر شمولاً للسلامة.
يحافظ المؤلفون على نبرة متواضعة فيما يتعلق بالنشر في العالم الحقيقي، مشيرين إلى أن تقييمهم الفيزيائي هو دراسة أولية للنقل من المحاكاة إلى الواقع مع مطابقة تقريبية للمشاهد، وأن التصنيف الحالي لا يشمل جميع مهام المناولة أو المخاطر الممكنة.