Self Supervised Learning from Automatically Generated Demonstrations for Visual Robotic Manipulation
تقدم هذه الورقة طريقة تلاعب بصري ذاتية الإشراف تستخدم عروضاً توضيحية مُولدة تلقائياً في المحاكاة لتدريب شبكة تلافيفية لتصحيح الوضع النسبي من صور RGB المثبتة على المعصم، مما يمكّن روبوت UR5e من تحقيق عمليات إمساك ناجحة مع تقليل جهد الإعداد وتحسين الدقة المستوية في كل من بيئات المحاكاة والواقع.
المؤلفون الأصليون:Andres Rivas, Anselmo R. Cukla, Rodrigo S. Guerra, Bruna V. Guterres, Ricardo B. Grando
تخيل أنك تحاول تعليم روبوت كيفية التقاط كوب قهوة. في الأيام الخوالي، كان على المهندسين كتابة آلاف الأسطر من البرمجيات، وقياس الشكل الدقيق للكوب، ومعايرة عيون الروبوت بدقة الليزر. كان الأمر يشبه محاولة تعليم شخص ركوب الدراجة من خلال إعطائه دليلاً عن ضغط الإطارات والديناميكا الهوائية بدلاً من مجرد تركه يركب ويتمايل. جعل هذا الروبوتات بارعة في وظائف المصانع ولكنها سيئة في التعامل مع عالم منازلنا الفوضوي وغير المتوقع.
مؤخراً، اكتشف العلماء طريقة أفضل: "التعلم من خلال التوضيح". فبدلاً من برمجة كل حركة، تترك إنساناً يوضح للروبوت كيفية القيام بذلك، ويتعلم الروبوت من خلال المشاهدة. ولكن هناك عقبة: إن جعل إنسان يوجه ذراع الروبوت جسدياً أو يتحكم به عبر عصا تحكم هو أمر بطيء، وممل، ويصعب توسيع نطاقه. ماذا لو استطاع الروبوت تعليم نفسه؟ ماذا لو استطاع فقط النظر إلى جسم ما، وتخمين مكان الإمساك به، وإدراك أنه أخطأ قليلاً، ثم التدرب على إصلاح أخطائه مراراً وتكراراً حتى يتقن الأمر؟ هذا هو أفق "التعلم الذاتي الموجه"، حيث يعمل الروبوت كطالب ومعلم في آن واحد، فينشئ مسائل التدريب الخاصة به دون الحاجة إلى إنسان يمسك بيده.
تقدم هذه الورقة البحثية طريقة ذكية حيث يقوم الروبوت بذلك تماماً. فقد بنى الباحثون نظاماً حيث يقوم روبوت مزود بكاميرا على معصمه بإنشاء "توضيحاته" الخاصة تلقائياً. فبدلاً من قيام إنسان بإظهار كيفية الإمساك بجسم ما، يبدأ الروبوت من نقطة عشوائية، وينظر إلى الجسم، ثم يتحرك إلى وضعية الإمساك المثالية. يسجل هذه الحركة كدرس: "عندما رأيت الجسم بهذا الشكل، كان عليّ التحرك بهذا الاتجاه للوصول إلى الهدف". ومن خلال تكرار ذلك آلاف المرات حول أجسام مختلفة، يبني الروبوت مكتبة ضخمة من دروس "الصورة-إلى-الحركة" دون تسمية بشرية واحدة أو معايرة كاميرا معقدة.
اختبر الفريق هذه الفكرة بطريقتين. أولاً، قاموا بتشغيلها في محاكاة لعبة فيديو متطورة تسمى Isaac Sim. لقد علموا الروبوت كيفية الاقتراب من جسم بشكل تقريبي ثم ضبط موضعه بدقة. كانت النتائج واعدة: أصبح تصويب الروبوت النهائي أكثر حدة بكثير. في المحاكاة، تقلص "انتشار" المكان الذي انتهى إليه الروبوت (مدى بعده عن النقطة المثالية) من 9.69 ملم إلى 5.38 ملم فقط بعد خطوة الضبط الدقيق. كان الأمر يشبه الانتقال من رمي سهم يهبط في الجوار العام إلى إصابة مركز الهدف تماماً.
بعد ذلك، نقلوا النظام إلى العالم الحقيقي باستخدام ذراع روبوت من نوع UR5e مجهز بقابض وكاميرا USB قياسية. لم يستخدموا أي مساطر خاصة أو أدلة ليزر لمعايرة الكاميرا؛ بل تعلم الروبوت ببساال من الصور التي التقطها. اختبروا النظام على ثلاثة أجسام فيزيائية مختلفة ذات أشكال وأنسجة متنوعة. حاول الروبوت الإمساك بها دون تدوير الجسم أولاً، ونجح بنسبة 66.6% لجسم واحد و63.6% لآخر. وعندما أضافوا لمسة تغيير — أي تدوير الأجسام حرفياً بحيث يتعين على الروبوت التعرف عليها من زاوية جديدة — انخفضت معدلات النجاح (إلى 36.4% و55.5% على التوالي)، ومع ذلك تمكن الروبوت من الإمساك بها في بعض الأحيان.
تشير الورقة البحثية إلى أنه بينما تعمل طريقة التعلم الذاتي هذه بشكل جيد للوصول إلى هدف قريب وتحسين التصويب على الأسطح المستوية، إلا أنها لا تزال تعاني قليلاً في تخمين مدى عمق الجسم (توقع العمق) وتصاب بالارتباك عندما تُدار الأجسام بطرق غريبة. ومع ذلك، فإن الفكرة الجوهرية تظل قائمة: يمكن للروبات بالفعل إنشاء بيانات التدريب الخاصة بها لتعلم المعالجة البصرية، متجاوزة الحاجة إلى معلمين بشريين مكلفين أو تجهيزات مختبرية مثالية. إنها خطوة نحو روبوتات يمكنها ببساطة النظر إلى طاولة مزدحمة، وفهم كيفية الإمساك بكوب، والتعلم من أخطائها، وكل ذلك دون الحاجة إلى إنسان يكتب لها القواعد.
ملخص تقني: التعلم الخاضع للإشراف الذاتي من خلال العروض التوضيحية المولدة تلقائياً للمناولة الروبوتية البصرية
بيان المشكلة لا تزال المناولة الروبوتية في البيئات غير المهيكلة أو الديناميكية تشكل تحدياً بسبب الاعتماد على البرمجة الخاصة بكل كائن، والتعليق اليدوي للبيانات، وخطوط معالجة الإدراك المعايرة. وبينما يوفر "التعلم من العروض التوضيحية" (LfD) بديلاً مباشماً، إلا أن الأساليب التقليدية غالباً ما تعتمد على التحكم عن بُعد من قبل البشر أو التعليم الحركي (kinesthetic teaching) الذي يستغرق وقتاً طويلاً. علاوة على ذلك، تتطلب العديد من أنظمة المناولة البصرية الحالية معايرة صريحة للمعالم الخارجية بين الكاميرا والروبوت، مما يعقد عملية النشر. تعالج الورقة البحثية الحاجة إلى طريقة تؤتمت جمع العروض التوضيحية، وتلغي التسمية اليدوية، وتعمل دون معايرة صريحة مع الحفاظ على المتانة في الإعدادات الواقعية.
المنهجية الإطار المقترح هو خط معالجة خاضع للإشراف الذاتي مبني على ROS 2 وتم التحقق من صحته في كل من Isaac Sim وعلى روبوت تعاوني من طراز UR5e حقيقي. يتضمن النهج الجوهري قيام الروبوت تلقائياً بتوليد عروض توضيحية حول وضعية مستهدفة (P0) لتعلم تصحيحات الوضعية النسبية مباشرة من صور RGB أحادية العين مثبتة على المعصم.
توليد البيانات تلقائياً: بدلاً من التحكم عن بُعد بواسطة البشر، يقوم عقدة "قائد الروبوت" (Robot Commander) بتحريك الروبوت عبر مسارات محددة مسبقاً حول وضعية مرجعية. لكل صورة RGB يتم التقاطها، يحسب النظام التحويل النسبي المطلوب للعودة إلى الوضعية المستهدفة (P0) باستخدام tf2. هذا ينشئ أزواج (صورة-وضعية) مصنفة دون تسمية يدوية أو معايرة صريحة للكاميرا.
تعقيد مجموعة البيانات: تم إنشاء مجموعات بيانات منفصلة لثلاثة أجسام فيزيائية ذات هندسات متغيرة. استخدم جمع البيانات أربع عائلات من المسارات لزيادة الصعوبة تدريجياً:
2-DOF (مستوٍ): حركة متعرجة (Zig-zag) على المستوى س-ص (x-y).
3-DOF (مستوٍ + دوران): حركة مستوية مع دوران داخل المستوى.
3-DOF (مخروطي): إزاحة رأسية مدمجة مع مواضع مستوية للتقرب الأولي.
4-DOF (مخروطي + دوران): إزاحة رأسية مع دوران داخل المستوى.
تعلم السياسة البصرية: يتم تدريب شبكة عصبية تلافيفية (تتبع بنية Johns [1]) لاسترجاع تصحيحات الوضعية النسبية (3 قيم ترجمة و4 مكونات للـ quaternion) من ملاحظات RGB أحادية الإطار. تجمع دالة الخسارة بين متوسط مربع الخطأ (MSE) للترجمة والدوران، مع وزن يعطي الأولوية لدقة الترجمة (L=MSEtrans+0.01⋅MSErot).
استراتيجية التحكم من الخشن إلى الناعم: أثناء التنفيذ، يستخدم النظام متحكماً ذا مرحلتين:
التقرب الخشن (Coarse Approach): يستخدم نموذجاً تم تدريبه على البيانات المخروطية (3D) للاقتراب من الكائن من ارتفاعات مختلفة.
التنقيح المستوي (Planar Refinement): يستخدم نموذجاً تم تدريبه على البيانات المستوية لضبط المحاذاة النهائية على المستوى س-ص (x-y).
المساهمات الرئيسية تحدد الورقة أربع مساهمات رئيسية:
جمع البيانات ذاتي الإشراف: طريقة حيث يقوم الروبوت تلقائياً بتوليد أزواج (صورة-وضعية) تشبه العروض التوضيحية دون تسمية يدوية أو تدخل بشري.
سياسة بصرية خالية من المعايرة: نموذج تعلم يتنبأ بتصحيحات الوضعية النسبية من ملاحظات RGB أحادية العين دون الحاجة إلى معايرة صريحة للمعالم الخارجية بين الكاميرا والروبوت.
التحكم من الخشن إلى الناعم: استراتيجية تفصل بين التقرب ثلاثي الأبعاد (3D) والتنقيح المستوي، مما يحسن المحاذاة النهائية في التنفيذ مغلق الحلقة.
التحقق في العالم الحقيقي: تقييم شامل على روبوت UR5e مزود بقابض وكاميرا أحادية العين، يظهر الأداء عبر أجسام فيزيائية متعددة ذات مظاهر متغيرة.
النتائج تم تقييم الإطار في المحاكاة وعلى أجهزة حقيقية باستخدام ثلاثة أجسام متميزة.
المحاكاة: نجحت استراتيجية "من الخشن إلى الناعم" في تقليل التشتت المستوي النهائي. انخفض نصف قطر الدائرة المحيطة بالموضع النهائي من 9.69 مم (بعد المرحلة الخشنة) إلى 5.38 مم (بعد مرحلة التنقيح). ومع ذلك، ظل التنبؤ بالعمق يمثل تحدياً، حيث انخفض نصف قطر الكرة ثلاثية الأبعاد فقط من 33.39 مم إلى 31.55 مم، وأظهرت بعض المسارات عدم استقرار في تقدير الارتفاع.
تجارب العالم الحقيقي: قام النظام بمحاولات إمساك كاملة (end-to-end). تباينت معدلات النجاح حسب الكائن والظروف:
بدون دوران الكائن: حقق الكائن 1 نسبة نجاح 66.6% والكائن 2 نسبة 63.6%. حقق الكائن 3 نسبة أقل بلغت 35.2%.
مع دوران الكائن: انخفض الأداء بشكل عام. انخفض الكائن 1 إلى 36.4%، وحافظ الكائن 2 على أعلى معدل بنسبة 55.5%، بينما انخفض الكائن 3 إلى 25.0%.
تشير النتائج إلى أنه بينما النظام متين تجاه بعض الاختلافات، إلا أن الأداء يعتمد على الكائن ويتدهور عندما ينحرف اتجاه الكائن بشكل كبير عن توزيع التدريب.
الأهمية والادعاءات يزعم المؤلفون أن العروض التوضيحية المولدة تلقائياً يمكن أن تدعم المناولة البصرية العملية بجهد إعداد محدود، مما يزيل فعلياً الحاجة إلى التسمية اليدوية والمعايرة الصريحة. توضح هذه الدراسة أن توليد العروض التوضيحية ذاتي الإشراف يمكن توسيعه من الإعدادات المحاكية أو منخفضة الأبعاد إلى المناولة البصرية في العالم الحقيقي مع التحقق من الإمساك مغلق الحلقة.
ومع ذلك، تحافظ الورقة على نبرة متواضعة فيما يتعلق بحدودها؛ فهي تقر بأن الطريقة لا تزال حساسة للتنبؤ بالعمق، وهندسة الكائنات، ودوران الكائن. ويخلص المؤلفون إلى أنه بينما يعد النهج قابلاً للتطبيق للمناولة العملية، يجب أن تعالج الأعمال المستقبلية تحديات تقدير العمق (ربما عبر مستشعرات RGB-D أو الاستشعار الستيريوسكوبي) وتحسين التعميم عبر اتجاهات الكائنات المختلفة. لا تدعي الورقة حل جميع مشكلات التعميم، بل تقدم خط معالجة وظيفياً يقلل من الجهد الهندسي في إعداد مهام المناولة البصرية.