A Sim-to-Real Integration Pipeline for Training and Deployment of Chunk-Based VLA Manipulation Policies
تقدم هذه الورقة مساراً مفتوح المصدر للانتقال من المحاكاة إلى الواقع يعالج عقبة ندرة البيانات في تدريب سياسات المناولة القائمة على الرؤية واللغة والأفعال (VLA) بنظام الكتل، وذلك عبر إعادة تشغيل مسارات الخبراء من المحاكاة على أجهزة حقيقية لتوليد مجموعات بيانات مقترنة، مما يتيح تدريباً وتقييماً فعالين للسياسة وقياساً مباشراً للفجوة بين المحاكاة والواقع.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لطالما كانت الروبوتات بارعة في التكرار، حيث كانت قادرة على أداء نفس الحركة الدقيقة آلاف المرات في المصنع. لكن تعليمها فهم العالم الفوضوي وغير المتوقع للمنزل البشري أثبت صعوبته. يتجه مجال الروبوتات الحديثة بشكل متزايد نحو نهج جديد حيث تتعلم الآلات من خلال المشاهدة والاستماع، وتجمع بين ما تراه وما تُؤمر بفعله. هذه الطريقة، المعروفة باسم (الرؤية-اللغة-الفعل)، تسمح للروبوت بأخذ مشهد بصري وتعليمة منطوقة، مثل "حرك الكتلة الحمراء"، وترجمتها مباشرة إلى حركة فيزيائية. ويكمن التحدي في جمع أمثلة كافية لتعليم الروبوت. عادةً، يتطلب هذا من الإنسان توجيه ذراع الروبوت فعلياً عبر كل مهمة، وهي عملية بطيئة ومكلفة ويصعب توسيع نطاقها. علاوة على ذلك، عندما يحاول الباحثون تدريب الروبوتات في محاكاة حاسوبية ثم نقلها إلى العالم الحقيقي، غالباً ما تفشل النتائج لأن العالم الرقمي مثالي للغاية. نادراً ما يتم قياس الفجوة بين المحاكاة والواقع بدقة، مما يترك العلماء غير متأكدين مما إذا كان الفشل ناتجاً عن "دماغ" روبوت سيء أو ببساطة لأن الطاولة الحقيقية كانت زلقة للغاية.
قام فريق من الباحثين في معهد الأنظمة الذكية والروبوتات في باريس بتطوير طريقة جديدة لسد هذه الفجوة. فبدلاً من الاعتماد على المعلمين البشر أو عمليات المحاكاة غير المختبرة، أنشأوا نظاماً يستخدم خبيراً مولداً بالحاسوب لتعليم روبوت حقيقي. في إعدادهم، يقوم ذراع روبوت افتراضي في محاكاة بالتخطيط لمسار مثالي لدفع مكعب. يتم بعد ذلك إرسال هذه الخطة الرقمية إلى ذراع روبوت حقيقي من طراز (Franka FR3) في مختبر. يحاول الروبوت الحقيقي اتباع الخطة الرقمية بدقة، دون أي توجيه بشري أو تصحيحات في الوقت الفعلي. وبينما يتحرك، يسجل الفريق ما يراه ويشعر به الروبوت الحقيقي، مما يخلق مجموعة بيانات يكون فيها "الجواب الصحيح" مستمداً من المحاكاة، ولكن "الخبرة" مستمدة من العالم الحقيقي. وهذا يسمح لهم بتدريب سياسات روبوتية جديدة باستخدام بيانات من العالم الحقيقي دون تكلفة التحكم عن بُعد بواسطة البشر. والأهم من ذلك، ولأنهم يعرفون المسار الدقيق الذي كان من المفترض أن يتخذه الروبوت، يمكنهم قياس الفرق بين الخطة والواقع بدقة عالية.
اختبر الباحثون هذه الطريقة بجعل الروبوت الحقيقي يعيد تشغيل 200 مسار محاكى مختلف، يتضمن كل منها دفع مكعب إما إلى اليسار أو اليمين. ووجدوا أن الروبوت الحقيقي اتبع الخطة الرقمية بدقة ملحوحة. وفي المتوسط، انحرف المسار الذي اتخذه الذراع الحقيقي عن المسار المقصود بأقل من سنتيمتر واحد. وحدثت أكبر الأخطاء فقط عندما لمس الروبوت الجسم، حيث تسببت فيزياء العالم الحقيقي المتعلقة بالاحتكاك والوزن، والتي لم تكن مُمذجة تماماً في الحاسوب، في حدوث انحرافات طفيفة. وبالرغم من هذه الأخطاء الضئيلة، نجح الروبوت في إكمال جميع المهام الـ 200. وقد أثبت ذلك أن الفجوة الفيزيائية بين المحاكاة والعالم الحقيقي كانت صغيرة بما يكفي لإدارتها، وأن النظام يمكنه توليد بيانات تدريب عالية الجودة تلقائياً.
لإثبات أن النظام يعمل من البداية إلى النهاية، استخدم الفريق البيانات التي جمعوها لتدريب سياسة روبوتية جديدة من الصفر. لقد علموا نموذجاً يسمى (ORCHID) لأداء مهام دفع المكعب نفسها باستخدام 200 مثال من العالم الحقيقي التي جمعوها فقط. وعندما اختبروا هذا الروبوت الذي علّم نفسه بنفسه في حلقة مغلقة -حيث كان عليه النظر إلى المشهد، واتخاذ القرار، والتحرك وفقاً لذلك- نجح في 6 من أصل 20 محاولة. وأشار الباحثون إلى أن معدل النجاح المنخفض هذا كان ناتجاً على الأرجى عن كمية بيانات التدريب القليلة والاختلافات في الإضاءة، وليس بسبب خلل جوهري في الطريقة. وقد كانت التجربة بمثابة إثبات للمفهوم، حيث أظهرت أنه يمكن تدريب روبوت على بيانات من العالم الحقيقي تم توليدها بواسطة محاكاة، وأن نفس البنية البرمجية يمكن استخدامها لجمع البيانات وتشغيل الروبوت النهائي على حد سواء.
تسلط الدراسة الضوء على أن التحديات الكبرى في نقل الروبوتات من الحاسوب إلى العالم الحقيقي لا تكمن في التخطيط رفيع المستوى، بل في التفاعلات الفيزيائية المحددة. لم تكن الأخطاء عشوائية؛ فقد ظهرت باستمرار عندما لامس الروبوت الجسم، مما يشير إلى أن نماذج أفضل لوزن الأجسام واحتكاك الطاولة ستؤدي إلى تحسين الأداء أكثر من تحسين حركة الروبوت في المساحات الفارغة. ومن خلال توفير بروتوكول مفتوح المصدر ومجموعة بيانات من المسارات المزدوجة (المحاكاة والحقيقية)، قدم الباحثون للمجتمع أداة لقياس وتقليل هذه التناقضات الفيزيائية. ويظهر عملهم أنه من الممكن توليد كميات هائلة من بيانات التدريب من العالم الحقيقي دون تدخل بشري، بشرط أن يتم تصميم النظام لقياس ومراعاة الاختلافات الصغيرة بين الخطة الرقمية والواقع الفيزيائي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.