Phys2Real: Fusing VLM Priors with Interactive Online Adaptation for Uncertainty-Aware Sim-to-Real Manipulation
إن Phys2Real هو إطار عمل للتعلم المعزز من الواقع إلى المحاكاة ثم إلى الواقع، يعمل على تعزيز النقل من المحاكاة إلى الواقع من أجل التلاعب الروبوتي الدقيق عبر دمج الأولويات المسبقة للمعلمات الفيزيائية المستنتجة من نماذج الرؤية واللغة مع التكيف التفاعلي عبر الإنترنت من خلال تقدير المجموعة الواعي بالارتياب.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوتًا كيفية دفع صندوق ثقيل وذي شكل غريب عبر طاولة. لا يمكنك ببساطة أن تقول للروبوت "ادفع بقوة"، لأنه إذا كان الصندوق ثقيلاً من جانب واحد، فقد ينقلب. وإذا كان خفيفًا، فقد تدفعه بقوة زائدة مما يجعله يطير بعيدًا. يحتاج الروبوت إلى معرفة فيزياء الشيء: أين تتركز كتلته (مركز الكتلة) ومدى انزلاقه.
المشكلة هي أن الروبوتات عادة ما تتعلم في عالم مثالي (محاكاة - لعبة فيديو)، ثم تحاول تنفيذ المهمة في العالم الحقيقي، وغالبًا ما تخطئ لأن "فيزياء اللعبة" لا تطابق "الفيزياء الحقيقية".
Phys2Real هي طريقة جديدة تساعد الروبوت على سد هذه الفجوة. فكر فيها كبرنامج تدريبي من ثلاث خطوات يجمع بين التخمين، التعلم، والثقة.
وصفة الـ "Phys2Real" ذات الخطوات الثلاث
1. التوأم الرقمي (من الواقع إلى المحاكاة)
أولاً، يحتاج الروبوت إلى نسخة رقمية مثالية من الشيء ليتدرب عليها.
- التشبيه: تخيل التقاط صورة لمطرقة حقيقية واستخدام برنامج سحري لتحويلها إلى نموذج ثلاثي الأبعاد في لعبة فيديو يبدو تمامًا مثل الشيء الحقيقي، وصولاً إلى الملمس والشكل.
- ماذا فعلوا: استخدموا كاميرا لالتقاط صور للشيء وبرنامج ذكاء اصطناعي خاص (يسمى Gaussian Splating) لبناء نموذج ثلاثي الأبعاد مثالي. هذا يصبح "صالة الألعاب الرياضية للتدريب" الخاصة بالروبوت.
2. استراتيجية "الدماغين" (الابتكار الجوهري)
هذا هو الجزء الذكي. يستخدم الروبوت "دماغين" مختلفين لفهم فيزياء الشيء، ثم يدمجهما معًا.
الدماغ (أ): الخبير البصري (VLM)
- من هو: هذا نموذج لغوي بصري (مثل ذكاء اصطناعي فائق الذكاء يمكنه الرؤية والقراءة).
- ماذا يفعل: قبل أن يلمس الروبوت الشيء، ينظر الذكاء الاصطناعي إلى صورة ويقول: "بناءً على كيفية ظهور رأس تلك المطرقة الثقيلة، أتوقع أن مركز الوزن هنا. أنا متأكد بنسبة 80%."
- الاستعارة: هذا يشبه نظرك إلى حقيبة سفر وتخمينك: "تبدو ثقيلة من الأسفل، لذا يجب أن أرفعها من الأعلى." إنه تخمين جيد، لكنه يظل مجرد تخمين.
الدماغ (ب): المتعلم اللمسي (RL Policy)
- من هو: هذا هو دماغ التعلم المعزز الخاص بالروبوت، والذي تم تدريبه في المحاكاة.
- ماذا يفعل: بينما يبدأ الروبوت في دفع الشيء، يشعر بكيفية تفاعل الشيء. إذا مال الشيء إلى اليسار، يتعلم الروبوت: "أوه، الوزن في الواقع على اليمين!"
- الاستعارة: هذا يشبه قيامك بالفعل بحمل حقيبة السفر والشعور بميلانها. أنت تعدل قبضتك بناءً على ما تشعر به.
3. خلاط "عدم اليقين" (الدمج)
هذا هو المكون السحري. الروبوت لا يختار دماغًا واحدًا فقط؛ بل يستمع إلى كليهما، لكنه يزن رأيهما بناءً على درجة الثقة.
- التشبيه: تخيل أنك تحاول العثور على شيء مفقود.
- الدماغ (أ) (البصري) يقول: "أعتقد أنه في المطبخ، لكني لست متأكدًا بنسبة 100%."
- الدماغ (ب) (اللمسي) يقول: "لم أشعر به بعد، لذا ليس لدي أدنى فكرة أين هو."
- النتيجة: يستمع الروبوت في الغالب إلى الدماغ (أ) لأن الدماغ (ب) ليس لديه أي معلومات حاليًا.
- لاحقًا: بعد 10 ثوانٍ من الدفع، يقول الدماغ (ب): "أشعر بوضوح أنه ثقيل من الجانب الأيسر!" الآن، أصبح الدماغ (ب) واثقًا جدًا. ينتقل الروبوت للاستماع في الغالب إلى الدماغ (ب).
النظام يسأل باستمرار: "من هو الأكثر تأكدًا الآن؟" إذا كان الروبوت في البداية ولم يلمس الشيء بعد، فإنه يثق في الخبير البصري. وبمجرد أن يبدأ الروبوت في التفاعل وجمع البيانات، فإنه يثق في المتعلم اللمسي.
لماذا هذا مهم (النتائج)
اختبر الباحثون ذلك في مهمتين:
- دفع كتلة على شكل حرف T: أضافوا وزنًا ثقيلاً في الأعلى أو الأسد لتغيير طريقة حركتها.
- الطريقة القديمة (عشوائية النطاق - Domain Randomization): حاول الروبوت أن يكون "متوسطًا" ليتعامل مع كل شيء. فشل كثيرًا (نجاح بنسبة 23% فقط في النسخة الصعبة).
- Phys2Real: استخدم الروبوت تخمين الذكاء الاصطناعي للبدء، ثم قام بتحسينه أثناء الدفع. نجح بنسبة 57% في النسخة الصعبة و100% في النسخة السهلة.
- دفع مطرقة: قاموا ببناء نموذج المطرقة ثلاثي الأبعاد من الصفر باستخدام الصور.
- النتيجة: أنهى الروبوت المهمة بشكل أسرع بنسبة 15% من الطرق القديمة لأنه لم يضع وقتًا في التخمين؛ بل عرف بالضبط كيف ستتصرف المطرقة.
الصورة الكبيرة
Phys2Real يشبه إعطاء الروبوت "شعورًا داخليًا" (من رؤية الذكاء الاصطناعي للشيء) ثم تعليمه كيف "يثق بيديه" (من التفاعل الفيزيائي). ومن خلال دمج هذين المصدرين من المعلومات ومعرفة متى يثق في كل منهما، يمكن للروبوت التعامل مع أشياء جديدة وغريبة لم يراها من قبل، مما يجعله أكثر ذكاءً وأمانًا في الوظائف الواقعية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.