← أحدث الأبحاث
🤖 machine learning

Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons

تقدم الورقة البحثية Robometer، وهو إطار عمل قابل للتوسع لنمذجة المكافأة يجمع بين الإشراف على التقدم على مستوى الإطار مع تعلم التفضيل القائم على مقارنة المسارات، والذي تم تدريبه على مجموعة بيانات RBM-1M واسعة النطاق لتعلم دالات مكافأة قابلة للتعميم بفعالية من مسارات خبيرة وغير مثالية متنوعة.

المؤلفون الأصليون: Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Ste
نُشر 2026-05-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Stephen Tu, Erdem Biyik, Jesse Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية طهي العشاء. في الماضي، لكي تعلم الروبوت، كان عليك أن تعمل كحكم صارم، تراقب كل ثانية من حركاته وتمنحه درجة دقيقة (مثل "7.5 من 10") لكيفية براعته في تقطيع البصل. إذا أسقط الروبوت السكين، كان عليك تحديد متى انخفضت الدرجة بالضبط وبأي مقدار. كان هذا أمرًا صعبًا للغاية، خاصة عندما يفشل الروبوت، وكان ذلك يعني أنك لا تستطيع استخدام آلاف المحاولات "الفاشلة" التي يقوم بها الروبوت في العالم الحقيقي لأنها كانت فوضوية جدًا لدرجة يصعب معها تقييمها.

نظام ROBOMETER هو نظام جديد يغير طريقة تعليم الروبوتات عبر استخدام نهج أكثر ذكاءً وشبه بشري في التقييم.

الفكرة الجوهرية: المقارنة بدلاً من التقييم الرقمي

بدلاً من محاولة إعطاء درجة مثالية لكل لحظة، يتعلم ROBOMMETER من خلال مقارنة محاولتين مختلفتين لنفس المهمة.

فكر في الأمر كحكم في برنامج مواهب. بدلاً من إعطاء المتسابق درجة 8.2 من 10، يكتفي الحكم بالنظر إلى عرضين ويقول ببساًطة: "الأداء (أ) كان أفضل بوضوح من الأداء (ب)".

  • الطريقة القديمة: يتعين عليك مشاهدة روبوت يفشل في وضع كوب على الطاولة ومحاولة حساب مدى "سوء" هذا الفشل بدقة.
  • طريقة ROBOMETER: تعرض للروبوت فيديو لإنسان يقوم بالمهمة بشكل مثالي وفيديو لروبوت يسقط الكوب. يتعلم النظام: "فيديو الإنسان أفضل". لا يحتاج النظام لمعرفة "لماذا" أو إعطاء رقم محدد؛ إنه يتعلم فقط ترتيب "الجيد" مقابل "السيئ".

"المكتبة الضخمة" للأخطاء (RBM-1M)

لتعليم هذا النظام، بنى الباحثون مكتبة ضخمة تسمى RBM-1M.

  • المشكلة القديمة: معظم مكتبات تدريب الروبوتات تحتوي فقط على فيديوهات "مثالية". إذا أسقط الروبوت كوبًا، يتم رمي هذا الفيديو في المهملات لأنه يصعب تقييمه.
  • الحل الجديد: تحتوي هذه المكتبة على مليون فيديو من 21 نوعًا مختلفًا من الربوات (من الأذرع المنفردة إلى الأيدي الشبيهة بالبشر). والأهم من ذلك، أنها مليئة بالأخطاء، والإخفاقات، والمحاولات المتعثرة. ولأن ROBOMETER يتعلم من خلال المقارنة (على سبيل المثال: "هذه المحاولة الفاشلة أسوأ من تلك الناجحة")، فإنه يستطيع فعليًا التعلم من كومة النفايات المتمثلة في الفيديوهات الفاشلة. إنه يعامل الإخفاقات كدروس قيمة حول ما يجب عدم فعله.

كيف يعمل (الرقصة الثنائية)

يتعلم ROBOMETER باستخدام خدعتين محددتين في نفس الوقت:

  1. فحص "التقدم": يشاهد فيديو واحد ويحاول تخمين: "إلى أي مدى وصلت هذه المهمة؟" (من 0% إلى 100%). هذا يرسخ فهم الروبوت للزمن والتقدم.
  2. فحص "التفضيل": يشاهد فيديوهين جنبًا إلى جنب ويقرر: "أيهما أدى المهمة بشكل أفضل؟" وهذا يعلم الروبوت فهم جودة الحركة، حتى لو كانت فشلاً ذريعًا.

من خلال الجمع بينهما، يكتسب الروبوت "شعورًا" بالنجاح يعمل حتى عندما ينظر إلى روبوت لم يره من قبل، وفي غرفة لم يزرها من قبل.

ما الذي يفعله حقًا (نتائج مثبتة)

تظهر الورقة البحثية أن هذا النظام يعمل بشكل أفضل من الطرق السابقة في أربعة سيناريوهات محددة من الواقع:

  1. التعلم عبر الإنترنت التلقائي (Automatic Online Learning): عندما يكون الروبوت في مرحلة تعلم مهمة ما في الوقت الفعلي (مثل وضع وعاء على الطاولة)، يعمل ROBOMETER كمدرب يخبر الروبوت فورًا: "أنت تفعل ذلك بشكل خاطئ"، ويوجهه لإصلاح الخطأ. لقد ساعد الروبوت على تحسين معدل نجاحه من 20% إلى 85% في مطبخ مزدحم، بينما توقفت الطرق القديمة عند 55%.
  2. التعلم من البيانات الفوضوية (Offline RL): إذا كان لديك مزيج من الفيديوهات المثالية والفيديوهات الفوضوية والفاشلة، يمكن لـ ROBOMETER فرزها لتعليم روبوت جديد. لقد حسن معدلات النجاح بمقدار 2.4 مرة مقارلة بأفضل الأدوات السابقة.
  3. إيجاد الأشياء الجيدة (Data Filtering): تخيل أن لديك كومة ضخمة من مقاطع الفيديو وتحتاج للعثور على أفضل 10 مقاطع لتعليم روبوت كيفية "تحريك القدر". ROBOMETER أفضل بكثير في العثور على المقاطع ذات الصلة والناجحة وتجاهل الإخفاقات مقارنة بأدوات البحث الأخرى. أدى ذلك إلى تحسن قدرة الروبوت على تعلم المهمة بمقدار 4.5 مرة.
  4. رصد الإخفاقات: إذا كان الروبوت عالقًا، أو يتذبذب (يتحرك ذهابًا وإيابًا دون تقدم)، أو يسقط شيئًا، يمكن لـ ROBOMETER اكتشاف هذا الفشل فورًا دون الحاجة لإخباره بماهية الفشل. لقد حدد الإخفاقات بشكل صحيح في 81% من الحالات، متفوقًا على الأنظمة الأخرى.

الخلاصة

ROBOMETER هو "نموذج مكافأة عالمي" يوقف حاجة الروبوتات لوجود إنسان يقيم كل ثانية من عملها. من خلال التعلم من المقارنة بين "الأفضل" و"الأسوأ" باستخدام مكتبة ضخمة من النجاحات والإخفاقات، فإنه يساعد الروبوتات على التعلم بشكل أسرع، والتعامل مع الأخطاء بشكل أفضل، والتكيف مع مهام جديدة وأجساد روبوتية جديدة دون الحاجة إلى إعادة التدريب من الصفر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →