← أحدث الأبحاث
💻 computer science

SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation

تقترح الورقة البحثية إطار عمل SARM، وهو نموذج مكافأة قائم على الفيديو ومعتمد على المراحل، يستفيد من التعليقات التوضيحية باللغة الطبيعية لتوليد إشراف متسق للمهام طويلة المدى والغنية بالتلامس مثل طي القمصان، مما يعزز بشكل كبير تدريب السياسات اللاحقة من خلال طريقة مبتكرة لنسخ السلوك المتوافق مع المكافأة (RA-BC).

المؤلفون الأصليون: Qianzhong Chen, Justin Yu, Mac Schwager, Pieter Abbeel, Yide Shentu, Philipp Wu

نُشر 2026-04-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Qianzhong Chen, Justin Yu, Mac Schwager, Pieter Abbeel, Yide Shentu, Philipp Wu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيفية طي قميص (T-shirt). هذه ليست مجرد مهمة بسيطة من نوع "التقط وضع"، بل هي رقصة طويلة ومعقدة تتضمن الإمساك، وتنعيم التجاعيد، وطي الأكمام، وحشر القميص في زاوية ما. وإذا كان القميص مجعداً، تصبح المهمة أكثر صعوبة.

المشكلة التي واجهها مؤلفو هذه الورقة البحثية هي أن تعليم الروبوتات يشبه تعليم طفل من خلال عرض فيديوهات عليه، لكن بعض تلك الفيديوهات سيئة.

المشكلة: فيديوهات سيئة ومؤقتات مربكة

في الماضي، لتعليم الروبوت، كان الباحثون يجمعون ساعات من الفيديو لبشر يقومون بالمهمة. كانوا يخبرون الروبوت: "افعل بالضبط ما تراه في الفيديو". وهذا ما يسمى "التعلم بالتقليد" (Imitation Learning).

ومع ذلك، هناك مشكلتان كبيرتان:

  1. الفيديوهات فوضوية: بعض العروض البشرية مثالية، بينما البعض الآخر يتسم بالارتباك، أو يستغرق وقتاً طويلاً، أو حتى يفشل في منتصف الطريق. إذا علمت الروبوت باستخدام كل الفيديوهات بالتساوي، فسيصاب بالارتباك؛ لأنه سيتعلم العادات السيئة جنباً إلى جنب مع العادات الجيدة.
  2. فخ "المؤقت": لتعليم الروبوت، كان الباحثون يقولون سابقاً: "عند الثانية 10، يجب أن تكون هنا؛ وعند الثانية 20، يجب أن تكون هناك". لكن البشر لا يعملون وفق مؤقت صارم. فقد يقوم شخص بتنعيم القميص في 5 ثوانٍ، بينما يستغرق آخر 20 ثانية. إذا كنت تعتمد فقط على عد الثواني، فستحصل على خريطة مربكة للروبوت. قد يعتقد الروبوت أن القميص "مطوي جزئياً" لمجرد مرور 10 ثوانٍ، حتى لو كان لا يزال عبارة عن كرة مجعدة.

الحل: SARM (المدرب المدرك للمراحل)

ابتكر المؤلفون نظاماً جديداً يسمى SARM (نمذجة المكافأة المدركة للمراحل). فكر في SARM كـ مدرب ذكي يشاهد فيديو الروبوت ويفهم قصة المهمة، وليس مجرد الساعة.

بدلاً من السؤال: "كم ثانية مرت؟"، يسأل SARM: "في أي مرحلة من المهمة نحن الآن؟"

  • التشبيه: تخيل سيناريو فيلم. المدرب السيئ يقول: "في الدقيقة الخامسة، يجب أن يكون البطل في حالة قتال". أما المدرب الجيد (SARM) فيقول: "البطل حالياً في مشهد 'القتال'. هل هو منتصر؟ هل هو مهزوم؟ أم أنه بدأ القتال للتو؟".
  • كيف يعمل: ينظر SARM إلى الفيديو والوصف النصي (مثل: "أمسك القميص"، "قم بتنعيم القميص"). يقوم بتقسيم المهمة الطويلة إلى "مشاهد" (مراحل) أصغر. ثم يقيم تقدم الروبوت داخل ذلك المشهد. هل نجح الروبوت في الإمساك بالقميص؟ هل يقوم الآن بتنعيمه؟
  • النتيجة: يمكن لـ SARM أن ينظر إلى فيديو فوضوي حيث ارتكب الروبوت خطأً، ويدرك: "أوه، أنت عالق في مرحلة 'التنعيم'"، ويعطي درجة تعكس هذا الواقع، بدلاً من أن يقول ببساطة: "لقد تأخرت، لذا ستحصل على درجة سيئة".

الخطوة الثانية: RA-BC (المصفاة الذكية)

بمجرد تدريب SARM ليكون حكماً جيداً، استخدمه المؤلفون لبناء RA-BC (نسخ السلوك المتوافق مع المكافأة).

  • التشبيه: تخيل أنك طالب تدرس من أجل اختبار. لديك كومة من 100 امتحان تجريبي.
    • الطريقة القديمة (Vanilla BC): تدرس كل الامتحانات بالتساوي، بما في ذلك تلك التي أخطأ فيها المعلم أو غش فيها الطالب. أنت تضيع وقتك في أمثلة سيئة.
    • طريقة RA-BC: تستخدم "مدربك الذكي" (SARM) لتصحيح الامتحانات التجريبية أولاً. يقول المدرب: "هذا الامتحان مثالي، ادرسه بجد! هذا الامتحان فوضوي، تجاوزه. هذا الآخر جيد، ادرسه قليلاً".
  • كيف يعمل: ينظر RA-BC إلى جميع الفيديوهات البشرية، ويستخدم SARM لتسجيل درجاتها، ثم يقوم بـ إعادة وزن التدريب. إنه يخبر الروبوت: "انتبه بشكل خاص للفيديوهات المثالية وتجاهل الفيديوهات الفوضوية".

النتائج: طي القمصات

اختبر الفريق نظامهم على روبوت حقيقي يحاول طي القمصات، بما في ذلك المهمة الصعبة جداً المتمثلة في البدء بـ قميص مجعد.

  • الطريقة القديمة: بدون نظامهم الجديد، نجح الروبوت بنسبة 8% فقط مع القميص المسطح، و 0% مع القميص المجعد. لقد كان تائهاً تماماً.
  • الطريقة الجديدة (SARM + RA-BC):
    • مع القميص المسطح: 83% نسبة النجاح.
    • مع القميص المجعد: 67% نسبة النجاح.

لماذا هذا مهم؟

تظهر الورقة البحثية أنه لكي تقوم الروبوتات بمهام معقدة وطويلة (مثل طي الغسيل أو تفريغ الأطباق)، فإن جودة البيانات أهم من كمية البيانات. أنت لا تحتاج فقط إلى المزيد من الفيديوهات؛ بل تحتاج إلى طريقة لفهم أي الفيديوهات جيدة وأين يقع الروبوت في العملية.

من خلال استخدام مدرب "مدرك للمراحل" لفهم قصة المهمة، و"مصفاة ذكية" لاختيار أفضل الأمثلة، استطاعوا تعليم الروبوت القيام بشيء كان مستحيلاً عليه سابقاً.

باختصار: لقد علموا الروبوت التوقف عن عد الثواني والبدء في فهم قصة المهمة، مما سمح له بالتعلم من أفضل الأمثلة وتجاهل الأخطاء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →