← أحدث الأبحاث
🤖 machine learning

Residual Reward Models: Leveraging Prior Knowledge for Efficient Preference-based Reinforcement Learning in Robotics

تقدم هذه الورقة نماذج المكافأة المتبقية (RRM)، وهي طريقة تعمل على تفكيك دالة المكافأة إلى مكون معرفة مسبقة وإزاحة متبقية قابلة للتعلم لتعزيز كفاءة العينات وقابلية التطبيق في العالم الحقيقي للتعلم المعزز القائم على التفضيلات في الروبوتات بشكل كبير.

المؤلفون الأصليون: Chenyang Cao, Miguel Rogel-García, Mohamed Nabail, Xueqian Wang, Nicholas Rhinehart

نُشر 2026-08-28
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Chenyang Cao, Miguel Rogel-García, Mohamed Nabail, Xueqian Wang, Nicholas Rhinehart

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

يُعد تعليم روبوت مهمة بدنية معقدة، مثل الضغط على زر أو التقاط جسم رقيق، لغزاً صعباً للمهندسين. ففي عالم الروبوتات، يحتاج الجهاز إلى مجموعة من التعليمات تخبره بما يفعله بشكل جيد وما يفعله بشكل سيئ. تُسمى هذه المجموعة من التعليمات "دالة المكافأة". وإذا كانت التعليمات غامضة أو خاطئة، فقد يتعلم الروبوت تجاوز النظام، فيجد طريقة للحصول على درجة عالية دون إكمال المهمة فعلياً، أو قد يستسلم ببساطة لأنه لا يستطيع معرفة ما هو متوقع منه. تقليدياً، يتعين على البشر كتابة هذه التعليمات يدوياً، من خلال التخمين أي الحركات ستؤدي إلى النجاح. هذه العملية بطيئة، ومكلفة، وغالباً ما تفشل عندما يواجه الروبوت موقفاً لم يتوقعه الإنسان.

يحاول نهج أحدث، يُعرف باسم "التعلم القائم على التفضيل"، حل هذه المشكلة من خلال السماح للبشر ببساطة بالقول أي من حركتي الروبوت تبدو أفضل، بدلاً من كتابة قواعد معقدة. ورغم أن هذا يبدو أبسط، إلا أنه يخلق مشكلة جديدة: يحتاج الروبوت إلى رؤية آلاف من هذه المقارنات ليتعلم أي شيء مفيد. وفي بيئة العالم الحقيقي، يكون طلب مراقبة الإنسان وإصدار أحكام على الروبوت لهذا العدد الكبير من المرات أمراً غير عملي ومكلفاً؛ إذ يتعلم الروبوت ببطء شديد، ويصبح تكلفة انتباه البشر عائقاً يمنع هذه الآلات من أن تكون مفيدة خارج المختبر الخاضع للرقابة.

قام باحثون من جامعة تورنتو وجامعة تسينغهوا بتطوير طريقة لتسريع هذه العملية بشكل كبير، وأطلقوا على نهجهم اسم "نموذج المكافأة المتبقية" (Residual Reward Model). فبدلاً من البدء من الصفر وطلب تعليم الروبوت كل شيء من البداية، تسمح هذه الطة للروبوت بالبدء بـ "أفضل تخمين" حول كيفية تنفيذ المهمة. يمكن أن يأتي هذا التخمين من قاعدة بسيطة كتبها مهندس، أو وصف تم إنشاؤه بواسطة نموذج لغوي كبير، أو حتى دالة مكافأة تم تعلمها من خلال مراقبة إنسان يؤدي المهمة لمرة واحدة. ثم يستخدم الروبوت هذا التخمين الأولي كقاعدة أساسية. وعندما يقدم الإنسان تفضيلاً، قائلاً "هذه الحركة كانت أفضل من تلك"، فإن الروبوت لا يحاول إعادة كتابة كتاب القواعد بأكمله، بل يتعلم فقط الفرق الصغير، أو "المتبقي"، اللازم لتصحيح التخمين الأولي.

تخيل الأمر كطالب يعرف بالفعل القواعد الأساسية لرياضة ما ولكنه يحتاج إلى مدرب ليشير إلى الفروق الدقيقة في تقنيته. الطالب لا يحتاج إلى إعادة تعلم كيفية الجري أو الرمي؛ بل يحتاج فقط إلى تعديل أسلوبه قليلاً ليتناسب مع ملاحظات المدرب. وبنفس الطريقة، يستخدم الروبوت ملاحظات الإنسان لإجراء تعديلات صغيرة ودقيقة على فهمه المسبق للمهمة. هذا الهيكل يحافظ على استقرار عملية التعلم؛ فإذا كان التخمين الأولي غير كامل، فلا يزال بإمكان الروبوت التعلم لأنه يحتاج فقط إلى تصحيح الأخطاء بدلاً من اكتشاف المفهوم بأكرله من العدم.

اختبر الباحثون هذه الفكرة في مجموعة متنوعة من البيئات المحاكية، بما في ذلك المهام التي تتطلب من ذراع روبوتية الضغط على أزرار، أو كنس أشياء في سلة، أو فتح أبواب. كما اختبروا ذلك على روبوت مادي حقيقي، وهو ذراع "فرانكا باندا" (Franta Panda)، في بيئة مختبرية. وفي كل حالة، كانت الطريقة التي استخدمت "أفضل تخمين" بالإضافة إلى التصحيحات الصغيرة أسرع بكثير من الطرق التي حاولت تعلم كل شيء من تفضيلات البشر وحدها. وفي عمليات المحاكاة، وصل الروبوت الذي يستخدم هذه الطريقة الجديدة إلى معدل نجاح مثالي في العديد من المهام مع تطلب عدد أقل بكثير من أحكام البشر. على سبيل المثال، في مهمة كان على الروبوت فيها الضغط على زر، توقفت الطريقة القياسية التي تحاول التعلم من الصفر عند معدل نجاح قدره عشرون بالمائة، بينما وصلت الطوة الجديدة إلى مائة بالمائة.

كما أظهرت الدراسة أن هذا النهج قوي ضد الأخطاء. فإذا كان "أفضل تخمين" أولي خاطئاً قليلاً، أو إذا كانت ملاحظات البشر غير متسقة أو متذبذبة أحياناً، فلا يزال بإمكان الروبوت تعلم السلوك الصحيح. لقد عمل التخمين الأولي كشبكة أمان، مما منع الروبوت من الانجراف نحو سلوكيات غير مجدية، بينما ضمنت التصحيحات أنه سيجد المسار الصحيح في النهاية. وكان هذا مهماً بشكل خاص عندما اختبر الباحثون النظام مع عدد محدود جداً من ملاحظات البشر؛ فحتى عندما طُلب من الإنسان تقديم عدد ضئيل جداً من الأحكام، استمر الروبوت الذي يستخدم طريقة "المتبقي" في التحسن، بينما فشلت الطريقة القياسية في تعلم أي شيء مفيد.

ولعل الأهم من ذلك هو أن الباحثين أثبتوا أن هذا التعلم يمكن أن ينتقل مباشرة من محاكاة الكمبيوتر إلى روبوت مادي حقيقي دون أي ضبط إضافي. فقد قاموا بتدريب الروبوت في بيئة افتراضية ثم وضعوا السياسة المتعلمة على ذراع "فرانكا باندا" حقيقية لأداء مهام مثل الوصول إلى جسم، أو دفع كتلة، أو التقاط شيء ما ونقله. وقد نجح الروبوت الذي تدرب باستخدام طريقة "المتبقي" في هذه المهام الواقعية بشكل أسرع بكثير من الطريقة الأساسية. وفي إحدى المهام الصعبة التي تتضمن دفع جسم، تمكنت الطريقة القياسية من النجاح في نصف الحالات فقط بعد تدريب مكثف، بينما حققت الطريقة الجديدة نسبة نجاح بلغت 95% بنفس وقت التدريب.

تشير النتائج إلى أنه من خلال الجمع بين المعرفة المسبقة وملاحظات البشر، يمكن للروبوتات تعلم مهارات بدنية معقدة بإشراف بشري أقل بكثير مما كان يُعتقد سابقاً. وهذا لا يعني أن الروبوت يعرف كل شيء مسبقاً، بل يعني أنه يستخدم ما يعرفه كنقطة انطلاق لتحقيق أقصى استفادة من كل قطعة من ملاحظات البشر التي يتلقاها. ويمكن أن يكون هذا الكفاءة خطوة رئيسية نحو جعل المساعدين الروبوتيين عمليين للوظائف في العالم الحقيقي، حيث الوقت وانتباه البشر موارد محدودة. ويؤكد العمل أن منح الروبوت بداية جيدة، حتى لو كانت تقريبية، يسمح له بالتعلم من تفضيلات البشر بطريقة أسرع وأكثر موثوقية من البدء من صفحة بيضاء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →