Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control
تقدم هذه الورقة البحثية تحسين السياسة القائم على الانجراف (DBPO)، وهو إطار عمل ثنائي المراحل يُمكّن سياسات توليدية أصلية ذات خطوة واحدة للتحكم الروبوتي من خلال استيعاب الصقل التكراري ضمن التدريب ودعم التعلم المعزز عبر الإنترنت، مما يحقق أداءً عالي التردد ومنخفض زمن الاستجابة يتفوق على النماذج المرجعية الحالية متعددة الخطوات والخطوة الواحدة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
أصبحت الأذرع الروبوتية شائعة بشكل متزايد في المصانع والمختبرات، حيث تُكلف بمهام دقيقة مثل تجميع الإلكترونيات أو فرز الأشياء. ولكي تعمل هذه الآلات بشكل جيد، فإنها تحتاج إلى "دماغ" يمكنه أن يقرر بدقة كيفية تحريك مفاصلها بناءً على ما تراه كاميراتها. وتحدث عملية اتخاذ القرار هذه في جزء من الثانية، مراراً وتكراراً، بينما يتفاعل الروبوت مع عالم متغير. ويكمكن التحدي في أن العالم الحقيقي فوضوي وغير متوقع؛ فقد تسمح رؤية واحدة لكتلة على طاولة بعدة طرق مختلفة وصحيحة للإمساك بها، اعتماداً على حركات الروبوت السابقة أو التغيرات الطفيفة في الإضاءة. وللتعامل مع حالة عدم اليقين هذه، طور الباحثون أنظمة لا تكتفي باختيار إجابة واحدة فقط، بل تتعلم نطاقاً من الإجراءات الجيدة المحتملة. وتستخدم الأنظمة الأكثر نجاحاً حتى الآن طريقة تعمل مثل النحات البطيء والمتأني: فهي تبدأ بتخمين عشوائي ثم تقوم بتحسينه تدريجياً، خطوة بخطوة، حتى يبدو الإجراء مثالياً. ورغم أن هذا النهج ينتج حركات عالية الجودة، إلا أنه بطيء؛ إذ يتعين على الروبوت تشغيل دماغه الحاسوبي مرات عديدة لكل حركة واحدة يقوم بها، مما يخلق تأخراً يجعل استجابته بطيئة جداً للمهام التي تتطلب سرعة في الوقت الفعلي أو لتعلم مهارات جديدة من خلال التجربة والخطأ.
لقد وجد فريق من الباحثين الآن طريقة تجعل هذه الأدمغة الروبوتية الذكية بنفس القدر من الكفاءة ولكن أسرع بكثير. فقد طوروا نظاماً جديداً ينتج نفس خطط العمل عالية الجودة متعددة الخيارات في لحظة واحدة، بدلاً من استغراق عشرات الخطوات في عملية التحسين. وفي عملهم، أظهروا أنه من خلال تغيير كيفية تعلم الروبوت أثناء التدريب، استطاعوا تعليمه تخطي عملية التحسين البطيئة تماماً. فبدلاً من التعلم من إصلاح أخطائه بعد وقوعها، يتعلم الروبوت أن يصيب الإجابة الصحيحة من المرة الأولى. وعند اختباره على مجموعة من اثني عشر مهمة روبوتية مختلفة، حققت هذه الطريقة الجديدة معدل نجاح متوسط أعلى من الأنظمة القديمة الأبطأ. ولم يكن هذا التسريع مجرد تحسن نظري؛ ففي تجربة على روبوت مادي ثنائي الأذرع في مختبر حقيقي، أكمل النظام الجديد 82 بالمائة من مهامه، مقارنة بـ 59 بالمائة لأفضل طريقة سابقة ذات الخطوة الواحدة، كل ذلك مع الاستجابة بسرعة كافية للتحكم في الروبوت في الوقت الفعلي.
يكمن جوهر هذا الاختراق في كيفية تعلم الروبوت من الأمثلة. تعتمد الطرق التقليدية التي تنتج إجراءات عالية الجودة غالباً على عملية تسمى "إزالة الضجيج التكرارية". تخيل روبوتاً يحاول إيجاد أفضل طريقة للإمساك بكوب؛ قد تبدأ الأنظمة القديمة بوضعية يد عشوائية تماماً ثم تحركها ببطء لتصبح أقرب إلى الكوب، وتتحقق من عملها، ثم تحركها مرة أخرى، وتكرر هذه الدورة مرات عديدة حتى تصبح اليد في المكان المثالي. هذا يضمن أن الروبوت سيجد حلاً جيداً، لكنه يستغرق وقتاً. أما النهج الجديد، الذي يسمه الباحثون "سياسة الانجراف" (drift-based policy)، فيقلب هذا المنطق؛ فبدلاً من تحسين الإجابة أثناء لحظة الفعل، يتعلم الروبوت استيعاب عملية التصحيح بأكملها أثناء تدريبه. خلال التدريب، يُعرض على النظام أمثلة عديدة لحركات ناجحة، ويُعلّم كيف يتنبأ بكيفية انجراف التخمين العشوائي نحو التخمين الصحيح. إنه يتعلم امتصاص هذه التصحيحات في إعداداته الداخلية، بحيث عندما يتم نشره أخيراً، لا يحتاج إلى اتخاذ تلك الخطوات التدريجية البطيئة، بل يقوم ببساطة بإخراج الإجراء المصحح النهائي فوراً.
ولإثبات نجاح هذه الفكرة، اختبر الباحثون نظامهم على مجموعة متنوعة من التحديات. بدأوا بمجموعة قياسية من اثني عشر مهمة محاكاة تتضمن دفع الكتل، ورفع الأشياء، والتحكم في الأدوات. كانت الأنظمة القديمة متعددة الخطوات تتطلب من الكمبيوتر تشغيل شبكتها مائة مرة لتقرير حركة واحدة، بينما قام النظام الجديد بنفس المهمة عبر تشغيل واحد فقط. وكانت النتيجة نظاماً ليس فقط أسرع بمائة مرة، بل أيضاً أكثر نجاحاً بشكل عام، حيث حقق معدل نجاح متوسط قدره 83 بالمائة مقارنة بـ 79 بالمائة للأساليب الأبطأ. وقد أثبت ذلك أن السرعة لم تأتِ على حساب الجودة؛ فقد كان الروبوت بنفس جودة الأنظمة السابقة في أداء المهمة، ولكنه كان أكثر كفاءة بكثير.
ثم دفع الباحثون النظام إلى أبعد من ذلك ليروا ما إذا كان بإمكانه التعامل مع بيئات أكثر تعقيداً وثلاثية الأبعاد، حيث يرى الروبوت العالم كسحابة من النقاط بدلاً من صورة مسطحة. واختبروه في سبعة وثلاثين مهمة مختلفة، تراوحت من التلاعب البسيط بالأشياء إلى المهام الماهرة الصعبة مثل استخدام المطرقة أو تدوير مقبض الباب. وفي هذه الاختبارات، تفوق النظام الجديد مرة أخرى على الأساليب الرائدة المصممة للسرعة ذات الخطوة الواحدة؛ حيث حقق معدل نجاح متوسط قدره 88.4 بالمائة، متفوقاً بفارق كبير على أفضل نظام خطوة واحدة آخر. وأظهر هذا أن الطريقة كانت قوية بما يكفي للتعامل مع تعقيد الرؤية ثلاثية الأبعاد في العالم الحقيقي دون الحاجة إلى التحسين البطيء متعدد الخطوات الذي كان يُعتبر سابقاً ضرورياً لمثل هذه المهام الصعبة.
ومع ذلك، فإن الروبوت الذي يجيد تقليد العروض البشرية ليس دائماً جيداً في حل المشكلات الجديدة أو التعافي من الأخطاء. ولمعالجة ذلك، أضاف الباحثون مرحلة ثانية إلى إطار عملهم، مما يسمح للروبوت بالتعلم من خلال "التعلم المعزز عبر الإنترنت" (online reinforcement learning). وهذه عملية حيث يحسن الروبوت أداءه من خلال التفاعل مع البيئة وتلقي التغذية الراجعة حول نجاحه، بدلاً من مجرد نسخ الفيديوهات القديمة. وكان التحدي هنا هو أن خوارزميات التعلم القياسية تتطلب عادةً من النظام حساب احتمالية كل إجراء ممكن، وهو أمر صعب لمولدات الخطوة الواحدة السريعة هذه. وقد حل الفريق هذه المشكلة عبر إنشاء واجهة خاصة سمحت للروبوت بالتعلم من تجاربه مع الحفاظ على طبيعته السريعة ذات الخطوة الواحدة. ووجدوا أن هذا النهج سمح للروبوت بصقل مهاراته بفعالية، مما أدى إلى تحسين أدائه في المهام التي تم تدريبه عليها في البداية بناءً على العروض البشرية فقط.
أما الاختبار النهائي، فقد نقل النظام من محاكاة الكمبيوتر إلى روبوت مادي في مختبر حقيقي. لقد ثبتوا النظام على روبوت ثنائي الأذرع، يشبه الإنسان، وطلبوا منه القيام بمهام مثل رفع كتلة، وحمل علبة، ونقل الأشياء بين الذراعين. كان على الروبوت الاستجابة للمعلومات المرئية من الكاميرات في الوقت الفعلي، دون أي تدخل بشري. عمل النظام بمتوسط تأخير قدره 9.5 ميلي ثانية فقط من لحظة رؤية العالم إلى تحريك الذراع، وهي سرعة كافية للتحكم عالي التردد. وفي سلسلة من التجارب، نجح الروبوت في إكمال 123 من أصل 150 محاولة، بنسبة نجاح بلغت 82 بالمائة. وبالمقارنة، نجح أفضل نظام خطوة واحدة سابق في 89 من أصل 150 محاولة فقط، أي بنسبة 59 بالمائة. وكانت حالات الفشل التي حدثت ناتجة في الغالب عن مشكلات مادية مثل انزلاق الشيء أو اصطدام الذراعين، بدلاً من فشل نظام اتخاذ القرار نفسه.
يشير هذا العمل إلى أن المقايضة بين السرعة والذكاء في التحكم الروبوتي ليست ثابتة كما كان يُعتقد سابقاً. فمن خلال نقل عبء التحسين من لحظة الفعل إلى وقت التعلم، يمكن إنشاء وحدات تحكم روبوتية تتسم بالكفاءة العالية والسرعة الفائقة في آن واحد. لقد أثبت الباحثون أن الروبوت ليس بحاجة لقضاء الوقت في التفكير في خياراته خطوة بخطوة لاتخاذ قرار جيد؛ بل يمكنه تعلم اتخاذ القرار الصحيح فوراً. وهذا يفتح الباب أمام روبوتات يمكنها العمل بسرعة ردود الفعل البشرية، والتعلم والتكيف في الوقت الفعلي مع البيئات المعقدة وغير المتوقعة في عالمنا. وقد أتاح الباحثون الكود البرمجي لهذا النظام الجديد لمجتمع البحث العلمي، مما يسمح للمجتمع بالبناء على هذا الأساس من التحكم التوليدي السريع.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.