Recursive Value Learning for Long-Horizon Offline Goal-Conditioned RL
تقترح الورقة البحثية طريقة DCRL (التعلم التعزيزي القائم على مبدأ فرق تسد)، وهي طريقة تعلّم تعزيزي غير متصل (offline) تعتمد على الأهداف وتعمل بشكل تكراري، حيث تقوم بتفكيك المسارات إلى أشجار ثنائية متوازنة لتقليل عمق التمهيد (bootstrap depth) وتراكم الخطأ، مما يؤدي إلى تفوقها بشكل كبير على النماذج المرجعية المسطحة والهرمية الحالية في المهام ذات الآفاق الطويلة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الذكاء الاصطناعي، هناك تحدٍ محدد يُعرف باسم "التعلم المشروط بالهدف". تخيل تعليم روبوت ليس فقط كيف يمشي، بل كيف يمشي نحو كرسي معين، أو باب معين، أو مفتاح ضوء معين، باستخدام مكتبة فقط من الفيديوهات السابقة لروبوتات أخرى تتحرك حولها. يجب على الروبوت النظر إلى هذه التسجيلات القديمة، وفهم كيفية الانتقال من النقطة (أ) إلى النقطة (ب)، ثم محاولة القيام بذلك بنفسه. يعمل هذا بشكل جيد للرحلات القصيرة؛ فإذا كانت الرحلة على بعد خطوات قليلة فقط، يمكن للروبوت بسهولة ربط النقاط ببعضها. ولكن عندما تكون الرحلة طويلة — تتطلب مئات أو آلاف الخطوات للوصول إلى وجهة بعيدة — فإن الروبوت غالباً ما يضل طريقه. فهو يعاني في تذكر بداية المسار أثناء محاولته التخطيط للنهاية، كما أن الأخطاء الصغيرة في ذاكرته للخطوات القصيرة تتراكم لتصبح أخطاءً جسيمة بحلول الوقت الذي يصل فيه إلى الهدف.
يصبح هذا المشكل أكثر صعوبة عندما لا يستطيع الروبوت التعلم عن طريق تجربة الأشياء في العالم الحقيقي. ففي العديد من السيناريوهات الواقعية، مثل تشغيل الآلات الثقيلة أو التنقل في مصنع معقد، يكون ارتكاب الأخطاء خطيراً للغاية أو مكلفاً للغاية. يجب على الروبوت أن يتعلم بالكامل من مجموعة بيانات ثابتة من التجارب السابقة، وهو مجال يُعرف باسم "التعلم التعزيزي غير المتصل" (offline reinforcement learning). لقد أدرك الباحثون منذ فترة طويلة أنه لكي تحل رحلة طويلة، يجب أن تفهم الأجزاء القصيرة التي تتكون منها. ومع ذلك، فإن الطرق القياسية لتعليم الروبوتات من هذه المجموعات البيانية الثابتة غالباً ما تحاول تعلم الرحلة بأكملها دفعة واحدة، أو تنتقل عشوائياً بين الأجزاء القصيرة والطويلة. هذا النهج يشبه محاولة قراءة كتاب عبر تقليب صفحات عشوائية؛ حيث ينتهي الأمر بالروبوت وهو يخمن معنى فصل كامل بناءً على جملة لم يفهمها تماماً بعد، مما يؤدي إلى الارتباك والفشل.
قام فريق من الباحثين من جامعة يونسي وجامعة سيول الوطنية باقتراح طريقة جديدة لتعليم هذه الروبوتات، تسمى DCRL. بدلاً من تخمين المسار بأكمله دفعة واحدة، يقوم نهجهم بتفكيك كل رحلة طويلة إلى تسلسل هرمي منظم خطوة بخطوة، تماماً مثل تنظيم مهمة كبيرة من خلال إتقان أصغر القطع أولاً ثم دمجها. قام الباحثون بأخذ مسار طويل من مجموعة بيانات وقسموه إلى نصفين بالضبط، ثم قسموا تلك الأنصاف إلى أنصاف مرة أخرى، واستمروا في هذه العملية حتى وصلوا إلى الخطوات المنفردة. ثم علموا الروبوت فهم هذه الحركات الصغيرة والمنفردة أولاً. وبمجرد أن أصبح الروبوت واثقاً بشأن هذه الخطوات الصغيرة، استخدم ذلك المعرفة لفهم الأجزاء الأطول قليلاً، ثم الأجزاء الأطول، لبناء فهمه من القاعدة إلى القمة. تضمن استراتيجية "فرق تسد" هذه أن الروبوت لن يحاول أبداً تعلم مسار طويل ومعقد إلا بعد أن يكون قد أتقن بالفعل المسارات الأقصر التي يتكون منها.
وجد الباحثون أن هذا النهج المنظم حل مشكلة رئيسية عانت منها الأساليب السابقة. أولاً، منع الروبوت من تقديم تخمينات متفائلة. كانت الأساليب القديمة تنظر في العديد من النقاط الوسيطة الممكنة وتختار أفضلها، على أمل العثور على طريق مختصر. ولكن بسبب محدودية البيانات، كان الروبوت غالباً ما يختار نقطة تبدو جيدة فقط بسبب خطأ في ذاكرته، ومن ثم يبني خطته بأكملها على هذا الخطأ. يتجنب النهج الجديد ذلك من خلال اتباع المسار الفعلي الموضح في البيانات بصرامة، وتقسيمه عند المنتصف تماماً، وتعلم قيمة ذلك المسار المحدد دون تخمين.
عند اختبار هذا النهج الجديد على مجموعة متنوعة من المهام الصعبة، بما في ذلك توجيه روبوت بشري عملاق عبر متاهة أو حل ألغاز معقدة، تفوق هذا النهج على جميع الأساليب السابقة. وفي أكثر خمس مهام طويلة المدى تحدياً في معيار الاختبار الخاص بهم، رفع النهج الجديد متوسط درجة النجاح من 55 إلى 64، متفوقاً حتى على الأنظمة الهرمية الأكثر تعقيداً التي كانت تعتبر سابقاً هي الأفضل في مجالها. وفي اختبار محدد يتضمن روبوتاً بشرياً في متاهة ضخمة، حقق النهج الجديد معدل نجاح قدره 93 بالمئة، بينما حققت الطريقة التالية الأفضل 79 بالمئة فقط. كما أظهرت النتائج كفاءة عالية في بيئة CALVIN، حيث نجح النهج في إكمال أربع مهام فرعية متتالية. ولعل الأمر الأكثر إثارة للإعجاب هو أنه في مهمة تتعلق بمكعب يتطلب ثماني حركات منفصلة لحله، كان النهج الجديد هو الوحيد الذي استطاع إكمال المهمة بنجاح، محققاً نسبة نجاح 5 بالمئة بينما فشلت جميع الطرق الأخرى تماماً.
اكتشف الباحثون أيضاً أن الترتيب الذي تعلم به الروبوت كان لا يقل أهمية عن الطريقة نفسها. فبينما تستخدم الطرق السابقة أسلوب التعلم بترتيب عشوائي (scrambled-order learning)، يبرز نهج DCRL أهمية التعلم المنظم. تشير الدراسة إلى أنه من خلال احترام الاعتماد الطبيعي للرحلات الطويلة على الخطوات القصيرة، ومن خلال تنظيم عملية التعلم ليعكس هذا الاعتماد، يمكن للروبوتات تعلم التنقل في مسارات أطول وأكثر تعقيداً من أي وقت مضى. لا يقدم هذا العمل مجرد خوارزمية جديدة؛ بل يوفر فهماً أوضح لكيفية توسيع نطاق الذكاء الاصطناعي للتعامل مع المهام الطويلة والمعقدة التي تحدد معالم العالم الحقيقي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.