← أحدث الأبحاث
🤖 machine learning

COOPO: Cyclic Offline-Online Policy Optimization Algorithm

يُعدُّ COOPO إطار عمل هجينًا عامًا للتعلم التعزيزي يتناوب بين التدريب غير المتصل (offline) المنظم بـ KL والضبط الدقيق المتصل (online)، وذلك للتخفيف من حدة الانزياح التوزيعي والنسيان الكارثي، مما يحقق كفاءة عينة وأداءً فائقين على معايير D4RL مقارنة بالأسالهم المتقدمة.

المؤلفون الأصليون: Qisai Liu, Zhanhong Jiang, Joshua Russell Waite, Aditya Balu, Cody Fleming, Soumik Sarkar

نُشر 2026-05-19
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Qisai Liu, Zhanhong Jiang, Joshua Russell Waite, Aditya Balu, Cody Fleming, Soumik Sarkar

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيف يمشي بشكل مثالي. لديك طريقتان رئيسيتان للقيام بذلك، ولكن لكل منهما مشكلة كبيرة.

الطريقتان الإشكاليتان

  1. طريقة "التعلم عبر الإنترنت الصرف" (التجربة والخطأ): تترك الروبوت يتعلم من خلال المشي في العالم الحقيقي، فيسقط، ثم ينهض، ثم يحاول مجددًا.
    • المشكلة: هذا يستغرق وقتًا طويلاً للغاية. قد يحتاج الروبوت إلى السقوط ملايين المرات ليتعلم الطريقة الصحيحة. الأمر يشبه محاولة تعلم ركوب الدراجة عن طريق إلقاء نفسك على الأسفلت باستمرار حتى تفهم الأمر. إنه أمر خطير وبطيء للغاية.
  2. طريقة "التعلم دون اتصال بالإنترنت الصرف" (دراسة كتاب مدرسي): تعطي الروبوت مكتبة فيديو ضخمة لمشاة خبراء وتطلب منه التعلم فقط من هذه الفيديوهات. هو لا يلمس العالم الحقيقي أبدًا.
    • المشكلة: يصبح الروبوت خبيرًا نظريًا لكنه فاشل عمليًا. عندما يحاول أخيرًا المشي في العالم الحقيقي، يصاب بالارتباك لأن العالم الحقيقي مختلف قليلاً عن الفيديوهات. قد ينسى ما تعلمه أو يحاول القيام بأشياء تبدو جيدة في الفيديو ولكنها تسبب سقوطه فورًا.

المحاولة الهجينة القديمة

حاول العلماء الجمع بينهما: "دعونا ندرس الفيديوهات أولاً، ثم نذهب للممارسة في الواقع".

  • العيب: بمجرد أن يبدأ الروبوت في الممارسة في العالم الحقيقي، يصبح متحمسًا، ويجرب أشياء جديدة، و"ينسى" بالخطأ كل ما درسه في الفيديوهات. يُسمى هذا النسيان الكارثي. إنه مثل دراسة اختبار الرياضيات، ثم الذهاب إلى حفلة، وبحلول وقت الاختبار، تكون قد نسيت كيفية الجمع.

الحل الجديد: COOPO

يقدم المؤلفون في هذه الورقة البحثية COOPO (تحسين السياسة الدوري عبر التعلم دون اتصال وبالتفاعل المباشر). فكر في هذا ليس كخط مستقيم، بل كـ حلقة.

إليك كيف يعمل COOPO، باستخدام تشبيه بسيط:

تخيل أنك تتدرب على ماراثون.

  • مرحلة "التعلم دون اتصال" (المكتبة): تقضي وقتًا في دراسة خريطة ومشاهدة فيديوهات لعدائين نخبة. تحفظ المسار والشكل المثالي.
  • مرحلة "التعلم عبر الإنترنت" (المضمار): تذهب وتجري بعض الدورات. تشعر بالرياح، والتضاريس، وعضلاتك.
  • سحر "الدورية": في الطرق القديمة، كنت تدرس مرة واحدة، ثم تجري لمدة شهر، ثم تدرك أنك نسيت الخريطة.
    • COOPO يقول: "توقف! عد إلى المكتبة."
    • تجري لفترة، ثم تعود إلى الفيديوهات لترسيخ ذاكرتك مجددًا. تتحقق من: "هل ابتعدت كثيرًا عن شكل الخبير؟" إذا فعلت ذلك، فإن الفيديوهات ستعيدك بلطف إلى المسار الآمن والمثبت.
    • ثم تعود إلى المضمار لتجري قليلاً أكثر.

لماذا هذا مميز؟

  1. يمنع "الانحراف": في كل مرة يبدأ فيها الروبوت (أو العداء) في التصرف بغرابة أو بشكل خطير في العالم الحقيقي، يقوم النظام بعمل "مراجعة للواقع" مقابل البيانات الخبيرة والآمنة. إنه يشبه نظام تحديد المواقع (GPS) الذي يذكرك باستمرار: "أنت خارج المسار الآمن، عد إلى الطريق الرئيسي".
  2. يوفر الوقت: لأن الروبوت يستمر في إعادة قراءة "الكتاب المدرسي" (البيانات التي تم جمعها مسبقًا)، فإنه لا يحتاج إلى السقوط ملايين المرات ليتعلم. إنه يعيد استخدام البيانات القديمة مرارًا وتكرارًا، مما يجعل عملية التعلم أسرع بكثير.
  3. إنه آمن: في العالم الحقيقي (مثل السيارات ذاتية القيادة أو روبوتات المصانع)، لا يمكنك تحمل أن "يجرب" الروبوت أشياءً عشوائية ويتحطم. يضمن COOPO بقاء الروبوت قريبًا من السلوكيات الآمنة والمثبتة مع الاستمرار في التحسن.

النتائج

اختبرت الورقة البحثية هذا على محاكيات حاسوبية لروبوتات (مثل حيوان الشيتة، والـ hopper، والـ walker).

  • الأداء: تعلم COOPO المشي بشكل أفضل وأسرع من الطرق الأخرى.
  • الكفاءة: احتاج إلى عدد أقل بكثير من المحاولات في "العالم الحقيقي" (التفاعلات) للوصول إلى مستوى عالٍ من المهارة مقارنة بالطرق القياسية.
  • الاستقرار: لم ينسَ ما تعلمه. حتى بعد دورات عديدة من الجري والدراسة، حافظ على المعرفة الأساسية من البيانات الخبيرة الأصلية.

باختاًصر

COOPO هو حلقة تدريب تقول: "تعلم من الخبراء، جرب ذلك، عد وتعلم من الخبراء مجددًا، جرب ذلك مرة أخرى". هذه الدورة المستمرة تمنع المتعلم من نسيان الأساسيات أو الخروج عن المسار، مما يجعلها طريقة أكثر أمانًا وسرعة لتعليم الآلات كيف تعمل في العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →