COOPO: Cyclic Offline-Online Policy Optimization Algorithm
يُعدُّ COOPO إطار عمل هجينًا عامًا للتعلم التعزيزي يتناوب بين التدريب غير المتصل (offline) المنظم بـ KL والضبط الدقيق المتصل (online)، وذلك للتخفيف من حدة الانزياح التوزيعي والنسيان الكارثي، مما يحقق كفاءة عينة وأداءً فائقين على معايير D4RL مقارنة بالأسالهم المتقدمة.