Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards
تقدم هذه الورقة البحثية VIP، وهي استراتيجية تخصيص تنبؤي معلوماتي للتباين (Variance-Informed Predictive allocation) تعمل على تحسين توزيع عمليات التدحرج (rollout distribution) عبر مطالبات التدريب ديناميكيًا باستخدام تقدير التباين القائم على العمليات الغاوسية لتقليل تباين التدرج وتحسين كفاءة أخذ العينات بشكل كبير في التعلم التعزيزي عبر الإنترنت مع مكافآت قابلة للتحقق.