Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR
تقدم هذه الورقة NudgeRL، وهو إطار عمل يعزز التعلم التعزيزي بالمكافآت القابلة للتحقق (RLVR) من خلال توظيف استكشاف موجه بالاستراتيجية ومدفوع بالتنوع لتحسين قدرات الاستنتاج بكفاءة في اختبارات الرياضيات المرجعية دون الاعتماد على الإشراف من قِبل "أوراكل" المكلف أو التوسع بالقوة الغاشمة.