Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning
تقترح هذه الورقة "E2H Reasoner"، وهي طريقة للتعلم التعزيزي القائم على المنهج الدراسي تقوم بجدولة المهام من السهل إلى الصعب لتحسين قدرات الاستنتاج لدى النماذج اللغوية الصغيرة، مقدمةً بذلك ضمانات تقارب نظرية وأدلة تجريبية على أداء متفوق مقارنة بنهج التعلم التعزيزي القياسية.