Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration
تقترح هذه الورقة البحثية "معايرة المعامل الأمثل" (OCC)، وهي مخطط تكيفي مستمد من تحليل استمثالي لتفاعلات التدرج، لتمكين التدريب المشترك الفعال بين "التنبؤ متعدد الرموز" و"التعلم التعزيزي من المكافآت القابلة للتحقق"، وذلك للتغلب على تدهور الأداء السابق وتحقيق نتائج متفوقة في معايير اختبار الاستدلال الرياضي.