How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum
यह शोध पत्र एक टैलिस लॉस निरंतरता (Tsallis loss continuum) प्रस्तुत करता है जो रीजनिंग मॉडल्स में कोल्ड-स्टार्ट स्टालिंग (cold-start stalling) को हल करने के लिए सुदृढीकरण शिक्षण (reinforcement learning) और घनत्व अनुमान (density estimation) के बीच मध्यस्थता करता है, जिसमें दो व्यावहारिक अनुमानकों (GARL और PAFT) का प्रस्ताव दिया गया है जो कम सफलता की संभावनाओं से बाहर निकलने की गति और प्रशिक्षण स्थिरता के बीच संतुलन बनाकर जटिल रीजनिंग बेंचमार्क पर GRPO जैसे मानक तरीकों से काफी बेहतर प्रदर्शन करते हैं।