TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment
यह शोध पत्र TRACE का प्रस्ताव करता है, जो एक टोकन-रूटेड सेल्फ-डिस्टिलेशन विधि है जो सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) के दौरान एनोटेटर द्वारा चिह्नित महत्वपूर्ण स्पैन (critical spans) पर चुनिंदा रूप से KL डाइवर्जेंस लागू करती है, जिससे ग्रेडिएंट बर्बादी और विशेषाधिकार प्राप्त सूचना रिसाव (privileged-information leakage) को कम किया जाता है, जिससे मानक GRPO और फुल-रिस्पॉन्स सेल्फ-डिस्टिलेशन बेसलाइनों की तुलना में लॉन्ग-हॉरइजन मैथ रीजनिंग और आउट-ऑफ-डिस्ट्रीब्यूशन जनरलाइजेशन में महत्वपूर्ण सुधार होता है।