TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training
TurnOPD एक नवीन ऑन-पॉलिसी डिस्टिलेशन फ्रेमवर्क है जो एडेप्टिव रोलआउट-डेप्थ बजटिंग और प्रोग्रेसिव टर्न-नॉर्मलाइज्ड लॉस वेटिंग को पेश करके लॉन्ग-होरइजन लैंग्वेज एजेंट्स के प्रशिक्षण की दक्षता को बढ़ाता है, ताकि वे वैनिला OPD में निहित संसाधन अपव्यय और प्रशिक्षण असंतुलन को दूर कर सकें।