← नवीनतम पेपर
💬 NLP

Bridging Reasoning Trajectories in On-Policy Distillation via Near-Future Guidance

यह शोध पत्र ट्रैजेक्टरी-अवेयर ऑन-पॉलिसी डिस्टिलेशन (TOPD) का प्रस्ताव करता है, जो एक ऐसी विधि है जो वास्तविक तर्क संबंधी विचलन (reasoning divergences) को सतही स्तर के टोकन बेमेल (token mismatches) से अलग करने और कई टोकनों में मार्गदर्शन वितरित करने के लिए निकट-भविष्य की ट्रैजेक्टरी जानकारी का लाभ उठाती है, जिससे मानक टोकन-स्तरीय OPD की तुलना में छात्र मॉडल के तर्क प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Yuxuan Jiang, Francis Ferraro

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxuan Jiang, Francis Ferraro

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र ("स्टूडेंट मॉडल") को जटिल गणितीय समस्याओं को हल करना सिखा रहे हैं, यह देखते हुए कि एक जीनियस ट्यूटर ("टीचर मॉडल") उन्हें कैसे हल करता है। लक्ष्य छात्र को केवल अंतिम उत्तर नहीं, बल्कि उस तक पहुँचने का मार्ग सिखाना है।

यह शोध पत्र एक नई शिक्षण पद्धति पेश करता है जिसे TOPD (ट्रैजेक्टरी-अवेयर ऑन-पॉलिसी डिस्टिलेशन) कहा जाता है, जो एक विशिष्ट समस्या को ठीक करने के लिए बनाया गया है कि वर्तमान में AI मॉडल्स को कैसे सिखाया जा रहा है।

पुराना तरीका: "स्पॉट द टाइपो" (टाइपो पकड़ने वाला) जाल

वर्तमान में, मानक शिक्षण विधि (जिसे OPD कहा जाता है) एक सख्त संपादक की तरह काम करती है जो एक समय में केवल एक शब्द को देखता है।

  • यह कैसे काम करता है: छात्र एक समस्या को हल करने की कोशिश करता है। यदि छात्र एक ऐसा शब्द लिखता है जो शिक्षक नहीं लिखता, तो सिस्टम इसे एक "हाई-लॉस" त्रुटि के रूप में चिह्नित करता है और केवल उसी एक शब्द को सुधारने का प्रयास करता है।
  • समस्या: शोध पत्र का तर्क है कि यह एक सड़क यात्रा के दौरान गलत मोड़ को केवल उस सड़क का नाम बदलकर ठीक करने जैसा है जिस पर आप वर्तमान में हैं, बिना यह देखे कि आगे वह सड़क वास्तव में कहाँ जाती है।

लेखकों ने इस "एक-समय-में-एक-शब्द" वाले दृष्टिकोण में दो प्रमुख खामियां पाई हैं:

  1. गलत अलार्म (शैली बनाम तर्क का मिश्रण):
    कभी-कभी, शिक्षक और छात्र एक शब्द पर असहमत होते हैं, लेकिन इससे अंतिम उत्तर पर कोई फर्क नहीं पड़ता।
  • उपमा: कल्पना करें कि शिक्षक लिखता है, "फिर, हम गणना करते हैं..." और छात्र लिखता है, "और, हम गणना करते हैं..." सिस्टम चिल्लाता है "त्रुटि!" क्योंकि शब्द "फिर" के बजाय "और" है। लेकिन वास्तव में, दोनों मार्ग बिल्कुल एक ही समाधान की ओर ले जाते हैं। सिस्टम हानिरहित शैलीगत अंतरों को सुधारने में समय बर्बाद करता है, जो वास्तव में छात्र को भ्रमित करता है। शोध पत्र ने पाया कि इनमें से लगभग 30% "त्रुटियां" केवल हानिरहित शैलीगत विसंगतियां थीं।
  1. "टोकन-दर-टोकन" का जाल:
    भले ही छात्र वास्तव में कोई तार्किक त्रुटि करता है, केवल उस एक शब्द को सुधारना अक्सर पर्याप्त नहीं होता है।
  • उपमा: कल्पना करें कि छात्र गाड़ी चला रहा है और सड़क के चौराहे पर गलत मोड़ ले लेता है। शिक्षक कहता है, "नहीं, बाएं जाओ!" छात्र बाएं मुड़ता है (तत्काल त्रुटि को सुधारते हुए)। लेकिन क्योंकि छात्र ने मानचित्र को नहीं समझा था, वह अगले चौराहे पर तुरंत दूसरा गलत मोड़ ले लेता है।
  • पुराना तरीका एक बार में एक शब्द को सुधारता रहता है, लेकिन छात्र लगातार सही रास्ते से भटकता रहता है क्योंकि वह समग्र दिशा को नहीं सीख पा रहा है। वह छोटी-छोटी गलतियों को सुधारने के चक्र में फंसा रहता है जबकि पूरी यात्रा ही गलत दिशा में जा रही होती है।

नया तरीका: TOPD (द "जीपीएस नेविगेटर")

लेखक TOPD प्रस्तावित करते हैं, जो शिक्षण शैली को "शब्द संपादक" से बदलकर "जीपीएस नेविगेटर" कर देता है।

केवल वर्तमान शब्द को देखने के बजाय, TOPD अगले 50 शब्दों (भविष्य की एक छोटी खिड़की) को देखता है ताकि यह देखा जा सके कि क्या छात्र वास्तव में पटरी से उतर रहा है।

  • चरण 1: केवल साइनपोस्ट नहीं, बल्कि मानचित्र देखें।
    एक शब्द को सुधारने से पहले, सिस्टम सिमुलेट करता है: "यदि छात्र यहाँ से जारी रखता है, तो वे कहाँ पहुँचेंगे?"

  • यदि छात्र का भविष्य का मार्ग शिक्षक के मार्ग से बहुत अलग है, तो यह एक वास्तविक त्रुटि है।

  • यदि छात्र का भविष्य का मार्ग समान है (भले ही वर्तमान शब्द अलग हो), तो यह एक गलत अलार्म है, और सिस्टम इसे अनदेखा कर देता है।

  • चरण 2: पूरी यात्रा का मार्गदर्शन करें।
    एक बार वास्तविक त्रुटि मिलने पर, TOPD केवल यह नहीं कहता, "इस शब्द को बदलें।" यह कहता है, "इस शब्द को बदलें और अपने पथ को अगले 50 शब्दों के लिए समायोजित करें ताकि आप शिक्षक के मार्ग पर बने रहें।"

  • उपमा: ड्राइवर को केवल बाएं मुड़ने के लिए कहने के बजाय, जीपीएस अगले 10 मील के लिए पूरे मार्ग की पुनर्गणना करता है ताकि वह हाईवे पर बना रहे।

परिणाम

शोधकर्ताओं ने इसका परीक्षण कठिन गणित प्रतियोगिताओं (जैसे AIME) पर किया।

  • मानक विधि (OPD): लगभग 47.8% समस्याओं को सही हल कर पाई।
  • नई विधि (TOPD): लगभग 52.2% समस्याओं को सही हल कर पाई।

हालांकि 4% की वृद्धि छोटी लग सकती है, लेकिन उन्नत गणित की दुनिया में, यह एक बहुत बड़ी छलांग है। यह सिद्ध करता है कि मॉडल को तर्क के प्रवाह को समझने के लिए सिखाना, व्यक्तिगत शब्दों को सुधारने की तुलना में बहुत अधिक प्रभावी है।

सारांश

शोध पत्र का दावा है कि AI तर्क इसलिए विफल नहीं होता क्योंकि शब्द खराब हैं, बल्कि इसलिए विफल होता है क्योंकि पथ भटक रहा है (ड्रिफ्टिंग पाथ्स)। पुराना तरीका पथ को व्यक्तिगत पत्थरों को जोड़ने से ठीक करने की कोशिश करता है; नया तरीका (TOPD) यह देखता है कि पथ कहाँ जा रहा है और छात्र को पूरी यात्रा के दौरान सही सड़क पर रहने के लिए मार्गदर्शन करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →