← नवीनतम पेपर
🤖 machine learning

Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning

यह शोध पत्र SC-SDPO को प्रस्तुत करता है, जो सेल्फ-डिस्टिलेशन पॉलिसी ऑप्टिमाइज़ेशन का एक नवीन संस्करण है जो प्रशिक्षण प्रश्नों को उनके अनुमानित पास-रेट वेरिएंस के वर्गमूल द्वारा गतिशील रूप से भारित करता है ताकि अंतर्निहित रूप से एक कठिनाई-जागरूक पाठ्यक्रम बनाया जा सके, जिससे तर्क और टूल-उपयोग बेंचमार्क पर स्थिर प्रशिक्षण गतिकी बनाए रखते हुए निरंतर प्रदर्शन लाभ प्राप्त किया जा सके।

मूल लेखक: Zehao Liu, Yuanpu Cao, Jinghui Chen, Vasant G. Honavar

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zehao Liu, Yuanpu Cao, Jinghui Chen, Vasant G. Honavar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: एक रोबोट को बेहतर सोचने के लिए सिखाना

कल्पना कीजिए कि आप एक बहुत ही स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल) को कठिन पहेलियाँ, जैसे गणित के सवाल या विज्ञान के प्रश्न, हल करने के लिए प्रशिक्षित कर रहे हैं। आप चाहते हैं कि रोबोट तर्क करने (reasoning) में बेहतर हो जाए।

वर्तमान में, इस रोबोट को सिखाने के दो मुख्य तरीके हैं, और दोनों में एक कमी है:

  1. "पास/फेल" कोच (GRPO): यह कोच रोबोट को एक पहेली के 8 प्रयास देता है। यदि रोबोट 4 सही और 4 गलत करता है, तो कोच कहता है, "बहुत अच्छा! तुम बीच के क्षेत्र (middle zone) में हो; चलो इससे सीखते हैं।" लेकिन यदि रोबोट के सभी 8 प्रयास सही या सभी 8 गलत होते हैं, तो कोच कहता है, "यहाँ सीखने के लिए कुछ नहीं है," और फीडबैक देना बंद कर देता है।

    • कमी: यह कोच यह जानने में बहुत अच्छा है कि सीखने के लिए कौन सी पहेलियाँ सही कठिनाई वाली हैं (जिसे "स्वीट स्पॉट" कहा जाता है), लेकिन यह उत्तर के हर एक शब्द के साथ एक जैसा व्यवहार करता है। यह रोबोट को यह नहीं बताता कि कौन सा विशिष्ट शब्द गलत था।
  2. "स्व-शिक्षक" कोच (SDPO): यह कोच अधिक स्मार्ट है। यह रोबोट के उत्तर को देखता है और कहता है, "तुमने सही उत्तर दिया, लेकिन तुमने यहाँ गलत शब्द का उपयोग किया। चलो उस विशिष्ट शब्द को ठीक करते हैं।" यह शब्द-दर-शब्द विस्तृत फीडबैक देता है।

    • कमी: यह कोच शब्दों को ठीक करने में इतना केंद्रित हो जाता है कि यह भूल जाता है कि पहेली कितनी कठिन थी। यह उस पहेली के साथ भी वैसा ही व्यवहार करता है जिसे रोबोट ने 100% सही हल किया है, जैसा कि उस पहेली के साथ जिसे रोबोट 100% गलत हल करता है। यह उन पहेलियों को "सिखाने" में समय बर्बाद करता है जिन्हें रोबोट पहले ही मास्टर कर चुका है या जो वर्तमान में असंभव हैं।

समस्या: "स्वीट स्पॉट" गायब है

लेखकों ने महसूस किया कि सबसे अच्छा सीखना "स्वीट स्पॉट" में होता है: ऐसी पहेलियाँ जहाँ रोबोट 50% सही और 50% गलत होता है।

  • यदि रोबोट सब कुछ सही करता है, तो वह ऊब जाता है (सीखने के लिए कुछ नहीं)।
  • यदि वह सब कुछ गलत करता है, तो वह भ्रमित हो जाता है (सीखने के लिए कुछ नहीं)।
  • यदि वह बीच में है, तो वह सबसे अधिक सीख रहा है।

"पास/फेल" कोच स्वाभाविक रूप से इस स्वीट स्पॉट पर ध्यान केंद्रित करता है। "स्व-शिक्षक" कोच इसे अनदेखा कर देता है। लेखक "स्व-शिक्षक" की शब्द-स्तर की विस्तृत जानकारी को "पास/फेल" कोच की कठिनाई जागरूकता के साथ जोड़ना चाहते थे।

समाधान: SC-SDPO ("गोल्डिलॉक्स" वेटिंग)

लेखकों ने एक नई विधि बनाई जिसे SC-SDPO कहा जाता है। इसे स्व-शिक्षक के फीडबैक में एक साधारण वॉल्यूम नॉब (आवाज़ कम-ज्यादा करने वाला बटन) जोड़ने के रूप में समझें।

यह इस प्रकार काम करता है:

  1. स्कोर की जाँच करें: रोबोट द्वारा एक पहेली को 8 बार आज़माने के बाद, सिस्टम जाँचता है: "उसने कितनी बार इसे सही किया?"
  2. वॉल्यूम को एडजस्ट करें:
    • यदि रोबोट ने इसे 0 बार सही किया या 8 बार सही किया (बहुत आसान या बहुत कठिन), तो सिस्टम वॉल्यूम को जीरो (शून्य) तक कम कर देता है। "यहाँ समय बर्बाद न करें।"
    • यदि रोबोट ने इसे लगभग 4 बार सही किया (स्वीट स्पॉट), तो सिस्टम वॉल्यूम को अधिकतम (मैक्सिमम) तक बढ़ा देता है। "यहाँ पूरी एकाग्रता से ध्यान दें!"
  3. गुप्त नुस्खा (गणित): लेखकों ने यह गणना करने के लिए कुछ गणित किया कि वॉल्यूम को कितना बढ़ाना है। उन्होंने पाया कि केवल "वेरिएंस" (एक फैंसी शब्द जिसका अर्थ है मिश्रित परिणाम) के आधार पर वॉल्यूम बढ़ाना पूरी तरह सही नहीं था। उन्होंने पाया कि एक विशिष्ट गणितीय वक्र (वर्गमूल का उपयोग करके) सबसे अच्छा काम करता है। यह सुनिश्चित करता है कि रोबोट एक स्थिर, निरंतर गति से सीखे बिना अभिभूत हुए या बिना उत्तेजना के।

यह विशेष क्यों है: "फ्री लंच" (मुफ्त का लाभ)

आमतौर पर, यह जानने के लिए कि पहेली कितनी कठिन है, आपको रोबोट का अलग से परीक्षण करना पड़ता है, जिसमें अतिरिक्त समय और पैसा लगता है।

लेकिन यह नई विधि चतुर है: इसे यह जानकारी मुफ्त में मिल जाती है।
क्योंकि रोबोट अपने सामान्य प्रशिक्षण के दौरान पहेली को 8 बार आज़मा ही रहा है, सिस्टम बस उन परिणामों को देखकर वॉल्यूम नॉब की सेटिंग तय करता है। इसे किसी अतिरिक्त काम की आवश्यकता नहीं है। यह एक शिक्षक द्वारा छात्र के होमवर्क को ग्रेड देने और तुरंत यह महसूस करने जैसा है, "ओह, यह छात्र इस विशिष्ट प्रकार की समस्या के साथ संघर्ष कर रहा है," बिना किसी अलग टेस्ट के।

परिणाम: क्या यह काम करता है?

उन्होंने दो अलग-अलग रोबोट दिमागों (Qwen और OLMo) पर विज्ञान के सवालों और टूल-यूज़ कार्यों का परीक्षण किया।

  • विजेता: नई विधि (SC-SDPO) ने पुराने स्व-शिक्षक पद्धति को लगातार मात दी।
  • लाभ: Qwen मॉडल पर, इसने औसत रूप से लगभग 3 से 4 अंक का सुधार किया। OLMo मॉडल पर, इसने लगभग 2 से 3 अंक का सुधार किया।
  • स्थिरता: प्रशिक्षण सुचारू रहा। रोबोट भ्रमित या अनियंत्रित नहीं हुआ; वह बस अधिक कुशलता से सीख गया।

सारांश उपमा (Analogy)

कल्पना कीजिए कि आप एक संगीत शिक्षक हैं।

  • पुरानी विधि (SDPO): आप छात्र द्वारा बजाए गए हर गलत नोट को सुधारते हैं, चाहे वह कोई ऐसा गाना हो जिसे वह पहले से ही पूरी तरह जानता है या कोई ऐसा गाना जिसे वह पढ़ भी नहीं सकता। आप उन गानों के नोट्स सुधारने में समय बर्बाद करते हैं जिन्हें उन्होंने मास्टर कर लिया है।
  • नई विधि (SC-SDPO): आप छात्र को सुनते हैं। यदि वह एक ऐसा गाना बजा रहा है जिसे वह पूरी तरह जानता है, तो आप कहते हैं, "अच्छा काम, आगे बढ़ो।" यदि वह एक ऐसा गाना बजा रहा है जिसे वह पढ़ नहीं सकता, तो आप कहते हैं, "फिलहाल इसे छोड़ दें।" लेकिन यदि वह एक ऐसा गाना बजा रहा है जहाँ उसे आधे नोट्स सही मिलते हैं, तो आप कहते हैं, "रुको! यह अभ्यास के लिए एकदम सही गाना है। आइए इन विशिष्ट नोट्स को ठीक करते हैं।"

यह पेपर सिद्ध करता है कि केवल "परफेक्टली डिफिकल्ट" (बिल्स सटीक कठिन) गानों पर अपनी ऊर्जा केंद्रित करके, छात्र तेजी से सीखता है और समग्र रूप से एक बेहतर संगीतकार बनता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →