Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning
यह शोध पत्र SC-SDPO को प्रस्तुत करता है, जो सेल्फ-डिस्टिलेशन पॉलिसी ऑप्टिमाइज़ेशन का एक नवीन संस्करण है जो प्रशिक्षण प्रश्नों को उनके अनुमानित पास-रेट वेरिएंस के वर्गमूल द्वारा गतिशील रूप से भारित करता है ताकि अंतर्निहित रूप से एक कठिनाई-जागरूक पाठ्यक्रम बनाया जा सके, जिससे तर्क और टूल-उपयोग बेंचमार्क पर स्थिर प्रशिक्षण गतिकी बनाए रखते हुए निरंतर प्रदर्शन लाभ प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य चित्र: एक रोबोट को बेहतर सोचने के लिए सिखाना
कल्पना कीजिए कि आप एक बहुत ही स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल) को कठिन पहेलियाँ, जैसे गणित के सवाल या विज्ञान के प्रश्न, हल करने के लिए प्रशिक्षित कर रहे हैं। आप चाहते हैं कि रोबोट तर्क करने (reasoning) में बेहतर हो जाए।
वर्तमान में, इस रोबोट को सिखाने के दो मुख्य तरीके हैं, और दोनों में एक कमी है:
"पास/फेल" कोच (GRPO): यह कोच रोबोट को एक पहेली के 8 प्रयास देता है। यदि रोबोट 4 सही और 4 गलत करता है, तो कोच कहता है, "बहुत अच्छा! तुम बीच के क्षेत्र (middle zone) में हो; चलो इससे सीखते हैं।" लेकिन यदि रोबोट के सभी 8 प्रयास सही या सभी 8 गलत होते हैं, तो कोच कहता है, "यहाँ सीखने के लिए कुछ नहीं है," और फीडबैक देना बंद कर देता है।
- कमी: यह कोच यह जानने में बहुत अच्छा है कि सीखने के लिए कौन सी पहेलियाँ सही कठिनाई वाली हैं (जिसे "स्वीट स्पॉट" कहा जाता है), लेकिन यह उत्तर के हर एक शब्द के साथ एक जैसा व्यवहार करता है। यह रोबोट को यह नहीं बताता कि कौन सा विशिष्ट शब्द गलत था।
"स्व-शिक्षक" कोच (SDPO): यह कोच अधिक स्मार्ट है। यह रोबोट के उत्तर को देखता है और कहता है, "तुमने सही उत्तर दिया, लेकिन तुमने यहाँ गलत शब्द का उपयोग किया। चलो उस विशिष्ट शब्द को ठीक करते हैं।" यह शब्द-दर-शब्द विस्तृत फीडबैक देता है।
- कमी: यह कोच शब्दों को ठीक करने में इतना केंद्रित हो जाता है कि यह भूल जाता है कि पहेली कितनी कठिन थी। यह उस पहेली के साथ भी वैसा ही व्यवहार करता है जिसे रोबोट ने 100% सही हल किया है, जैसा कि उस पहेली के साथ जिसे रोबोट 100% गलत हल करता है। यह उन पहेलियों को "सिखाने" में समय बर्बाद करता है जिन्हें रोबोट पहले ही मास्टर कर चुका है या जो वर्तमान में असंभव हैं।
समस्या: "स्वीट स्पॉट" गायब है
लेखकों ने महसूस किया कि सबसे अच्छा सीखना "स्वीट स्पॉट" में होता है: ऐसी पहेलियाँ जहाँ रोबोट 50% सही और 50% गलत होता है।
- यदि रोबोट सब कुछ सही करता है, तो वह ऊब जाता है (सीखने के लिए कुछ नहीं)।
- यदि वह सब कुछ गलत करता है, तो वह भ्रमित हो जाता है (सीखने के लिए कुछ नहीं)।
- यदि वह बीच में है, तो वह सबसे अधिक सीख रहा है।
"पास/फेल" कोच स्वाभाविक रूप से इस स्वीट स्पॉट पर ध्यान केंद्रित करता है। "स्व-शिक्षक" कोच इसे अनदेखा कर देता है। लेखक "स्व-शिक्षक" की शब्द-स्तर की विस्तृत जानकारी को "पास/फेल" कोच की कठिनाई जागरूकता के साथ जोड़ना चाहते थे।
समाधान: SC-SDPO ("गोल्डिलॉक्स" वेटिंग)
लेखकों ने एक नई विधि बनाई जिसे SC-SDPO कहा जाता है। इसे स्व-शिक्षक के फीडबैक में एक साधारण वॉल्यूम नॉब (आवाज़ कम-ज्यादा करने वाला बटन) जोड़ने के रूप में समझें।
यह इस प्रकार काम करता है:
- स्कोर की जाँच करें: रोबोट द्वारा एक पहेली को 8 बार आज़माने के बाद, सिस्टम जाँचता है: "उसने कितनी बार इसे सही किया?"
- वॉल्यूम को एडजस्ट करें:
- यदि रोबोट ने इसे 0 बार सही किया या 8 बार सही किया (बहुत आसान या बहुत कठिन), तो सिस्टम वॉल्यूम को जीरो (शून्य) तक कम कर देता है। "यहाँ समय बर्बाद न करें।"
- यदि रोबोट ने इसे लगभग 4 बार सही किया (स्वीट स्पॉट), तो सिस्टम वॉल्यूम को अधिकतम (मैक्सिमम) तक बढ़ा देता है। "यहाँ पूरी एकाग्रता से ध्यान दें!"
- गुप्त नुस्खा (गणित): लेखकों ने यह गणना करने के लिए कुछ गणित किया कि वॉल्यूम को कितना बढ़ाना है। उन्होंने पाया कि केवल "वेरिएंस" (एक फैंसी शब्द जिसका अर्थ है मिश्रित परिणाम) के आधार पर वॉल्यूम बढ़ाना पूरी तरह सही नहीं था। उन्होंने पाया कि एक विशिष्ट गणितीय वक्र (वर्गमूल का उपयोग करके) सबसे अच्छा काम करता है। यह सुनिश्चित करता है कि रोबोट एक स्थिर, निरंतर गति से सीखे बिना अभिभूत हुए या बिना उत्तेजना के।
यह विशेष क्यों है: "फ्री लंच" (मुफ्त का लाभ)
आमतौर पर, यह जानने के लिए कि पहेली कितनी कठिन है, आपको रोबोट का अलग से परीक्षण करना पड़ता है, जिसमें अतिरिक्त समय और पैसा लगता है।
लेकिन यह नई विधि चतुर है: इसे यह जानकारी मुफ्त में मिल जाती है।
क्योंकि रोबोट अपने सामान्य प्रशिक्षण के दौरान पहेली को 8 बार आज़मा ही रहा है, सिस्टम बस उन परिणामों को देखकर वॉल्यूम नॉब की सेटिंग तय करता है। इसे किसी अतिरिक्त काम की आवश्यकता नहीं है। यह एक शिक्षक द्वारा छात्र के होमवर्क को ग्रेड देने और तुरंत यह महसूस करने जैसा है, "ओह, यह छात्र इस विशिष्ट प्रकार की समस्या के साथ संघर्ष कर रहा है," बिना किसी अलग टेस्ट के।
परिणाम: क्या यह काम करता है?
उन्होंने दो अलग-अलग रोबोट दिमागों (Qwen और OLMo) पर विज्ञान के सवालों और टूल-यूज़ कार्यों का परीक्षण किया।
- विजेता: नई विधि (SC-SDPO) ने पुराने स्व-शिक्षक पद्धति को लगातार मात दी।
- लाभ: Qwen मॉडल पर, इसने औसत रूप से लगभग 3 से 4 अंक का सुधार किया। OLMo मॉडल पर, इसने लगभग 2 से 3 अंक का सुधार किया।
- स्थिरता: प्रशिक्षण सुचारू रहा। रोबोट भ्रमित या अनियंत्रित नहीं हुआ; वह बस अधिक कुशलता से सीख गया।
सारांश उपमा (Analogy)
कल्पना कीजिए कि आप एक संगीत शिक्षक हैं।
- पुरानी विधि (SDPO): आप छात्र द्वारा बजाए गए हर गलत नोट को सुधारते हैं, चाहे वह कोई ऐसा गाना हो जिसे वह पहले से ही पूरी तरह जानता है या कोई ऐसा गाना जिसे वह पढ़ भी नहीं सकता। आप उन गानों के नोट्स सुधारने में समय बर्बाद करते हैं जिन्हें उन्होंने मास्टर कर लिया है।
- नई विधि (SC-SDPO): आप छात्र को सुनते हैं। यदि वह एक ऐसा गाना बजा रहा है जिसे वह पूरी तरह जानता है, तो आप कहते हैं, "अच्छा काम, आगे बढ़ो।" यदि वह एक ऐसा गाना बजा रहा है जिसे वह पढ़ नहीं सकता, तो आप कहते हैं, "फिलहाल इसे छोड़ दें।" लेकिन यदि वह एक ऐसा गाना बजा रहा है जहाँ उसे आधे नोट्स सही मिलते हैं, तो आप कहते हैं, "रुको! यह अभ्यास के लिए एकदम सही गाना है। आइए इन विशिष्ट नोट्स को ठीक करते हैं।"
यह पेपर सिद्ध करता है कि केवल "परफेक्टली डिफिकल्ट" (बिल्स सटीक कठिन) गानों पर अपनी ऊर्जा केंद्रित करके, छात्र तेजी से सीखता है और समग्र रूप से एक बेहतर संगीतकार बनता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।