← नवीनतम पेपर
🤖 AI

Making Expert Reasoning Learnable with Self-Distillation

यह शोध पत्र डिस्ट्रीब्यूशन अलाइन्ड इमिटेशन लर्निंग (DAIL) का प्रस्ताव करता है, जो एक सेल्फ-डिस्टिलेशन विधि है जो न्यूनतम डेटा के साथ LLM की रीजनिंग क्षमताओं और सामान्यीकरण को कुशलतापूर्वक बढ़ाने के लिए उपदेशात्मक विशेषज्ञ समाधानों (didactic expert solutions) को इन-डिस्ट्रीब्यूशन रीजनिंग ट्रेसेस में परिवर्तित करती है।

मूल लेखक: Ethan Mendes, Jungsoo Park, Alan Ritter

प्रकाशित 2026-06-04
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ethan Mendes, Jungsoo Park, Alan Ritter

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Making Expert Reasoning Learnable with Self-Distillation" का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ हिंदी अनुवाद दिया गया है।

मुख्य समस्या: "पाठ्यपुस्तक" बनाम "विचारक" (The "Textbook" vs. The "Thinker")

कल्पना कीजिए कि आप एक छात्र को अविश्वसनीय रूप से कठिन गणित के सवाल हल करना सिखाने की कोशिश कर रहे हैं—जैसे कि इंटरनेशनल मैथ ओलंपियाड में पाए जाते हैं।

आपके पास उन्हें सिखाने के दो मुख्य तरीके हैं:

  1. प्रयास और त्रुटि (Reinforcement Learning - सुदृढीकरण सीखना): आप छात्र को एक समस्या देते हैं। यदि वह सही उत्तर देता है, तो आप उसे एक कुकी (इनाम) देते हैं। यदि वह गलत होता है, तो उसे कुछ नहीं मिलता।
    • समस्या: बहुत कठिन समस्याओं के लिए, छात्र अपने आप लगभग कभी भी सही नहीं हो पाता। इसलिए, उसे कभी कुकी नहीं मिलती, और वह कभी सीख नहीं पाता। यह किसी को पहली बार में ही एक परफेक्ट कॉन्सर्टो बजाने के लिए पुरस्कृत करके पियानो सीखने की कोशिश करने जैसा है। वे बस हार मान लेंगे।
  2. गुरु की नकल करना (Imitation Learning - अनुकरण सीखना): आप छात्र को एक विश्व स्तरीय विशेषज्ञ द्वारा लिखा गया समाधान दिखाते हैं।
    • समस्या: विशेषज्ञ के समाधान मनुष्यों के लिए लिखे जाते हैं, न कि कंप्यूटरों के लिए। वे "डिडैक्टिक" (didactic) होते हैं, जिसका अर्थ है कि वे जगह बचाने के लिए उबाऊ, स्पष्ट चरणों को छोड़ देते हैं। एक विशेषज्ञ लिख सकता है, "क्वाड्रेटिक फॉर्मूला का उपयोग करते हुए, हम x = 5 पाते हैं।" वे बीच की उलझी हुई बीजगणितीय गणनाओं को नहीं दिखाते।
    • जब AI इसे कॉपी करने की कोशिश करता है, तो वह चरणों को "छोड़ने" की भी सीख लेता है। वह तर्क को वास्तव में समझने के बजाय उत्तर का अनुमान लगाना या शॉर्टकट लेना सीख जाता है। यह किताब के पीछे दिए गए उत्तरों को रटने जैसा है बिना यह सीखे कि गणित कैसे किया जाता है।

समाधान: DAIL (Distribution Aligned Imitation Learning)

लेखक DAIL नामक एक नई विधि प्रस्तावित करते हैं। इसे एक दो-चरणीय अनुवाद प्रक्रिया के रूप में समझें जो "विशेषज्ञ मानव नोट्स" को "AI-अनुकूल पाठों" में बदल देती है।

चरण 1: "मिक्स्ड पॉलिसी एक्सपेंशन" (खाली जगहों को भरना)

AI को विचार प्रक्रिया का पूरा विवरण देखने की आवश्यकता है, न कि केवल सारांश। लेकिन यदि आप AI को विशेषज्ञ के समाधान को फिर से लिखने के लिए कहते हैं, तो वह धोखाधड़ी कर सकता है या उत्तर का बहुत अधिक संदर्भ ले सकता है।

इसलिए, लेखक Mixed Policy Rollouts नामक तकनीक का उपयोग करते हैं। कल्पना कीजिए कि दो लोग एक कहानी लिखने के लिए मिलकर काम कर रहे हैं:

  • छात्र (AI): जो वह जानता है उसके आधार पर अगला वाक्य लिखने की कोशिश करता है।
  • शिक्षक (उसी AI का एक स्थिर संस्करण, जो विशेषज्ञ के उत्तर को देख रहा है): यह जाँचता है कि क्या छात्र का वाक्य सही दिशा में है।

यदि छात्र का वाक्य अच्छा है, तो वे उसे रखते हैं। यदि वह पटरी से उतर गया है, तो शिक्षक अगला सही कदम लिखकर हस्तक्षेप करता है। यह समाधान का एक नया, विस्तृत संस्करण बनाता है जो AI की स्वाभाविक सोचने की शैली जैसा दिखता है, लेकिन विशेषज्ञ के सही मार्ग द्वारा निर्देशित होता है। यह उन सभी छूटे हुए चरणों को भर देता है जिन्हें मानव विशेषज्ञ ने छोड़ दिया था।

चरण 2: "कॉन्ट्रास्टिव" फ़िल्टर (धोखाधड़ी रोकना)

विस्तारित चरणों के बावजूद, AI बुरी आदतें सीख सकता है। उदाहरण के लिए, वह देख सकता है कि विशेषज्ञ "175" तक पहुँचा है और फिर वह बिना किसी उचित तर्क के अपने गणित को "175" के बराबर लाने के लिए मजबूर कर सकता है। इसे "रेशनलाइजेशन शॉर्टकट" (rationalization shortcut) कहा जाता है। यह ऐसा है जैसे एक छात्र देखता है कि उत्तर 10 है, इसलिए वह बस "2 + 8 = 10" लिख देता है, भले ही सवाल सेब और संतरों के बारे में क्यों न हो।

इसे रोकने के लिए, DAIL एक कॉन्ट्रास्टिव ऑब्जेक्टिव (Contrastive Objective) का उपयोग करता है। इसे "गुड कॉप / बैड कॉप" प्रशिक्षण पद्धति के रूप में सोचें:

  • गुड कॉप (शिक्षक): AI को पूर्ण, सही और विस्तृत तर्क दिखाता है। AI को इससे मेल खाने के लिए पुरस्कृत किया जाता है।
  • बैड कॉप (नेगेटिव रेफरेंस): AI को समाधान का एक "धोखाधड़ी वाला" संस्करण दिखाता है। इस संस्करण में केवल अंतिम उत्तर और कुछ यादृच्छिक (random) मध्यवर्ती संख्याएँ होती हैं, जिनका कोई तार्किक संबंध नहीं होता।

AI को "बैड कॉप" की तरह सुनाई देने से बचने के लिए प्रशिक्षित किया जाता है। यह वास्तविक तार्किक चरणों और नकली शॉर्टकट के बीच अंतर करना सीखता है जो केवल सही संख्या तक पहुँचने के लिए बनाए गए हैं।

परिणाम: छोटा डेटा, बड़ी बढ़त

लेखकों ने इन कठिन गणितीय समस्याओं पर इसका परीक्षण किया जिन्हें AI अकेले हल नहीं कर पा रहा था।

  • दक्षता (Efficiency): उन्होंने विशेषज्ञ समाधानों के 1,000 से भी कम का उपयोग किया। AI प्रशिक्षण के लिए यह बहुत कम डेटा है।
  • प्रदर्शन (Performance): कठिन समस्याओं को हल करने की AI की क्षमता में काफी सुधार हुआ (कुछ परीक्षणों में 31% तक बेहतर)।
  • गति (Speed): AI अधिक कुशलता से तर्क करना सीख गया। यह पहले की तुलना में आधे "सोचने के समय" (कम टोकन) का उपयोग करके समस्याओं को हल कर सका, क्योंकि इसने भटकने के बजाय सीधे, विशेषज्ञ मार्गों को सीखा।
  • सामान्यीकरण (Generalization): AI केवल उन विशिष्ट गणित के सवालों में ही बेहतर नहीं हुआ जिन पर इसे प्रशिक्षित किया गया था; यह विज्ञान के असंबंधित प्रश्नों (जैसे जीव विज्ञान और भौतिकी) में भी बेहतर हो गया, जिससे पता चलता है कि इसने केवल क्या उत्तर देना है यह नहीं, बल्कि कैसे सोचना है यह सीखा है।

सारांश उपमा

कल्पना कीजिए कि आप एक नौसिखिया शेफ हैं जो एक मास्टर शेफ से एक जटिल रेसिपी सीखने की कोशिश कर रहे हैं।

  • पुरानी विधि 1 (प्रयास और त्रुटि): आप शुरुआत से खाना बनाने की कोशिश करते हैं। आप इसे जला देते हैं। आप फिर से कोशिश करते हैं। आप इसे फिर से जला देते हैं। आप कभी भी सही नहीं कर पाते, इसलिए आप कभी सीख नहीं पाते।
  • पुरानी विधि 2 (नकल करना): आप मास्टर के रेसिपी कार्ड को देखते हैं। इसमें लिखा है, "सुनहरा होने तक भूनें, फिर मसाले डालें।" आपको नहीं पता कि "सुनहरा" क्या दिखता है या कौन से मसाले। आप अनुमान लगाते हैं, और आपका व्यंजन अजीब स्वाद वाला होता है।
  • DAIL विधि:
    1. एक्सपेंशन (विस्तार): एक शिक्षण सहायक आपके पास खड़ा है। जब आप हिचकिचाते हैं, तो वे धीरे से आपका हाथ गाइड करते हैं ताकि आप प्याज को सही ढंग से काट सकें, और यह भी समझाते हैं कि आप ऐसा क्यों कर रहे हैं। आप इस विस्तृत, चरण-दर-चरण प्रक्रिया को लिखते हैं।
    2. कॉन्ट्रास्टिव फ़िल्टर: सहायक आपको एक "नकली" रेसिपी भी दिखाता है जहाँ किसी ने बस एक बर्तन में यादृच्छिक सामग्री डाल दी और किस्मत से सही बन गई। वे आपसे कहते हैं, "इस व्यक्ति की तरह खाना न पकाएं। ध्यान दें कि इन्होंने हीटिंग स्टेप को कैसे छोड़ दिया? यह गलत है। मास्टर की तरह खाना पकाएं, जो हर चरण को समझाते हैं।"

अंत में, आपके पास एक विस्तृत, ईमानदार रेसिपी होती है जिसे आप फॉलो कर सकते हैं, और आपने आलसी शॉर्टकट से बचना सीख लिया है। अब आप कुशलतापूर्वक व्यंजन बना सकते हैं और उन कौशलों को अन्य रेसिपी में भी लागू कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →