← नवीनतम पेपर
💬 NLP

Where Did This Sentence Come From? Tracing Provenance in LLM Reasoning Distillation

यह शोध पत्र टीचर, स्टूडेंट और डिस्टिल्ड मॉडल्स के बीच प्रेडिक्टिव प्रोबेबिलिटीज की तुलना करके एक डिस्टिल्ड मॉडल के कार्यों के उद्गम का विश्लेषण करने के लिए एक रीजनिंग डिस्टिलेशन प्रोवेनेंस ट्रेसिंग फ्रेमवर्क पेश करता है, जो यह प्रदर्शित करता है कि टीचर-ओरिजिनेटेड एक्शन प्रदर्शन के साथ सह-संबंधित हैं और रीजनिंग डिस्टिलेशन को बेहतर बनाने के लिए एक सिद्धांत-आधारित, टीचर-गाइडेड डेटा चयन पद्धति को सक्षम बनाता है।

मूल लेखक: Kaiyuan Liu, Shaotian Yan, Rui Miao, Bing Wang, Chen Shen, Jun Zhang, Jieping Ye

प्रकाशित 2026-02-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaiyuan Liu, Shaotian Yan, Rui Miao, Bing Wang, Chen Shen, Jun Zhang, Jieping Ye

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ (शिक्षक) हैं जो एक बेहतरीन, जटिल व्यंजन बना सकते हैं। आपके पास एक युवा प्रशिक्षु (छात्र) है जो प्रतिभाशाली है लेकिन अभी भी काम सीख रहा है।

आर्टिफिशियल इंटेलिजेंस की दुनिया में, "रीज़निंग डिस्टिलेशन" (Reasoning Distillation) वैसा ही है जैसे शेफ अपनी गुप्त रेसिपी और उस व्यंजन को बनाने के लिए इस्तेमाल की गई विचार प्रक्रिया को चरण-दर-चरण लिखता है, और फिर उसे अध्ययन करने के लिए प्रशिक्षु को दे देता है। लक्ष्य यह है कि प्रशिक्षु न केवल यह सीखे कि व्यंजन का स्वाद कैसा है, बल्कि यह भी सीखे कि वह व्यंजन खुद बनाने के लिए शेफ की तरह कैसे सोच सकता है।

हालाँकि, एक बड़ा रहस्य है: जब प्रशिक्षु एक नए किचन में जाता है जहाँ सामग्री अलग है (एक नया परीक्षण प्रश्न), तो क्या वे वास्तव में मास्टर शेफ की तरह खाना बनाते हैं? या वे बस अपनी पुरानी, अनाड़ी आदतों पर वापस लौट आते हैं?

यह पेपर, जिसका शीर्षक है "यह वाक्य कहाँ से आया?", इसी रहस्य को सुलझाने की कोशिश करता है। यहाँ सरल शब्दों में इसका विवरण दिया गया है:

1. समस्या: "इम्पोस्टर" (बहरूपिया) प्रशिक्षु

लंबे समय तक, शोधकर्ता केवल अंतिम परिणाम को देखते रहे। यदि प्रशिक्षु ने सही उत्तर दिया, तो उन्होंने मान लिया कि प्रशिक्षु ने सफलतापूर्वक शेफ का गुप्त ज्ञान सीख लिया है। लेकिन क्या होगा अगर प्रशिक्षु केवल भाग्यशाली था? क्या होगा अगर उसने सही उत्तर पाने के लिए अपने पुराने तरीकों का उपयोग किया, भले ही वह शेफ के तर्क को वास्तव में नहीं समझ पाया हो?

लेखक चिंतित थे कि जब AI छात्र के सामने कोई नई समस्या आती है, तो क्या वह शिक्षक की बात सुनना बंद कर देगा और अपने मूल, कम-स्मार्ट स्वरूप पर वापस लौट जाएगा?

2. समाधान: "प्रोवेनेंस डिटेक्टिव" (स्रोत का जासूस)

यह पता लगाने के लिए कि वास्तव में क्या हो रहा है, लेखकों ने एक डिटेक्टिव फ्रेमवर्क बनाया।

कल्पना कीजिए कि प्रशिक्षु हर वाक्य के साथ एक कहानी लिख रहा है। जासूस हर एक वाक्य के बाद रुकता है और तीन सवाल पूछता है:

  1. शेफ: "यदि आपको ठीक यही स्थिति दी जाती, तो आपके द्वारा यह अगला वाक्य लिखे जाने की कितनी संभावना होती?"
  2. प्रशिक्षु (प्रशिक्षण से पहले): "यदि आपने अभी तक शेफ से नहीं सीखा होता, तो आपके द्वारा यह लिखने की कितनी संभावना होती?"
  3. प्रशिक्षित प्रशिक्षु: "आपने वास्तव में क्या लिखा?"

इन उत्तरों की तुलना करके, जासूस हर वाक्य को चार श्रेणियों (Buckets) में विभाजित कर सकता है:

  • 👨‍🍳 शेफ की आवाज़ (शिक्षक-मूलित - Teacher-Originated): प्रशिक्षु ने कुछ ऐसा लिखा जो शेफ निश्चित रूप से कहता, लेकिन अप्रशिक्षित प्रशिक्षु कभी नहीं सोच पाता। यही असली सोना है! इसका मतलब है कि प्रशिक्षु ने वास्तव में नया कौशल सीख लिया है।
  • 👶 बच्चे की पुरानी आदतें (छात्र-मूलित - Student-Originated): प्रशिक्षु ने कुछ ऐसा लिखा जो वे प्रशिक्षण के बिना भी कहते। शिक्षक की मदद ने इस हिस्से को नहीं बदला।
  • 🔄 बढ़ी हुई आदत (बूस्टेड - Boosted): प्रशिक्षु को यह वाक्य पता था, लेकिन प्रशिक्षण ने उन्हें इसे बहुत अधिक आत्मविश्वास के साथ कहने के लिए प्रेरित किया।
  • 🤝 साझा आधार (साझा - Shared): शेफ और प्रशिक्षु दोनों ही इसे वैसे ही कहते। यह बस एक बुनियादी तथ्य है।

3. उन्होंने क्या खोजा

जब उन्होंने वास्तविक AI मॉडलों पर यह जासूसी कार्य चलाया, तो उन्हें कुछ दिलचस्प बातें पता चलीं:

  • शेफ की आवाज़ ही असली 'सीक्रेट सॉस' है: जब प्रशिक्षु सही उत्तर प्राप्त करता है, तो वह बहुत सारे "शेफ की आवाज़" वाले वाक्यों का उपयोग कर रहा होता है, विशेष रूप से अपने तर्क की शुरुआत में। यह साबित करता है कि प्रशिक्षण वास्तव में काम कर गया और शिक्षक के तर्क को स्थानांतरित कर दिया।
  • सभी "बूट्स" अच्छे नहीं होते: कभी-कभी, प्रशिक्षण प्रशिक्षु को उनकी पुरानी, बुरी आदतों में अधिक आत्मविश्वासी बना देता है (Boosted Sentences)। यदि प्रशिक्षु गलत उत्तर देता है, तो यह अक्सर इसलिए होता है क्योंकि वह नए शिक्षक के तर्क के बजाय इन बढ़ी हुई पुरानी आदतों पर बहुत अधिक निर्भर होता है।
  • "अर्ली बर्ड" प्रभाव: शिक्षक का तर्क प्रतिक्रिया के पहले कुछ वाक्यों में सबसे अधिक दिखाई देता है। यहीं पर प्रशिक्षु के मास्टर की तरह सोचने की सबसे अधिक संभावना होती है।

4. नई रणनीति: सही रेसिपी चुनना

इस खोज के आधार पर, लेखकों ने प्रशिक्षुओं को प्रशिक्षित करने का एक नया तरीका निकाला।

पुराना तरीका: "आइए ऐसी रेसिपी चुनें जिन्हें प्रशिक्षु पहले से ही थोड़ा बहुत पसंद करता है या समझता है।" (यह एक छात्र को ऐसा होमवर्क देने जैसा है जो वह पहले से ही आसानी से कर सकता है)।

नया तरीका (शिक्षक-निर्देशित चयन - Teacher-Guided Selection): "आइए ऐसी रेसिपी चुनें जहाँ शेफ और प्रशिक्षु के बीच सबसे अधिक असहमति हो!"

  • यदि शेफ कहता है, "इसे इस तरह करो," और प्रशिक्षु कहता है, "नहीं, मैं इसे उस तरह करूँगा," तो यह एक परफेक्ट सीखने का अवसर है।
  • लेखकों ने इन विशिष्ट "असहमति" के क्षणों को खोजने के लिए एक फ़िल्टर बनाया। उन्होंने केवल उन उदाहरणों को रखा जहाँ शिक्षक का तर्क सबसे मजबूत और छात्र की पुरानी आदतों से सबसे अलग था।

5. परिणाम

जब उन्होंने AI छात्रों को प्रशिक्षित करने के लिए इस "डिसएग्रीमेंट फ़िल्टर" (असहमति फ़िल्टर) का उपयोग किया:

  • छात्र कठिन गणित और विज्ञान की समस्याओं को हल करने में बेहतर हो गए।
  • वे अपनी पुरानी, बुरी आदतों पर वापस लौटने की संभावना कम रखते थे।
  • वे वास्तव में मास्टर शेफ की तरह सोचने लगे।

बड़ी तस्वीर (The Big Picture)

यह पेपर AI दिमाग के लिए एक एक्स-रे मशीन देने जैसा है। केवल यह अनुमान लगाने के बजाय कि क्या एक AI ने कुछ सीखा है, हम अब इसके अंदर देख सकते हैं और सटीक रूप से जान सकते हैं कि उसके सोचने के कौन से हिस्से शिक्षक से आए हैं और कौन से हिस्से उसकी अपनी पुरानी आदतें हैं।

इस "एक्स-रे" का उपयोग करके सर्वोत्तम प्रशिक्षण डेटा चुनने से, हम अधिक स्मार्ट, अधिक विश्वसनीय AI सहायक बना सकते हैं जो वास्तव में अपने शिक्षकों के ज्ञान को विरासत में पाते हैं, न कि केवल स्मार्ट होने का नाटक करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →