← नवीनतम पेपर
💬 NLP

X\mathcal{X}-KD: General Experiential Knowledge Distillation for Large Language Models

यह शोध पत्र X\mathcal{X}-KD का प्रस्ताव करता है, जो अनुभवात्मक शिक्षण (experiential learning) और प्रतिलोम सुदृढीकरण शिक्षण (inverse reinforcement learning) से प्रेरित एक सामान्य ज्ञान आसवन (knowledge distillation) ढांचा है, जो छात्र मॉडलों को शिक्षक के मूल शिक्षण वातावरण से सीखने में सक्षम बनाता है, क्योंकि यह शिक्षक के रिवॉर्ड फंक्शन (reward function) और पॉलिसी (policy) को संयुक्त रूप से मॉडल करता है, जिससे मौजूदा बेसलाइनों की तुलना में विभिन्न कार्यों में बेहतर प्रदर्शन, विविधता और डेटा दक्षता प्राप्त होती है।

मूल लेखक: Yuang Cai, Yuyu Yuan

प्रकाशित 2026-02-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuang Cai, Yuyu Yuan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ बनना सीखने की कोशिश कर रहे हैं। आपके पास एक प्रसिद्ध, पुरस्कार विजेता शिक्षक (Teacher Model) है जो अविश्वसनीय भोजन बना सकता है।

सीखने के पुराने तरीके (पारंपरिक Knowledge Distillation) में, आप शिक्षक के बगल में खड़े होते हैं, प्याज काटने के उनके तरीके को देखते हैं, और उनके हाथों की गतिविधियों की हुबहू नकल करने की कोशिश करते हैं। आप कहते हैं, "ठीक है, उन्होंने इस तरह से प्याज काटा, तो मुझे भी इसी तरह काटना चाहिए।" इसे Behavioral Cloning कहा जाता है। आप कार्यों की नकल कर रहे हैं, लेकिन आप वास्तव में यह नहीं समझ पा रहे हैं कि उन्होंने प्याज इस तरह क्यों काटा या व्यंजन का वास्तविक लक्ष्य क्या है। यदि शिक्षक कोई छोटी सी गलती करता है या यदि आप किसी ऐसी नई सामग्री का सामना करते हैं जिसका उन्होंने कभी उपयोग नहीं किया था, तो आप अटक सकते हैं क्योंकि आपने केवल "चालों" को सीखा है, "तर्क" को नहीं।

X-KD (Experiential Knowledge Distillation) खेल बदल देता है। केवल शिक्षक के हाथों की नकल करने के बजाय, X-KD यह समझने की कोशिश करता है कि शिक्षक किस वातावरण (environment) में प्रशिक्षित हुआ था। यह पूछता है: "शिक्षक क्या हासिल करने की कोशिश कर रहा था? वह किस 'इनाम' (reward) के पीछे भाग रहा था?"

यहाँ बताया गया है कि X-KD कैसे काम करता है, सरल उपमाओं के साथ:

1. "मशीन में भूत" (The "Ghost in the Machine" - द रिवॉर्ड फंक्शन)

कल्पना कीजिए कि शिक्षक शेफ ने केवल खाना बनाना नहीं सीखा; उन्होंने एक बहुत ही विशिष्ट, अदृश्य जज को संतुष्ट करने के लिए खाना बनाना सीखा जो स्वाद, बनावट और प्रस्तुति के लिए अंक देता है। यह अदृश्य जज ही Reward Function है।

  • पुराना तरीका: आप शिक्षक के चाकू चलाने के कौशल की नकल करते हैं।
  • X-KD तरीका: आप यह समझने की कोशिश करते हैं कि अदृश्य जज को क्या पसंद है। आप सीखते हैं कि शिक्षक प्याज को इस तरह से काटता है क्योंकि इससे वह मीठा हो जाता है, जिसे जज पसंद करता है। आप केवल कटाई की नकल नहीं कर रहे हैं; आप कटाई के पीछे के सिद्धांत को सीख रहे हैं।

2. "वर्चुअल रियलिटी सिम्युलेटर"

यह पेपर एक फैंसी गणितीय ढांचे का उपयोग करता है जिसे Inverse Reinforcement Learning कहा जाता है। इसे शिक्षक के रसोईघर का एक वर्चुअल रियलिटी (VR) सिम्युलेटर बनाने के रूप में समझें।

इस VR दुनिया में, आप केवल शिक्षक को देखते नहीं हैं। आप उनके जूतों में कदम रखते हैं (उनके स्थान पर आते हैं)। आप खाना बनाने की कोशिश करते हैं, और सिस्टम आपको बताता है, "हे, यह व्यंजन स्वादिष्ट है क्योंकि यह शिक्षक की मूल रिवॉर्ड प्रणाली से मेल खाता है।" आप उसी वातावरण में सीख रहे हैं जिसमें शिक्षक ने सीखा था, न कि केवल उनके अंतिम आउटपुट की नकल कर रहे हैं।

3. "दो-भाग वाला पाठ"

X-KD छात्र मॉडल (एक प्रशिक्षु) को दो साथ-साथ चलने वाले पाठों का उपयोग करके सिखाता है:

  1. अनुकरण का पाठ (The Imitation Lesson): "देखो शिक्षक ने क्या किया।" (यह मानक नकल वाला हिस्सा है)।
  2. अनुभव का पाठ (The Experience Lesson): "अब, कल्पना करो कि तुम शिक्षक हो। अदृश्य जज से सबसे अच्छा स्कोर पाने के लिए तुम क्या करोगे?" (यह नया "अनुभवात्मक" हिस्सा है)।

इन दोनों को मिलाकर, छात्र लचीला बनना सीखता है। यदि शिक्षक के पास प्याज खत्म हो जाते हैं, तो छात्र जानता है कि उसे 'शालोट्स' (shallots) का उपयोग करना चाहिए क्योंकि वह लक्ष्य (स्वाद) को समझता है, न कि केवल सामग्री को।

यह बेहतर क्यों है? (परिणाम)

पेपर ने इसे तीन अलग-अलग "रसोईघरों" (कार्यों) पर परखा:

  • समाचारों का सारांश बनाना (Summarizing News): छात्र ने ऐसे सारांश लिखना सीखा जो न केवल छोटे थे, बल्कि वास्तव में कहानी के सार को पकड़ते थे, न कि केवल शिक्षक द्वारा उपयोग किए गए शब्दों को।
  • भाषा अनुवाद (Translating Languages): छात्र ने बेहतर अनुवाद किया, वाक्य के भाव को पकड़ा, न कि केवल शब्दों को एक-से-एक बदला।
  • गणित की समस्याओं को हल करना (Solving Math Problems): छात्र ने गणित के तर्क को सीखा, न कि केवल उत्तर के पैटर्न को।

जादुई लाभ:

  • कम डेटा की आवश्यकता: क्योंकि छात्र खेल के नियमों (रिवॉर्ड) को समझता है, उन्हें सीखने के लिए उदाहरणों की कम आवश्यकता होती है। यह शतरंज के नियमों को समझने बनाम ग्रैंडमास्टर द्वारा खेले गए हर मूव को याद करने जैसा है।
  • अधिक रचनात्मक: छात्र विविध उत्तर उत्पन्न कर सकता है (जैसे एक शेफ एक नई रेसिपी बनाता है) बिना गुणवत्ता खोए। पुराने तरीके अक्सर शिक्षक की सटीक शैली को दोहराने में फंस जाते हैं; X-KD उच्च गुणवत्ता बनाए रखते हुए विविधता की अनुमति देता है।

एक चुनौती (The Catch)

ठीक वैसे ही जैसे VR सिम्युलेटर में खाना सीखना, इसमें थोड़ा अधिक सेटअप की आवश्यकता होती है। आपको "अनुभव के भार" (experience weight) को ट्यून करना होगा (कि आप अदृश्य जज पर कितना ध्यान केंद्रित करते हैं बनाम शिक्षक के हाथों पर)। यदि आप इसे गलत ट्यून करते हैं, तो छात्र भ्रमित हो सकता है। लेकिन जब इसे सही ढंग से ट्यून किया जाता है, तो यह एक सुपरपावर है।

संक्षेप में

X-KD एक छात्र को केवल एक मास्टर की नकल करना ही नहीं, बल्कि मास्टर की मानसिकता को समझना सिखाने जैसा है। यह छात्र को मास्टर के जूतों में रखता है, जिससे वह "क्या" के पीछे के "क्यों" का अनुभव कर पाता है, जिसके परिणामस्वरूप एक अधिक स्मार्ट, अधिक अनुकूलन योग्य और अधिक कुशल शिक्षार्थी प्राप्त होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →