← नवीनतम पेपर
💬 NLP

DistillLens: Symmetric Knowledge Distillation Through Logit Lens

डिस्टिलल लेंस (DistillLens) एक सममित ज्ञान आसवन (knowledge distillation) ढांचे को पेश करता है जो 'लॉगिट लेंस' (Logit Lens) के माध्यम से हिडन स्टेट्स को वोकैबुलरी स्पेस में प्रोजेक्ट करके छात्र और शिक्षक मॉडलों की मध्यवर्ती विचार प्रक्रियाओं को संरेखित करता है, जिससे यह आवश्यक उच्च-एन्ट्रॉपी जानकारी को संरक्षित करते हुए निर्देश-अनुसरण बेंचमार्क पर मानक विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Manish Dhakal, Uthman Jinadu, Anjila Budathoki, Rajshekhar Sunderraman, Yi Ding

प्रकाशित 2026-02-17
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Manish Dhakal, Uthman Jinadu, Anjila Budathoki, Rajshekhar Sunderraman, Yi Ding

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक युवा प्रशिक्षु (छात्र) को एक मास्टर गणितज्ञ (शिक्षक) को देखकर एक जटिल गणित की समस्या हल करना सिखाने की कोशिश कर रहे हैं।

पुराना तरीका: उत्तर रटना

पारंपरिक शिक्षण विधियों (जिन्हें नॉलेज डिस्टिलेशन कहा जाता है) में, मास्टर केवल ब्लैकबोर्ड पर अंतिम उत्तर दिखाता है।

  • समस्या: प्रशिक्षु अंतिम संख्या को याद कर लेता है लेकिन उसे यह पता नहीं होता कि मास्टर वहां तक कैसे पहुँचा। वह चरणों, तर्क और "अहा!" वाले क्षणों को चूक जाता है।
  • परिणाम: यदि मास्टर संख्याओं को थोड़ा बदल देता है, तो प्रशिक्षु विफल हो जाता है क्योंकि उसने कभी प्रक्रिया नहीं सीखी, केवल परिणाम सीखा। वे उस छात्र की तरह हैं जिसने उत्तर कुंजी रट ली है लेकिन बीजगणित (algebra) को नहीं समझा है।

नया तरीका: DISTILLLENS ("थॉट लेंस")

यह विधि केवल अंतिम उत्तर देखने के बजाय, प्रशिक्षु को मजबूर करती है कि वह मास्टर के पूरे विचार की प्रक्रिया को हर एक चरण में, स्टेप-बाय-स्टेप देखे।

यह कैसे काम करता है, यहाँ एक सरल उपमा दी गई है:

1. "लॉगिट लेंस" (X-रे चश्मा)

एक कंप्यूटर मस्तिष्क (AI मॉडल) के भीतर, प्रसंस्करण के कई स्तर (layers) होते हैं। मास्टर AI जटिल, अदृश्य पैटर्न (हिडन स्टेट्स) में सोचता है जिसे हम आसानी से नहीं देख सकते।

  • उपमा: कल्पना करें कि मास्टर एक गुप्त कोड में सोच रहा है। लॉगिट लेंस (Logit Lens) एक जादुई X-रे चश्मे की तरह है जो इस गुप्त कोड को सोचने की प्रक्रिया के हर एक चरण में साधारण अंग्रेजी में अनुवादित करता है।
  • यह क्या करता है: यह हमें देखने देता है कि मास्टर लेयर 1, लेयर 2, लेयर 3, और इसी तरह अंत तक, क्या "सोच" रहा है।

2. "सिमेट्रिक" नियम (एक निष्पक्ष न्यायाधीश)

प्रशिक्षु को सिखाने के पुराने तरीकों में एक दोष था: वे अनुचित थे।

  • दोष: यदि मास्टर ने सोचा कि एक शब्द 90% संभावित है, तो पुराने तरीके चिल्लाते थे, "तुम्हें 90% कहना ही होगा!" लेकिन यदि मास्टर ने सोचा कि कोई शब्द 1% संभावित है, तो पुराने तरीके उसे पूरी तरह से अनदेखा कर देते थे।
  • DISTILLLENS का समाधान: यह नया तरीका एक सिमेट्रिक (Symmetric) नियम का उपयोग करता है। यह एक निष्पक्ष न्यायाधीश की तरह कार्य करता है जो कहता है:
    • "यदि आप बहुत आत्मविश्वासी हैं (कुछ ऐसा सोच रहे हैं जो संभावित नहीं है), तो आपको दंड मिलेगा।"
    • "यदि आप बहुत अनिश्चित हैं (उस चीज़ को अनदेखा कर रहे हैं जिसे मास्टर ने महत्वपूर्ण समझा था), तो आपको भी दंड मिलेगा।"
  • परिणाम: प्रशिक्षु मास्टर की अनिश्चितता को पूरी तरह से मैच करना सीख जाता है। वे सीखते हैं कि कब आत्मविश्वासी होना है और कब सतर्क रहना है।

3. "थॉट ट्रेजेक्टरी" (एक मानचित्र)

केवल यह जाँचने के बजाय कि अंतिम उत्तर सही है या नहीं, DISTILLLENS उस पूरे पथ की जाँच करता है जिसे प्रशिक्षु ने वहां तक पहुँचने के लिए अपनाया था।

  • उपमा: कल्पना करें कि मास्टर पहाड़ पर चढ़ाई कर रहा है।
    • पुराना तरीका: शिक्षक केवल यह जाँचता है कि क्या प्रशिक्षु शिखर तक पहुँच गया।
    • DISTILLLENS: शिक्षक यह भी जाँचता है कि क्या प्रशिक्षु ने उसी घुमावदार रास्ते का पालन किया, उन्हीं दृश्यों पर रुका, और उन्हीं चट्टानों से बचा जिनसे मास्टर बचा था।
  • इन "विचार पथों" (thought paths) को संरेखित करके, प्रशिक्षु पहाड़ के गंतव्य को नहीं, बल्कि उसके तर्क को सीखता है।

यह एक बड़ी बात क्यों है?

इस पेपर ने विभिन्न AI मॉडलों (जैसे GPT-2 और Llama) पर इसका परीक्षण किया और पाया कि:

  1. बेहतर समझ: प्रशिक्षु (स्टूडेंट मॉडल्स) बहुत अधिक स्मार्ट और सटीक हो गए, और अक्सर उन मॉडलों को भी पीछे छोड़ दिया जो उनसे बहुत बड़े थे।
  2. कम "हलुसिनेशन" (Hallucination): क्योंकि उन्होंने विचार प्रक्रिया को सीखा, इसलिए उनके द्वारा गलत तथ्य बनाने की संभावना कम हो जाती है (जो एक सामान्य AI समस्या है)।
  3. दक्षता: यह अन्य उन्नत तरीकों की तुलना में प्रशिक्षित करने में तेज़ है जो मास्टर की सोच की नकल करने की कोशिश करते हैं, लेकिन यह पुराने "केवल उत्तर देखने वाले" तरीके की तुलना में बहुत बेहतर परिणाम देता है।

संक्षेप में

DISTILLLENS AI मॉडलों को ब्लैक बॉक्स की तरह मानना बंद कर देता है। यह बॉक्स को खोलता है, अंदर चलते हुए गियरों को देखता है, और छोटे मॉडल को उन गियरों को बड़े मॉडल के बिल्कुल समान लय में घुमाना सिखाता है। यह एक रेसिपी को रटने और वास्तव में खाना बनाना सीखने के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →