← नवीनतम पेपर
🤖 machine learning

Learn from A Rationalist: Distilling Intermediate Interpretable Rationales

यह शोध पत्र REKD का प्रस्ताव करता है, जो एक ज्ञान आसवन (knowledge distillation) ढांचा है जो अधिक सक्षम शिक्षक मॉडल के तर्क (rationales) और भविष्यवाणियों से सीखने के लिए छोटे छात्र नेटवर्क को प्रशिक्षित करके तर्क निष्कर्षण (rationale extraction) मॉडलों के भविष्य कहनेवाला प्रदर्शन और व्याख्यात्मकता को बढ़ाता है, जिससे रिमोट सुपरविजन के तहत फीचर उपसमुच्चयों (feature subsets) को सीखने की कम्प्यूटेशनल चुनौतियों पर विजय प्राप्त होती है।

मूल लेखक: Jiayi Dai, Randy Goebel

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiayi Dai, Randy Goebel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक तर्कवादी से सीखें: मध्यवर्ती व्याख्यात्मक कारणों का आसवन (Distilling Intermediate Interpretable Rationales)

बड़ी समस्या: AI की "मुर्गी और अंडा" वाली दुविधा

कल्पना कीजिए कि आप एक छात्र को एक जटिल पहेली सुलझाना सिखाने की कोशिश कर रहे हैं। छात्र के पास दो काम हैं:

  1. टुकड़ों को चुनना: उन्हें यह तय करना होगा कि कौन से पहेली के टुकड़े वास्तव में महत्वपूर्ण हैं।
  2. पहेली को सुलझाना: उन्हें केवल उन्हीं चुने हुए टुकड़ों का उपयोग करके पहेली को हल करना होगा।

समस्या यह है कि छात्र को यह नहीं पता कि कौन से टुकड़े महत्वपूर्ण हैं जब तक कि वह पहेली सुलझाने की कोशिश नहीं करता, लेकिन वह पहेली को अच्छी तरह से तब तक हल नहीं कर सकता जब तक उसे यह न पता हो कि कौन से टुकड़े महत्वपूर्ण हैं। यह एक "मुर्गी और अंडा" (Chicken and Egg) वाली दुविधा है।

आर्टिफिशियल इंटेलिजेंस (विशेष रूप से डीप न्यूरल नेटवर्क) की दुनिया में, यह तब होता है जब हम AI को "व्याख्या योग्य" (explainable) बनाने की कोशिश करते हैं। हम चाहते हैं कि AI फिल्म समीक्षा के विशिष्ट शब्दों या फोटो के विशिष्ट पिक्सेल को हाइलाइट करे जिसने उसके निर्णय को प्रेरित किया। इसे रेशनल एक्सट्रैक्शन (Rationale Extraction - RE) कहा जाता है।

आमतौर पर, यह तब बहुत अच्छा काम करता है जब AI बहुत बुद्धिमान (एक "बड़ा" मॉडल) हो। लेकिन यदि AI छोटा या कम शक्तिशाली (एक "छात्र" मॉडल) है, तो वह फंस जाता है। वह गलत टुकड़े चुनता है, पहेली सुलझाने में विफल रहता है, भ्रमित हो जाता है, और कभी भी सही तरीके से टुकड़े चुनना नहीं सीख पाता।

समाधान: एक "तर्कवादी" शिक्षक से सीखना

इस शोध पत्र के लेखक एक चतुर समाधान प्रस्तावित करते हैं जिसे REKD (Rationale Extraction with Knowledge Distillation) कहा जाता है।

इसे एक मास्टर शेफ (शिक्षक) द्वारा एक प्रशिक्षु (छात्र) को सिखाने के रूप में सोचें।

  • पुराना तरीका: प्रशिक्षु खुद अनुमान लगाने की कोशिश करता है कि कौन सी सामग्रियां महत्वपूर्ण हैं और अकेले व्यंजन पकाने की कोशिश करता है। वे अक्सर असफल होते हैं क्योंकि उनके पास पर्याप्त अनुभव नहीं होता।
  • REKD का तरीका: मास्टर शेफ केवल यह नहीं कहता, "यह रही रेसिपी।" इसके बजाय, शेफ कहता है: "देखो, मैंने ये विशिष्ट जड़ी-बूटियाँ और मसाले (Rationale/कारण) चुने हैं, और क्योंकि मैंने इनका उपयोग किया, इसलिए व्यंजन का स्वाद एकदम सही है (Prediction/पूर्वानुमान)।"

प्रशिक्षु एक साथ दो चीजें सीखता है:

  1. क्या चुनना है: वे शिक्षक के हाथों को देखते हैं ताकि देख सकें कि वास्तव में किन सामग्रियों का चयन किया गया था।
  2. यह क्यों काम करता है: वे देखते हैं कि वे विशिष्ट सामग्रियां एक स्वादिष्ट परिणाम की ओर कैसे ले जाती हैं।

शिक्षक के "मध्यवर्ती" विकल्पों (rationales) की नकल करके, छात्र बहुत तेज़ी से सीखता है और कम गलतियाँ करता है, भले ही छात्र छोटा और कम शक्तिशाली हो।

यह कैसे काम करता है: "सॉफ्ट" से "हार्ड" ट्रेनिंग कैंप

यह शोध पत्र एक विशेष प्रशिक्षण तकनीक का उपयोग करता जिसमें एक "तापमान" (temperature) सेटिंग शामिल है, जो एक प्रशिक्षण पाठ्यक्रम (curriculum) की तरह कार्य करती है:

  1. चरण 1: सॉफ्ट शुरुआत (उच्च तापमान): शुरुआत में, शिक्षक के चुनाव थोड़े "धुंधले" या "सॉफ्ट" होते हैं। शिक्षक कह सकता है, "मुझे 70% यकीन है कि यह शब्द महत्वपूर्ण है, लेकिन शायद वह भी हो सकता है।" यह छात्र को सख्त नियमों से अभिभूत हुए बिना कार्य की एक सामान्य समझ विकसित करने और अन्वेषण करने में मदद करता है।
  2. चरण 2: हार्ड समापन (कम तापमान): जैसे-जैसे प्रशिक्षण आगे बढ़ता है, "तापमान" गिरता जाता है। शिक्षक के चुनाव तीक्ष्ण और निश्चित हो जाते हैं। "यह शब्द 100% महत्वपूर्ण है; बाकी को अनदेखा करें।" छात्र फिर सटीक और आत्मविश्वासी निर्णय लेना सीखता है, ठीक शिक्षक की तरह।

यह प्रक्रिया सुनिश्चित करती है कि छात्र चयन के तर्क को सीखे, न कि केवल अंतिम उत्तर को।

उन्होंने क्या पाया (परिणाम)

शोधकर्ताओं ने दो प्रकार के कार्यों पर इसका परीक्षण किया:

  • पढ़ना: मूवी रिव्यू (IMDB डेटासेट) का विश्लेषण करना कि वे सकारात्मक हैं या नकारात्मक।
  • देखना: तस्वीरों में वस्तुओं की पहचान करना (CIFAR डेटासेट्स)।

उन्होंने शिक्षक के रूप में शक्तिशाली मॉडलों (जैसे BERT और Vision Transformers) और छात्रों के रूप में छोटे, कमजोर संस्करणों का उपयोग किया।

परिणाम स्पष्ट थे:

  • बिना मदद के: छोटे छात्र संघर्ष करते रहे। जब उन्हें केवल कुछ "महत्वपूर्ण" विशेषताओं (जैसे 10% शब्द या पिक्सेल) को चुनने के लिए मजबूर किया गया, तो उनकी सटीकता काफी गिर गई। वे समझ नहीं पाए कि क्या मायने रखता है।
  • REKD के साथ: छोटे छात्रों ने शिक्षक के "rationales" से सीखा। उनकी सटीकता बढ़ गई, और वे अक्सर बड़े, शक्तिशाली शिक्षकों के लगभग बराबर प्रदर्शन करने लगे, भले ही वे बहुत छोटे थे।
  • बोनस: कुछ मामलों में, छात्र अपने शिक्षक के स्पष्टीकरणों से इतनी अच्छी तरह सीख गए कि उनका प्रदर्शन उस स्थिति से भी बेहतर रहा जब उन्हें बिना किसी स्पष्टीकरण बाधा के सभी डेटा का उपयोग करने की अनुमति दी गई थी।

यह क्यों महत्वपूर्ण है

यह शोध पत्र तर्क देता है कि हमें AI स्पष्टीकरणों का मूल्यांकन केवल इस आधार पर नहीं करना चाहिए कि वे मानव सोच के अनुसार क्या महत्वपूर्ण है, बल्कि इस आधार पर करना चाहिए कि क्या AI वास्तव में उन हिस्सों का उपयोग करके एक अच्छा पूर्वानुमान लगा सकता है जिन्हें उसने हाइलाइट किया है।

एक "तर्कवादी" शिक्षक का उपयोग करके छात्र को निर्देशित करके, हम छोटे, तेज़ AI मॉडल बना सकते हैं जो न केवल सटीक हैं बल्कि हमें यह दिखाने में भी सक्षम हैं कि उन्होंने एक निर्णय क्यों लिया, बिना इसके कि उन्हें यह करने के लिए विशाल कंप्यूटिंग शक्ति की आवश्यकता हो।

संक्षेप में: यदि आप एक छोटे AI को स्मार्ट और व्याख्या योग्य बनाना चाहते हैं, तो उसे अकेले अनुमान लगाने न दें। उसे एक स्मार्ट शिक्षक का अनुसरण करने दें जो उसे ठीक से दिखाता है कि किन सुरागों का पालन करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →