← नवीनतम पेपर
💬 NLP

Unveiling Decision-Making in LLMs for Text Classification : Extraction of influential and interpretable concepts with Sparse Autoencoders

यह शोध पत्र ClassifSAE को प्रस्तुत करता है, जो टेक्स्ट वर्गीकरण के लिए विशेष रूप से तैयार किया गया एक नवीन स्पार्स ऑटोएनकोडर-आधारित आर्किटेक्चर है, जो एक विशिष्ट क्लासिफायर हेड और एक्टिवेशन रेट स्पैरसिटी लॉस के माध्यम से निकाले गए फीचर्स की कार्य-कारणता (causality) और व्याख्यात्मकता (interpretability) में सुधार करके मौजूदा व्याख्यात्मकता विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Mathis Le Bail, Jérémie Dentan, Davide Buscaldi, Sonia Vanier

प्रकाशित 2026-02-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mathis Le Bail, Jérémie Dentan, Davide Buscaldi, Sonia Vanier

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट लाइब्रेरियन (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो लाखों किताबें पढ़ सकता है और तुरंत आपको बता सकता है कि कोई समाचार लेख खेल (Sports), व्यवसाय (Business), या विज्ञान (Science) के बारे में है। यह काम वह अविश्वसनीय रूप से अच्छी तरह से करता है, लेकिन एक पेंच है: रोबोट एक "ब्लैक बॉक्स" है। आप इनपुट (लेख) और आउटपुट (श्रेणी) को देख सकते हैं, लेकिन आपको यह पता नहीं है कि उसने निर्णय कैसे लिया। यह एक जादूगर को टोपी से खरगोश निकालते हुए देखने जैसा है, लेकिन आप उसका जादू (ट्रिक) नहीं देख सकते।

यह पेपर एक नया टूल पेश करता है जिसे ClassifSAE कहा जाता है, ताकि पर्दे के पीछे झाँका जा सके और रोबोट की विचार प्रक्रिया को समझा जा सके।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: रोबोट का "दिमाग" एक अस्त-व्यस्त अटारी (Attic) है

रोबोट के दिमाग के अंदर, जानकारी साफ-सुथरी, लेबल वाली फाइलों में संग्रहीत नहीं है। इसके बजाय, यह एक विशाल, अराजक अटारी की तरह है जहाँ लाखों चीजें एक के ऊपर एक ढेर कर दी गई हैं।

  • समस्या: जब रोबट "ओलंपिक बास्केटबॉल" के बारे में एक वाक्य पढ़ता है, तो वह एक साथ हजारों न्यूरॉन्स को सक्रिय कर देता है। कुछ न्यूरॉन्स "खेल" के बारे में ध्यान देते हैं, कुछ "समाचार एजेंसियों" के बारे में, और अन्य "संख्याओं" के बारे में। क्योंकि वे सभी आपस में मिले हुए हैं (एक समस्या जिसे पॉलीसेमेंटिकिटी/polysemanticity कहा जाता है), यह बताना कठिन हो जाता है कि किस विशिष्ट विचार ने "खेल" के लेबल तक पहुँचाया।
  • लक्ष्य: हम उन विशिष्ट "विचारों" या अवधारणाओं (concepts) को खोजना चाहते हैं जिनका उपयोग रोबोट अपने निर्णय लेने के लिए करता है, और हम चाहते हैं कि वे विचार स्पष्ट और मानव-पठनीय हों।

2. पुराने उपकरण: अटारी को छाँटने की कोशिश करना

पिछले तरीकों ने इस अटारी को छाँटने की कोशिश की, लेकिन उनमें कमियाँ थीं:

  • "अनुमान और जाँच" विधि: कुछ तरीकों ने मनुष्यों से पूछा कि उन्हें क्या लगता है कि रोबोट क्या सोच रहा है। यह धीमा और व्यक्तिपरक (subjective) है।
  • "अंधा खोज" (Blind Search): अन्य तरीकों ने बिना किसी मार्गदर्शन के पैटर्न खोजने की कोशिश की, लेकिन वे अक्सर "भूतों" को खोज निकालते थे—ऐसे पैटर्न जो अवधारणाओं की तरह दिखते थे लेकिन वास्तव में मनुष्यों के लिए कोई अर्थ नहीं रखते थे।
  • "भारी हिटर्स" (Heavy Hitters): कुछ तरीके उन अवधारणाओं को खोज सकते थे जिनके कारण रोबोट अपना मन बदल लेता था, लेकिन वे अवधारणाएँ स्वयं मनुष्यों के लिए समझ से बाहर (gibberish) थीं।

3. नया समाधान: ClassifSAE (स्मार्ट सॉर्टर)

लेखकों ने ClassifSAE बनाया है, जो रोबोट की अटारी के लिए एक सुपर-इंटेलिजेंट सॉर्टिंग मशीन की तरह कार्य करता है। यह कैसे काम करता है, यहाँ बताया गया है:

A. "विशेषज्ञ लाइब्रेरियन" (संयुक्त क्लासिफायर - Joint Classifier)

कल्पना कीजिए कि आप केवल कोई भी किताबें छाँटना नहीं चाहते; आप विशेष रूप से "खेल" अनुभाग के लिए किताबें छाँटना चाहते हैं।

  • यह कैसे काम करता है: ClassifSAE एक छोटा, विशिष्ट "लाइब्रेरियन" (क्लासिफायर) एक सॉर्टिंग मशीन के साथ प्रशिक्षित करता है। यह लाइब्रेरियन केवल छाँटी गई वस्तुओं को देखता है ताकि यह तय किया जा सके कि वे "खेल" के अंतर्गत आती हैं या "व्यवसाय" के।
  • परिणाम: क्योंकि लाइब्रेरियन को एक निर्णय लेने की आवश्यकता होती है, इसलिए सॉर्टिंग मशीन को अटारी को स्पष्ट, विशिष्ट ढेरों में व्यवस्थित करने के लिए मजबूर किया जाता है जो वास्तव में लाइब्रेरियन की मदद करें। यह "बास्केटबॉल" को "दिवालियापन" के साथ मिलने से रोकता है और उन्हें अलग रखता है।

B. "भीड़भाड़ न होने" का नियम (Sparsity)

एक अस्त-व्यस्त अटारी में, एक बड़ा ढेर सब कुछ समाहित कर सकता है, जिससे वह बेकार हो जाता है।

  • यह कैसे काम करता है: लेखकों ने एक नियम जोड़ा: "एक समय में केवल कुछ ही वस्तुओं को सुर्खियों (spotlight) में रहने की अनुमति है।" यह रोबोट को एक विशिष्ट वाक्य के लिए सबसे महत्वपूर्ण अवधारणा चुनने के लिए मजबूर करता है, बजाय इसके कि वह 50 अस्पष्ट विचारों को सक्रिय कर दे।
  • परिणाम: विचारों के धुंधले बादल के बजाय, आपको "ओलंपिक गेम्स" या "एयरलाइन स्टॉक्स" जैसी एक स्पष्ट, केंद्रित अवधारणा मिलती है।

4. प्रमाण: क्या यह काम कर गया?

टीम ने चार अलग-अलग "लाइब्रेरी" (डेटासेट: न्यूज़, मूवी रिव्यूज, आपत्तिजनक भाषा, और सेंटिमेंट) का उपयोग करके मौजूदा तरीकों के मुकाबले इस नए सॉर्टर का परीक्षण किया।

  • स्पष्टता (Interpretability): उन्होंने "स्पष्टता" मापने का एक नया तरीका बनाया। यदि रोबोट कहता है कि एक वाक्य "खेल" के बारे में है, तो क्या इसके द्वारा उपयोग किए गए विचार वास्तव में खेलों जैसे लगते हैं?
    • उपमा: यदि रोबोट कहता है "यह एक खेल का लेख है," और जो अवधारणाएँ उसने निकाली हैं वे "गोल," "टीम," और "स्कोर" हैं, तो वह एक उच्च स्कोर है। यदि उसने "पैसा," "राजनीति," और "मौसम" निकाला है, तो वह एक कम स्कोर है। ClassifSAS ने उच्चतम स्कोर प्राप्त किया।
  • कारण और प्रभाव (Causality): यदि आप एक अवधारणा को हटा देते हैं, तो क्या रोबोट अपना मन बदल लेता है?
    • उपमा: यदि आप रोबोट की विचार प्रक्रिया से "ओलंपिक" शब्द को हटा देते हैं, तो क्या वह "खेल" के बारे में सोचना बंद कर देता है? ClassifSAE की अवधारणाएँ इस मामले में बहुत अच्छी थीं, हालांकि एक प्रतिद्वंद्वी विधि (HI-Concept) रोबोट को मन बदलने के लिए मजबूर करने में थोड़ी बेहतर थी, लेकिन इसकी कीमत पर अवधारणाएँ समझने में कठिन हो गईं।
  • गति: ClassifSAE को प्रशिक्षित करने में मौजूदा सर्वोत्तम तरीकों की तुलना में 83% तक तेज़ था। यह टूथब्रश से सफाई करने के बजाय वैक्यूम क्लीनर का उपयोग करने जैसा है।

5. बड़ी तस्वीर (The Big Picture)

यह पेपर दिखाता है कि आपको रोबोट को समझने और उसके निर्णयों पर भरोसा करने के बीच चुनाव करने की आवश्यकता नहीं है।

  • पुराना तरीका: आपके पास एक ऐसा रोबोट हो सकता था जो बहुत सटीक था लेकिन एक रहस्य था, या एक ऐसा रोबोट जो समझने में आसान था लेकिन गलतियाँ करता था।
  • नया तरीका (ClassifSAE): आपके पास एक ऐसा रोबोट हो सकता है जो सटीक है, स्पष्ट, मानव-समान अवधारणाओं (जैसे "एयरलाइन दिवालियापन" या "साइबर सुरक्षा स्पैम") के आधार पर निर्णय लेता है, और आप इसे तेज़ी से कर सकते हैं।

संक्षेप में: ClassifSAE एक नया टूल है जो हमें रोबोट के अराजक, उच्च-गति वाले मस्तिष्क को स्पष्ट, व्यवस्थित "विचारों" की एक सूची में अनुवाद करने में मदद करता है जिन्हें मनुष्य वास्तव में पढ़ और समझ सकते हैं, जिससे यह प्रकट होता है कि रोबोट ने वह निर्णय क्यों लिया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →