← नवीनतम पेपर
🤖 machine learning

Scalable Circuit Learning for Interpreting Large Language Models

यह शोध पत्र CircuitLasso प्रस्तुत करता है, जो एक स्केलेबल स्पार्स लीनियर रिग्रेशन विधि है जो बड़े भाषा मॉडलों (LLMs) में स्पार्स ऑटोएन्कोडर फीचर्स पर व्याख्या योग्य सर्किट्स को कुशलतापूर्वक सीखती है, जो महंगी हस्तक्षेप-आधारित तकनीकों की सटीकता के बराबर है और बहुत कम कम्प्यूटेशनल लागत पर प्रभावी डोमेन सामान्यीकरण (domain generalization) को सक्षम करती है।

मूल लेखक: Naiyu Yin, Dennis Wei, Tian Gao, Amit Dhurandhar, Karthikeyan Natesan Ramamurthy, Yue Yu

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Naiyu Yin, Dennis Wei, Tian Gao, Amit Dhurandhar, Karthikeyan Natesan Ramamurthy, Yue Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल, अविश्वसनीय रूप से जटिल फैक्ट्री के रूप में करें। इस फैक्ट्री के अंदर, लाखों नन्हे कर्मचारी (न्यूरॉन्स) अंतिम आउटपुट बनाने के लिए—यानी एक वाक्य या उत्तर देने के लिए—एक-दूसरे को नोट्स पास करते हैं।

लंबे समय से, वैज्ञानिक जो यह समझने की कोशिश कर रहे थे कि यह फैक्ट्री कैसे काम करती है, उन्हें एक बड़ी समस्या का सामना करना पड़ा: कर्मचारी भ्रमित हैं। एक ही कर्मचारी "सेब", "लाल रंग" और "स्वास्थ्य" की अवधारणा, इन तीनों से एक साथ सक्रिय हो सकता है। क्योंकि एक ही कर्मचारी कई असंबंधित चीजें करता है, इसलिए यह बताना कठिन हो जाता है कि अंतिम वाक्य के किस हिस्से के लिए कौन सा विशिष्ट कर्मचारी जिम्मेदार है। यह ऐसा है जैसे यह पता लगाने की कोशिश करना कि केक किसने बनाया, जबकि रसोई का हर बेकर एक ही समय में आटा, अंडे और पेंटब्रश के साथ करतब दिखा रहा हो।

नया टूल: "फीचर डिटेक्टर्स" (विशेषता पहचानकर्ता)

इसे ठीक करने के लिए, शोधकर्ताओं ने एक विशेष टूल का उपयोग करना शुरू किया जिसे स्पार्स ऑटोएनकोडर (SAE) कहा जाता है। इसे एक अनुवादक के रूप में समझें जो फैक्ट्री के कर्मचारियों और बाहरी दुनिया के बीच बैठता है। सीधे भ्रमित कर्मचारियों को देखने के बजाय, यह अनुवादक उनकी गतिविधि को बहुत विशिष्ट, एकल-उद्देश्य वाले "फीचर्स" (विशेषताओं) में समूहित करता है।

अब, एक कर्मचारी द्वारा सब कुछ संभालने के बजाय, हमारे पास एक समर्पित "स्पोर्ट्स फैन" फीचर, एक "ग्रामर पुलिस" फीचर, या एक "भूख" फीचर है। प्रत्येक फीचर केवल एक स्पष्ट अवधारणा के लिए सक्रिय होता है। यह फैक्ट्री के आंतरिक कामकाज को समझना बहुत आसान बना देता है।

समस्या: बहुत अधिक डेटा

यहाँ एक पेंच है: हालाँकि ये "फीचर्स" बहुत स्पष्ट हैं, लेकिन इनकी संख्या हजारों में है। यह मैप करना कि ये हजारों फीचर्स आपस में कैसे बात करते हैं, एक विशाल शहर के हर एक सड़क के नक्शे को बनाने जैसा है, जबकि आप ऐसी कार चला रहे हैं जो केवल एक मील प्रति घंटा की गति से चल सकती है।

कनेक्शन को मैप करने के पुराने तरीकों के लिए "इंटरवेंशन" (हस्तक्षेप) की आवश्यकता होती थी। कल्पना कीजिए कि आप हर एक सड़क को एक-एक करके भौतिक रूप से ब्लॉक करके यह देखने की कोशिश कर रहे हैं कि क्या होता है। यह अविश्वसनीय रूप से धीमा, महंगा और गणनात्मक रूप से असंभव है।

समाधान: सर्किट-लासों (CircuitLasso)

इस पेपर के लेखक एक नया तरीका पेश करते हैं जिसे सर्किट-लासों कहा जाता है।

सड़कों को एक-एक करके ब्लॉक करने के बजाय, सर्किट-लासों एक सुपर-स्मार्ट जासूस की तरह काम करता है जो आवर्धक लेंस (मैग्निफाइंग ग्लास) और एक सांख्यिकीय शॉर्टकट का उपयोग करता है। यह पहले से ही स्वाभाविक रूप से हो रहे ट्रैफिक पैटर्न (डेटा) को देखता है और कनेक्शन का पता लगाने के लिए "स्पार्स रिग्रेशन" नामक एक गणितीय तकनीक का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप जानना चाहते हैं कि सूप में कौन सी सामग्रियां आवश्यक हैं।
    • पुराना तरीका (इंटरवेंशन): आप सूप चखते हैं, फिर एक सामग्री हटाते हैं, फिर से चखते हैं, उसे वापस रखते हैं, दूसरी सामग्री हटाते हैं, फिर से चखते हैं... यह हर एक मसाले के लिए करने में बहुत समय लगता है।
    • सर्किट-लासों: आप सभी सामग्रियों की एक सूची और अंतिम स्वाद को देखते हैं, और आप तुरंत गणना करते हैं कि वास्तव में कौन सी सामग्रियां मुख्य भूमिका निभा रही हैं। यह बहुत तेज़ है और इसमें सूप के साथ छेड़छाड़ करने की आवश्यकता नहीं है।

उन्होंने क्या पाया

यह पेपर तीन मुख्य बातें दावा करता है:

  1. बिना समझौते के गति: सर्किट-लासों पुराने "सड़कें ब्लॉक करने वाले" तरीकों की तुलना में नाटकीय रूप से तेज़ है। उनके परीक्षणों में, यह मानक बेंचमार्क पर 3 गुना तेज़ था, फिर भी इसने समान सटीकता के साथ बिल्कुल वही "सर्किट्स" (कनेक्शन के नक्शे) खोज निकाले।
  2. स्पष्ट कहानियाँ: क्योंकि यह भ्रमित न्यूरॉन्स के बजाय स्पष्ट, एकल-उद्देश्य वाले फीचर्स (जैसे "भूख" या "व्याकरण") के साथ काम करता है, इसलिए इसके द्वारा बनाए गए नक्शे इंसानों के समझने में आसान हैं। उन्होंने "पेड़ के आकार के" पथ पाए जो दिखाते हैं कि "भूख" जैसी अवधारणा मॉडल की परतों के माध्यम से कैसे प्रवाहित होती है, जो अंततः "खाने" की क्रिया की ओर ले जाती है। उन्होंने "स्प्यूरियस कोरिलेशन" (मिथ्या सहसंबंध) भी पकड़े—वे गलत कनेक्शन जहाँ मॉडल सोचता है कि "भूख" का "स्वयं" (self) से संबंध है, सिर्फ इसलिए क्योंकि वे शब्द अक्सर प्रशिक्षण डेटा में एक साथ दिखाई देते हैं।
  3. वास्तविक दुनिया की उपयोगिता: उन्होंने इस कार्य पर इसका परीक्षण किया जहाँ मॉडल को किसी व्यक्ति की जीवनी से उसकी नौकरी का अनुमान लगाना था। मॉडल पक्षपाती था (उदाहरण के लिए, यह मान लेना कि सभी नर्स महिलाएं हैं)। सर्किट-लासों का उपयोग करके उन विशिष्ट "जेंडर" (लिंग) फीचर्स की पहचान करने और उन्हें हटाने से, जिन्होंने इस पूर्वाग्रह को पैदा किया था, वे मॉडल के भविष्यवाणियों को ठीक करने में सक्षम हुए। उन्होंने यह काम पिछले तरीकों की तुलना में बहुत सस्ता और तेज़ तरीके से किया, जिससे समान या थोड़े बेहतर परिणाम प्राप्त हुए।

निचोड़

यह पेपर एआई मॉडल्स के सोचने के तरीके को रिवर्स-इंजीनियर करने का एक कुशल तरीका प्रस्तुत करता है। भ्रमित कर्मचारियों को देखने के बजाय स्पष्ट, एकल-उद्देश्य वाले फीचर्स पर स्विच करके, और धीमी, ब्रूट-फोर्स टेस्टिंग के बजाय एक तेज़ गणितीय शॉर्टकट का उपयोग करके, लेखकों ने एक ऐसा टूल बनाया है जो बड़े एआई मॉडल्स के "मस्तिष्क" को तेज़ी से और स्पष्ट रूप से मैप कर सकता है। यह न केवल यह समझने में मदद करता है कि एआई क्या कहता है, बल्कि यह भी कि वह ऐसा क्यों कहता है, और जब वह गलतियाँ करता है तो उसे कैसे ठीक किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →