← नवीनतम पेपर
💬 NLP

How Much Do Circuits Tell Us? Measuring the Consistency and Specificity of Language Model Circuits

यह शोध पत्र यह प्रदर्शित करता है कि जबकि पहचाने गए भाषा मॉडल सर्किट कार्य प्रदर्शन के लिए अत्यधिक सुसंगत और आवश्यक हैं, वे पर्याप्त क्रॉस-टास्क ओवरलैप के कारण कार्य-विशिष्टता की कमी रखते हैं, जिससे लक्षित हस्तक्षेप और समझ के लिए इस ढांचे की उपयोगिता को चुनौती मिलती है।

मूल लेखक: Michael Li, Nishant Subramani

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michael Li, Nishant Subramani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक विशाल, जटिल फैक्ट्री (एक लार्ज लैंग्वेज मॉडल) की कल्पना करें जो गणित करने से लेकर चुटकुले सुनाने तक, हर तरह की समस्याओं को हल कर सकती है। लंबे समय से, वैज्ञानिक यह पता लगाने की कोशिश कर रहे हैं कि इस फैक्ट्री के अंदर कौन सी विशिष्ट मशीनें किस काम के लिए जिम्मेदार हैं। वे इन विशिष्ट समूहों को "सर्किट्स" (circuits) कहते हैं।

यह शोध पत्र इन सर्किट्स के बारे में दो सरल प्रश्न पूछता है:

  1. निरंतरता (Consistency): यदि फैक्ट्री एक ही काम (जैसे संख्या जोड़ना) दस बार करती है, तो क्या वह हर बार बिल्कुल उन्हीं मशीनों का उपयोग करती है?
  2. विशिष्टता (Specificity): यदि फैक्ट्री गणित का काम करती है, तो क्या वह इतिहास के काम के दौरान उपयोग की जाने वाली मशीनों से अलग मशीनें उपयोग करती है?

शोधकर्ताओं ने सरल उपमाओं का उपयोग करते हुए जो पाया, वह यहाँ दिया गया है:

1. "निरंतरता" परीक्षण: हाँ, वे विश्वसनीय हैं।

शोधकर्ताओं ने यह जांचा कि क्या फैक्ट्री एक ही काम के लिए समान उपकरणों का उपयोग करती है।

  • निष्कर्ष: हाँ! यदि फैक्ट्री को संख्याएं जोड़ने के लिए कहा जाता है, तो वह लगभग हर गणित संबंधी समस्या के लिए भरोसेमंद तरीके से मशीनों के एक विशिष्ट सेट (मुख्य रूप से "MLP लेयर्स", जो फैक्ट्री के भारी-भरकम कार्यबेंच की तरह हैं) का उपयोग करती है।
  • उपमा: यह एक शेफ द्वारा एक विशिष्ट केक बनाने जैसा है। जब भी वे वह केक बनाते हैं, वे उसी मिक्सर और उसी ओवन का उपयोग करते हैं। वे काम के बीच में ब्लेंडर या टोस्टर पर स्विच नहीं करते हैं। शोधकर्ताओं ने पाया कि यदि उन्होंने इन विशिष्ट मशीनों को "अनप्लग" कर दिया होता, तो फैक्ट्री उस कार्य पर काम करना लगभग पूरी तरह से बंद कर देती। इससे यह सिद्ध होता है कि ये मशीनें वास्तव में काम कर रही हैं, न कि केवल वहां व्यस्त दिखने के लिए बैठी हैं।

2. "विशिष्टता" परीक्षण: नहीं, वे अद्वितीय नहीं हैं।

यह चौंकाने वाला हिस्सा है। शोधकर्ता उम्मीद कर रहे थे कि "गणित" के लिए उपयोग की जाने वाली मशीनें "इतिहास" या "तर्क" (Logic) के लिए उपयोग की जाने वाली मशीनों से बिल्कुल अलग होंगी।

  • निष्कर्ष: वे गलत थे। गणित के लिए उपयोग की जाने वाली मशीनें लगभग वही मशीनें हैं जो इतिहास, तर्क और यहाँ तक कि समझ (reading comprehension) के लिए उपयोग की जाती हैं।
  • उपमा: कल्पना कीजिए कि आपके पास एक टूलबॉक्स है। आपने सोचा था कि "गणित बॉक्स" में केवल गणित के उपकरण (रूलर, कैलकुलेटर) होंगे और "इतिहास बॉक्स" में केवल इतिहास के उपकरण (नक्शे, किताबें) होंगे। लेकिन जब आपने दोनों बॉक्स खोले, तो आपने पाया कि दोनों बॉक्सों में समान 90% उपकरण थे।
    • यदि आप टूलबॉक्स से "गणित के उपकरण" निकाल लेते, तो फैक्ट्री गणित नहीं कर पाती।
    • लेकिन यदि आप उन्हीं उपकरणों को निकाल देते, तो फैक्ट्री इतिहास या तर्क भी नहीं कर पाती।
    • यह स्पष्ट है कि फैक्ट्री हर काम को करने के लिए एक विशाल, साझा "इन्फ्रास्ट्रक्चर" (कार्यबेंच/MLP लेयर्स) पर निर्भर करती है। ये उपकरण सभी कार्यों के लिए आधार हैं, न कि केवल एक के लिए।

3. "छिपे हुए रत्न" (Hidden Gems): थोड़ी सी विशिष्टता।

क्या कार्यों के बीच कोई अंतर है?

  • निष्कर्ष: हाँ, लेकिन यह बहुत कम है। साझा उपकरणों के बड़े ढेर के भीतर, विशिष्ट कार्यों के लिए एक छोटा, विशेष सेट (कुल का लगभग 10-30%) मौजूद है।
  • उपमा: टूलबॉक्स वाली बात पर वापस चलते हैं: हालांकि 90% उपकरण साझा हैं, लेकिन "गणित बॉक्स" के अंदर एक छोटा, विशेष कैलकुलेटर है जो "इतिहास बॉक्स" में नहीं है। यदि आप केवल उस कैलकुलेटर को हटा देते हैं, तो गणित विफल हो जाता है, लेकिन इतिहास का काम चलता रहता है। हालाँकि, क्योंकि साझा 90% इतना बड़ा और महत्वपूर्ण है, पूरे "गणित बॉक्स" को हटाने से सब कुछ टूट जाता है, जिससे ऐसा लगता है कि केवल गणित के उपकरण ही महत्वपूर्ण थे।

मुख्य निष्कर्ष (The Big Picture)

शोध पत्र निष्कर्ष निकालता है कि जब हम भाषा मॉडल को "अटेंशन हेड्स" और "MLP लेयर्स" (फैक्ट्री के बड़े, दृश्य भागों) के स्तर पर देखते हैं, तो हम मुख्य रूप से इमारत के सामान्य बुनियादी ढांचे (general infrastructure) को देख रहे होते हैं, न कि प्रत्येक कार्य के विशिष्ट ब्लूप्रिंट को।

  • इसका अर्थ क्या है: हम उस "कार्यबेंच" को आसानी से ढूंढ सकते हैं जिसका मॉडल उपयोग करता है, लेकिन हम आसानी से यह नहीं बता सकते कि कौन सा कार्यबेंच केवल गणित के लिए है और कौन सा केवल इतिहास के लिए है, क्योंकि वे दोनों के लिए उपयोग किए जाते हैं।
  • चेतावनी: शोधकर्ता सुझाव देते हैं कि वास्तव में अद्वितीय "विशेषज्ञ उपकरणों" (वह छोटा 10%) को खोजने के लिए, हमें और करीब से देखने की आवश्यकता हो सकती है, शायद पूरे कार्यबेंच के बजाय व्यक्तिगत पेंच या तारों (न्यूरॉन्स या फीचर्स) को देखकर।

संक्षेप में: मॉडल सुसंगत है (यह एक ही काम के लिए समान उपकरणों का उपयोग करता है), लेकिन यह विशिष्ट नहीं है (यह हर काम के लिए समान उपकरणों का उपयोग करता है)। जो "सर्किट्स" हम पाते हैं, वे ज्यादातर मॉडल का साझा आधार हैं, न कि किसी एकल कार्य के लिए अद्वितीय निर्देश।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →