← नवीनतम पेपर
💬 NLP

Many Circuits, One Mechanism: Input Variation and Evaluation Granularity in Circuit Discovery

यह शोध पत्र इस धारणा को चुनौती देता है कि खोजे गए सर्किटों में संरचनात्मक अंतर अलग-अलग तंत्रों का संकेत देते हैं, जो "फैंटम स्पेशलाइजेशन" (phantom specialization) के माध्यम से यह प्रदर्शित करता है कि विविध इनपुट सांख्यिकी विविध लेकिन कार्यात्मक रूप से समान सबग्राफ उत्पन्न करती है, जिससे यह स्पष्ट होता है कि मानक मूल्यांकन पद्धतियां अक्सर सर्किट संरचना और मॉडल कार्य के बीच एक-से-अनेक (many-to-one) मैपिंग को छिपा देती हैं।

मूल लेखक: Alireza Bayat Makou, Jingcheng Niu, Subhabrata Dutta, Iryna Gurevych

प्रकाशित 2026-06-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alireza Bayat Makou, Jingcheng Niu, Subhabrata Dutta, Iryna Gurevych

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, जटिल मशीन (एक बड़ा AI मॉडल) है जो एक विशिष्ट ट्रिक करता है: यह अक्षरों के एक पैटर्न को देखता है और उनमें से एक को लाइन के अंत में कॉपी कर देता है। वैज्ञानिक जानना चाहते हैं कि यह मशीन इस ट्रिक को कैसे करती है। वे इस ट्रिक के लिए जिम्मेदार मशीन के अंदर की विशिष्ट "वायरिंग" खोजने की कोशिश करते हैं। वे इस वायरिंग को एक सर्किट (circuit) कहते हैं।

लंबे समय तक, शोधकर्ताओं का मानना था कि यदि उन्हें थोड़ी अलग परिस्थितियों में एक ही ट्रिक के लिए एक अलग वायरिंग डायग्राम मिलता है, तो इसका मतलब है कि मशीन ने उस ट्रिक को करने का एक नया, विशिष्ट तरीका (specialized way) विकसित कर लिया है।

यह पेपर कहता है: इतनी जल्दी नहीं।

लेखकों ने पाया कि जो एक नए, विशिष्ट मशीन जैसा दिखता है, वह वास्तव में वही मशीन है जो एक ही ट्रिक कर रही है, लेकिन उसके साथ कुछ अतिरिक्त, अनावश्यक तार जुड़े हुए हैं। वे इसे "फैंटम स्पेशलाइजेशन" (Phantom Specialization) कहते हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. प्रयोग: "कॉपी कैट" गेम

शोधकर्ताओं ने "लिटरल सीक्वेंस कॉपीइंग" (Literal Sequence Copying) नामक एक खेल का उपयोग किया।

  • कार्य: AI एक अनुक्रम (sequence) देखता है जैसे A B C D ... A B C और उसे अगला अक्षर (D) अनुमान लगाना होता है।
  • ट्विस्ट: उन्होंने यह खेल उन शब्दों का उपयोग करके खेला जो AI के प्रशिक्षण (training) में बहुत बार आते हैं (जैसे "the") और उन शब्दों का उपयोग करके जो बहुत कम आते हैं (जैसे कोई अज्ञात संज्ञा/proper noun)।
  • अपेक्षा: उन्होंने सोचा, "शायद AI दुर्लभ शब्दों के लिए सामान्य शब्दों की तुलना में अलग सेट के आंतरिक तारों (wires) का उपयोग करता है।"

2. खोज: "रोम के कई रास्ते" वाली समस्या

जब उन्होंने सामान्य शब्दों बनाम दुर्लभ शब्दों के लिए वायरिंग डायग्राम देखे, तो डायग्राम अलग दिखे।

  • "दुर्लभ शब्द" वाले सर्किट में अधिक तार थे।
  • "सामान्य शब्द" वाले सर्किट में कम तार थे।
  • वे दो अलग-अलग ब्लूप्रिंट की तरह लग रहे थे।

हालाँकि, जब उन्होंने कार्य का परीक्षण किया:

  • उन्होंने "दुर्लभ शब्द" वाले तारों को "सामान्य शब्दों" को कॉपी करने के लिए इस्तेमाल किया। यह पूरी तरह से काम कर गया।
  • उन्होंने "सामान्य शब्द" वाले तारों को "दुर्लभ शब्दों" के लिए इस्तेमाल किया। यह भी पूरी तरह से काम कर गया।
  • निष्कर्ष: "दुर्लभ शब्द" वाले सर्किट में अतिरिक्त तार किसी विशेष काम के लिए नहीं थे। वे केवल सजावट (decoration) थे। मशीन दोनों के लिए बिल्कुल एक ही मूल तर्क (logic) का उपयोग कर रही थी।

3. उपमा: "स्पैंड्रेल" (Spandrel) या "अतिरिक्त बैकपैक"

कल्पना कीजिए कि आप हाइकिंग (hiking) कर रहे हैं।

  • परिदृश्य A: आप एक छोटी सी यात्रा के लिए एक छोटा, कुशल बैकपैक पैक करते हैं।
  • परिदृश्य B: आप एक लंबी यात्रा के लिए एक बड़ा, भारी बैकपैक पैक करते हैं।

यदि आप दोनों बैकपैक को देखते हैं, तो वे पूरी तरह से अलग दिखते हैं (संरचना)। आप सोच सकते हैं, "बड़ा बैकपैक लंबी हाइकिंग के लिए एक विशेष उपकरण है!"

लेकिन क्या होगा यदि आपको पता चले कि दोनों बैकपैक में बिल्कुल एक ही पानी की बोतल और मानचित्र है? बड़े बैकपैक में अतिरिक्त जगह केवल खाली है या उसमें कुछ यादृच्छिक (random) चीजें भरी हुई हैं जो वहां मौजूद हैं। यदि आप छोटे बैकपैक को लंबी हाइकिंग के लिए उपयोग करते हैं, तो भी आप जीवित रहेंगे। यदि आप बड़े बैकपैक को छोटी हाइकिंग के लिए उपयोग करते हैं, तो भी आप जीवित रहेंगे।

"फैंटम स्पेशलाइजेशन" यह भ्रम है कि बड़ा बैकपैक एक अलग प्रकार का उपकरण है, जबकि वास्तव में यह वही उपकरण है जिसमें कुछ अतिरिक्त, बेकार वजन जुड़ा हुआ है।

4. यह क्यों हुआ? (द "ग्रीडी" मैकेनिक)

शोधकर्ताओं ने पाया कि इन सर्किट्स को खोजने के लिए उपयोग की जाने वाली विधि एक लालची मैकेनिक (greedy mechanic) की तरह है जो कार को ठीक करने की कोशिश कर रहा है।

  • मैकेनिक चाहता है कि वह तारों का सबसे छोटा सेट खोजे जिससे कार चल सके।
  • कभी-कभी, कई तार बिल्कुल एक ही काम करते हैं (redundancy/अतिरेक)।
  • जब मैकेनिक "दुर्लभ शब्द" के इनपुट को देखता है, तो कार की आंतरिक स्थिति (internal state) थोड़ी अलग होती है। लालची मैकेनिक रखने के लिए तारों का एक सेट चुनता है और बाकी को काट देता है।
  • जब "सामान्य शब्द" को देखा जाता है, तो आंतरिक स्थिति फिर से थोड़ी अलग होती है, इसलिए मैकेनिक रखने के लिए एक अलग सेट चुनता है।

परिणाम? दो अलग-अलग वायरिंग डायग्राम जो दोनों कार को पूरी तरह से चला सकते हैं। अंतर इसलिए नहीं है क्योंकि कार को अलग इंजन की आवश्यकता है; यह सिर्फ इसलिए है क्योंकि मैकेनिक ने समान रूप से अच्छे विकल्पों के बीच अलग-अलग यादृच्छिक चुनाव किए।

5. "ज़ूम लेंस" की समस्या (इवैल्यूएशन ग्रैनुलैरिटी)

पेपर में यह भी पाया गया कि वैज्ञानिक अक्सर गलत "लेंस" के माध्यम से सर्किट्स को देख रहे थे।

  • "सोर्स-लेवल" लेंस (ज़ूम आउट): यह पूरे घटक (जैसे एक पूरा चिप) को देखता है। यदि चिप का कोई भी तार सक्रिय है, तो पूरे चिप को "काम करने वाला" माना जाता है। यह सर्किट्स को बहुत निष्ठावान और अलग दिखाता है।
  • "एज-लेवल" लेंस (ज़ूम इन): यह विशिष्ट तारों को देखता है। जब आप ज़ूम इन करते हैं, तो आप देखते हैं कि चुने गए कई तार वास्तव में अनावश्यक थे।

पेपर का तर्क है कि यदि आप केवल दूर से (Source-Level) देखते हैं, तो आप "फैंटम स्पेशलाइजेशन" देखते हैं। यदि आप ज़ूम इन करते हैं (Edge-Level), तो आप देखते हैं कि सर्किट वास्तव में बिल्कुल एक ही चीज़ कर रहे हैं।

मुख्य निष्कर्षों का सारांश

  1. अलग तार \neq अलग तर्क: केवल इसलिए कि दो सर्किट कागज़ पर अलग दिखते हैं, इसका मतलब यह नहीं है कि वे अलग काम करते हैं।
  2. "फैंटम": स्पष्ट स्पेशलाइजेशन एक भ्रम है जो इन सर्किट्स को निकालने और मापने के तरीके के कारण होता है।
  3. अतिरेक (Redundancy) वास्तविक है: AI मॉडल्स में कई बैकअप रास्ते होते हैं। यदि एक रास्ता काट दिया जाता है, तो दूसरा काम संभाल लेता है। इससे "एक सच्चे" सर्किट को खोजना कठिन हो जाता है।
  4. इसे कैसे ठीक करें: AI कैसे काम करता है यह समझने के लिए, हमें केवल एक सर्किट को नहीं देखना चाहिए। हमें:
    • यह परीक्षण करना चाहिए कि क्या एक सर्किट विभिन्न प्रकार के इनपुट पर काम करता है (ट्रांसफर टेस्ट)।
    • बड़े घटकों के बजाय विशिष्ट तारों को देखना चाहिए (एज-लेवल इवैल्यूएशन)।
    • निष्कर्षण (extraction) को कई बार चलाना चाहिए और देखना चाहिए कि क्या समान रहता है (मल्टीपल एक्सट्रैक्शन)।

संक्षेप में: AI दुर्लभ शब्दों के लिए नया इंजन नहीं बना रहा है; यह बस एक अलग टोपी पहन रहा है। टोपी अलग दिखती है, लेकिन उसके नीचे का इंजन वही है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →