← नवीनतम पेपर
💬 NLP

Detection vs. Execution: Single-Bucket Probes Miss Half the Mamba-2 State Sink

यह शोध पत्र प्रदर्शित करता है कि Mamba-2 में, सिंगल-बकेट प्रोब्स द्वारा पहचाने गए रिप्रजेंटेशनल सिग्नेचर अक्सर स्टेट सिंक घटना के लिए विशिष्ट डिटेक्शन और एक्जीक्यूशन सर्किट्स को मिला देते हैं, जो यह प्रकट करता है कि केवल हीड्स का एक विशिष्ट उपसमूह (BOS-स्पेशलिस्ट्स) ही महत्वपूर्ण लॉन्ग-कॉन्टेक्स्ट रिट्रीवल प्रदर्शन को कारणवत रूप से संचालित करता है, जबकि अन्य समान रिप्रजेंटेशन वाले हीड्स ऐसा नहीं करते हैं।

मूल लेखक: Yuhang Jiang

प्रकाशित 2026-06-02
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuhang Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "परछाईं" बनाम "अभिनेता" को देखना

कल्पना कीजिए कि आप यह समझने की कोशिश कर रहे हैं कि एक विशाल, जटिल ऑर्केस्ट्रा एक विशिष्ट गाना कैसे बजाता है। आपके पास एक माइक्रोफ़ोन (एक प्रोब) है जो यह पता लगा सकता है कि कब कोई विशिष्ट वाद्य यंत्र ज़ोर से बज रहा है।

AI अनुसंधान की दुनिया में, वैज्ञानिक अक्सर यह मान लेते हैं कि यदि उनका माइक्रोफ़ोन किसी विशिष्ट वाद्य यंत्र से तेज़ आवाज़ पकड़ता है, तो वही वाद्य यंत्र वास्तव में धुन बजा रहा है।

यह शोध पत्र तर्क देता है कि Mamba-2 नामक एक नए प्रकार के AI मॉडल में, यह धारणा गलत है। माइक्रोफ़ोन गतिविधि की एक विशाल "परछाईं" का पता लगाता है, लेकिन वास्तविक "अभिनेता" जो मुख्य काम कर रहा है, वह उस परछाईं के भीतर एक छोटा, छिपा हुआ समूह है। यदि आप केवल तेज़ आवाज़ को देखते हैं, तो आप वास्तविक तंत्र (mechanism) को चूक जाते हैं।

परिवेश: "स्टेट सिंक" (State Sink)

इस समस्या को समझने के लिए, हमें यह समझने की आवश्यकता है कि AI क्या कर रहा है।

  • उपमा (Analogy): कल्पना कीजिए कि लोगों की एक लंबी कतार पानी की एक बाल्टी को आगे बढ़ा रही है। हर बार जब एक नया व्यक्ति कतार में शामिल होता है (वाक्य में एक नया शब्द), तो सबसे आगे वाला व्यक्ति (वाक्य की शुरुआत या BOS टोकन) को बाल्टी को बहुत कसकर पकड़ना पड़ता है ताकि पानी न गिरे।
  • विज्ञान: AI मॉडल्स में, इस "कसकर पकड़ने" को स्टेट सिंक (State Sink) कहा जाता है। मॉडल अपनी मेमोरी को स्थिर रखने के लिए शुरुआती कुछ टोकन (जैसे वाक्य की शुरुआत या नई लाइन) पर भारी मात्रा में ऊर्जा केंद्रित करता है।

खोज: दो समूह, एक संकेत

शोधकर्ताओं ने Mamba-2 मॉडल्स का अध्ययन किया और पाया कि यह "स्टेट सिंक" केवल श्रमिकों का एक बड़ा समूह नहीं है। यह वास्तव में दो अलग-अलग समूह हैं जो एक साधारण डिटेक्टर को एक जैसे दिखते हैं, लेकिन वे बहुत अलग काम करते हैं।

1. "BOS-विशेषज्ञ" (एग्जीक्यूशन लेयर/Execution Layer)

  • वे कौन हैं: श्रमिकों का एक छोटा समूह (कुल का केवल लगभग 5%)।
  • वे क्या करते हैं: वे काम करने वाले (doers) हैं। वे ही वास्तव में बाल्टी को पकड़े हुए हैं और पानी का प्रवाह बनाए रख रहे हैं। यदि आप उन्हें हटा देते हैं, तो पूरी कतार ढह जाएगी, और AI सब कुछ भूल जाएगा।
  • पेपर का दावा: ये "एग्कजीक्यूशन" सर्किट हैं। ये वे हैं जो वास्तव में गणना (calculation) कर रहे हैं।

2. "डुअल हेड्स" (डिटेक्शन लेयर/Detection Layer)

  • वे कौन हैं: एक बहुत बड़ा समूह (लगभग 30%)।
  • वे क्या करते हैं: वे देखने वाले (watchers) हैं। वे काम करने वालों के बगल में खड़े हैं, उसी चीज़ को देख रहे हैं, और उतने ही उत्साहित भी हो रहे हैं। एक साधारण माइक्रोफ़ोन (एक "सिंगल-बकेट प्रोब") के लिए, वे काम करने वालों जैसे ही दिखते हैं। उनके संकेत लगभग समान हैं।
  • ट्विस्ट: यदि आप इन देखने वालों को हटा देते हैं, तो AI अभी भी ठीक से काम करता है! वे भारी काम नहीं कर रहे हैं। वे बस "डिटेक्ट" कर रहे हैं कि कुछ महत्वपूर्ण हो रहा है।
  • पेपर का दावा: ये "डिटेक्शन" सर्किट हैं। इनके पास सही सिग्नेचर (दिखावा) है (वे ऐसा दिखते हैं जैसे काम कर रहे हों) लेकिन सही फंक्शन (कार्य) नहीं है (वे वास्तव में काम नहीं कर रहे हैं)।

गलती: "सिंगल-बकेट" जाल

इन दोनों समूहों के बीच भ्रमित होने की गलती को पेपर में "सिंगल-बकेट प्रोब" त्रुटि कहा गया है।

  • उपमा: कल्पना कीजिए कि आप एक रसोई में सर्वश्रेष्ठ शेफ को खोजने की कोशिश कर रहे हैं और आपसे पूछते हैं, "चाकू कौन पकड़े हुए है?"
    • आपको हेड शेफ (BOS-विशेषज्ञों) का एक छोटा समूह मिलता है जो वास्तव में भोजन पका रहे हैं।
    • आपको सॉस शेफ (Dual Heads) का एक बड़ा समूह भी मिलता है जो चाकू पकड़े हुए हैं लेकिन केवल सजावट के लिए सब्जियां काट रहे हैं।
    • यदि आप एक सरल परीक्षण का उपयोग करते हैं जो केवल यह कहता है कि "चाकू पकड़े हुए कोई भी हेड शेफ है," तो आप गलती से सोच लेंगे कि सॉस शेफ मुख्य व्यंजन पका रहे हैं।
    • परिणाम: आप सोचते हैं कि आपने पूरी रसोई टीम को ढूंढ लिया है, लेकिन आप यह समझने में चूक गए कि वास्तविक खाना पकाने का काम एक छोटी, विशिष्ट टीम द्वारा किया जा रहा है।

Mamba-2 में, "चाकू" गणितीय संकेत (mathematical signals) हैं। साधारण प्रोब दोनों समूहों को उन्हें पकड़े हुए देखता है, लेकिन केवल छोटा समूह ही वास्तव में खाना पका रहा है।

ऐसा क्यों होता है? (आर्किटेक्चर)

Mamba-2 में यह "परछाईं" वाला समूह क्यों है जबकि पुराने मॉडल्स में ऐसा नहीं है?

  • Mamba-1 (पुराना मॉडल): कल्पना कीजिए कि एक रसोई जहाँ हर शेफ का अपना निजी काउंटर है। यदि कोई शेफ वाक्य की शुरुआत पर ध्यान केंद्रित करना चाहता है, तो वह किसी और को परेशान किए बिना ऐसा कर सकता है। यहाँ "काम करने वाले" और "देखने वाले" एक ही लोग हैं।
  • Mamba-2 (नया मॉडल): कल्पना कीजिए कि एक रसोई जहाँ शेफ को एक ही छोटे काउंटर को साझा करने के लिए मजबूर किया जाता है। क्योंकि उन्हें जगह साझा करनी पड़ती है, उन्हें एक साथ कई काम करने पड़ते हैं।
    • मॉडल कई 'हेड्स' को "मल्टीप्लेक्स" (एक साथ दो काम करना) करने के लिए मजबूर करता है।
    • एक काम है वाक्य की शुरुआत को डिटेक्ट करना (देखने वाले)।
    • दूसरा काम है रिसेट को एग्जीक्यूट करना (काम करने वाले)।
    • क्योंकि वे एक ही स्थान साझा करते हैं, वे एक साधारण प्रोब को एक जैसे दिखते हैं, भले ही उनके काम अलग हों।

प्रमाण: "नीडल इन अ हेस्टैक" (Needle in a Haystack) टेस्ट

यह साबित करने के लिए कि छोटा समूह (विशेषज्ञ) ही असली हीरो है और बड़ा समूह (Dual Heads) केवल एक दर्शक है, शोधकर्ताओं ने "नीडल इन अ हेस्टैक" टेस्ट किया।

  • टेस्ट: उन्होंने एक विशाल किताब (हेस्टैक) के भीतर एक विशिष्ट वाक्य (सुई/नीडल) को छिपा दिया और AI को उसे खोजने के लिए कहा।
  • परिणाम:
    • जब उन्होंने छोटे समूह (विशेषज्ञों) को हटाया: AI पूरी तरह से विफल हो गया। वह सुई को बिल्कुल नहीं ढूंढ सका। सटीकता 100% से गिरकर 0% हो गई।
    • जब उन्होंने बड़े समूह (Dual Heads) को हटाया: AI ने सुई को सफलतापूर्वक ढूंढ लिया।
    • निष्कर्ष: बड़ा समूह केवल देख रहा था; छोटा समूह ही वास्तव में सुई को याद रख रहा था।

पेपर के दावों का सारांश

  1. डिटेक्शन \neq एग्जीक्यूशन: केवल इसलिए कि AI का एक हिस्सा सक्रिय (डिटेक्ट) हो रहा है, इसका मतलब यह नहीं है कि वह काम (एग्जीक्यूशन) कर रहा है।
  2. विभाजन: Mamba-2 में, "स्टेट सिंक" एक छोटे एग्जीक्यूशन लेयर (5% हेड्स) और एक बड़े डिटेक्शन लेयर (30% हेड्स) में विभाजित है।
  3. जाल: साधारण प्रोब्स (सिंगल-बकेट) केवल बड़े डिटेक्शन लेयर को देखते हैं और छोटे एग्जीक्यूशन लेयर को मिस कर देते हैं।
  4. समाधान: Mamba-2 को समझने के लिए, आप केवल यह नहीं देख सकते कि कौन "ज़ोर से" बोल रहा है। आपको यह टेस्ट करना होगा कि वास्तव में कौन आवश्यक है, उन्हें हटाकर और यह देखकर कि क्या AI टूट जाता है।
  5. आर्किटेक्चर मायने रखता है: यह इसलिए होता है क्योंकि Mamba-2 जिस तरह से बना है (शेयर्ड प्रोजेक्शंस), उसके कारण, न कि केवल मॉडल के आकार के कारण।

संक्षेप में: यह पेपर हमें चेतावनी देता है कि नए Mamba-2 मॉडल्स में, मस्तिष्क के "तेज़" हिस्से हमेशा सोचने वाले हिस्से नहीं होते हैं। एक छिपा हुआ, छोटा दल वास्तविक काम कर रहा है, और एक बहुत बड़ा दल बस व्यस्त दिखने के लिए खड़ा है। यदि आप केवल शोर को सुनेंगे, तो आप असली कहानी को चूक जाएंगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →