← नवीनतम पेपर
💻 computer science

Friends and Grandmothers in Silico: Localizing Entity Cells in Language Models

यह शोध पत्र भाषा मॉडलों की प्रारंभिक परतों में उन विरल (sparse), कारणत्मक रूप से कार्रवाई योग्य (causally actionable) MLP न्यूरॉन्स की पहचान और सत्यापन करता है जो विशिष्ट संस्थाओं (entities) को चुनिंदा रूप से एनकोड करते हैं, यह प्रदर्शित करते हुए कि इन स्थानीयकृत कोशिकाओं को सक्रिय करने से विशिष्ट संस्था-संबंधी तथ्यात्मक ज्ञान को विश्वसनीय रूप से प्राप्त किया जा सकता है और विभिन्न भाषाई रूपों में सुदृढ़ कैनोनिकलाइजेशन (canonicalization) का समर्थन किया जा सकता है।

मूल लेखक: Itay Yona, Dan Barzilay, Michael Karasik, Mor Geva

प्रकाशित 2026-04-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Itay Yona, Dan Barzilay, Michael Karasik, Mor Geva

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल पुस्तकालय है जहाँ एक लाइब्रेरियन (AI) आपके द्वारा पूछे गए लगभग हर सवाल का जवाब जानता है। लेकिन रहस्य यह है: लाइब्रेरियन वह उत्तर वास्तव में कहाँ रखता है? क्या वह किसी विशिष्ट पृष्ठ पर लिखा है, किसी विशिष्ट दराज में संग्रहीत है, या यह एक अस्पष्ट भावना है जो लाइब्रेरियन द्वारा आपके प्रश्न को पढ़ने के साथ विकसित होती है?

यह शोध पत्र, जिसका शीर्षक "फ्रेंड्स एंड ग्रैंडमदर्स इन सिलिको" (Friends and Grandmothers in Silico) है, AI के मस्तिष्क के भीतर जाता है ताकि उस विशिष्ट "स्विच" को खोजा जा सके जो किसी विशिष्ट व्यक्ति या चीज़ के बारे में ज्ञान को सक्रिय करता है।

यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है:

1. "ग्रैंडमदर सेल" (दादी कोशिका) का विचार

न्यूरोसाइंस में, एक प्रसिद्ध (और थोड़ी विवादास्पद) अवधारणा है जिसे "ग्रैंडमदर सेल" कहा जाता है। यह सिद्धांत सुझाव देता है कि आपके मस्तिष्क में कहीं, एक एकल न्यूरॉन है जो केवल तभी सक्रिय होता है जब आप अपनी दादी को देखते हैं। यह आपके दादा, आपकी चाची, या बिल्ली की तस्वीर देखकर सक्रिय नहीं होता। यह केवल दादी के लिए है।

शोधकर्ताओं ने पूछा: क्या AI मॉडलों में तथ्यों के लिए "ग्रैंडमदर सेल्स" होते हैं?

  • क्या AI के भीतर एक विशिष्ट छोटा स्विच है जो केवल तभी जलता है जब AI "बराक ओबामा" के बारे में सोचता है?
  • या "ओबामा" की अवधारणा हजारों न्यूरॉन्स में एक कोहरे की तरह फैली हुई है?

2. जासूसी कार्य: स्विच को खोजना

शोधकर्ता जासूसों की तरह काम कर रहे थे। उन्होंने एक AI मॉडल (विशेष रूप से जिसे Qwen2.5 कहा जाता है) लिया और उससे 200 अलग-अलग प्रसिद्ध व्यक्तियों और स्थानों (जैसे "X का जीवनसाथी कौन है?" या "X कहाँ स्थित है?") के बारे में हजारों प्रश्न पूछे।

उन्होंने AI की आंतरिक "मस्तिष्क तरंगों" (एक्टिवेशन) को देखा ताकि यह देखा जा सके कि कौन से छोटे स्विच (न्यूरॉन्स) हर बार सक्रिय होते हैं जब AI किसी विशिष्ट इकाई (entity) के बारे में सोचता है, चाहे प्रश्न को किसी भी तरह से क्यों न पूछा गया हो।

खोज:
उन्होंने पाया कि कई लोकप्रिय संस्थाओं के लिए, एक विशिष्ट "स्विच" मौजूद है

  • स्थान: ये स्विच मुख्य रूप से AI के मस्तिष्क के प्रारंभिक परतों (early layers) में पाए जाते हैं (प्रसंस्करण श्रृंखला की शुरुआत में)। यह ऐसा है जैसे AI तुरंत पहचान लेता है कि "यह कौन है?", इससे पहले कि वह प्रश्न का उत्तर देने के लिए भारी काम शुरू करे।
  • स्थिरता: वही स्विच "बराक ओबामा", "ओबामा", "ब्रॉक ओबमा" (एक टाइपिंग त्रुटि), और यहाँ तक कि जब नाम अलग भाषाओं में लिखा गया हो, तब भी सक्रिय हुआ। यह सुझाव देता है कि स्विच केवल नाम के अक्षरों को नहीं पहचान रहा है, बल्कि उस व्यक्ति की पहचान को पहचान रहा है।

3. "एमनेशिया" (स्मृति लोप) परीक्षण (स्विच को बंद करना)

यह साबित करने के लिए कि ये स्विच वास्तव में महत्वपूर्ण थे, शोधकर्ताओं ने उन्हें तोड़ने की कोशिश की। उन्होंने "नेगेटिव एब्लेशन" (negative ablation) नामक एक तकनीक का उपयोग किया, जो स्विच को "ऑफ" स्थिति में पलटने या उसके ध्रुवता (polarity) को उलटने जैसा है।

  • परिणाम: जब उन्होंने "ओबामा स्विच" को बंद कर दिया, तो AI अचानक ओबामा के बारे में सब कुछ भूल गया। वह उनकी पत्नी या उनके राष्ट्रपति कार्यकाल के बारे में बताने में असमर्थ रहा।
  • नियंत्रण (Control): हालाँकि, AI अभी भी अन्य लोगों (जैसे डोनाल्ड ट्रम्प) के बारे में बिल्कुल ठीक से बात कर सकता था। वह पागल नहीं हुआ; उसे बस उस एक व्यक्ति के लिए एक विशिष्ट एमनेशिया (स्मृति लोप) हो गया।

इससे सिद्ध हुआ कि स्विच केवल एक दर्शक नहीं था; वह उस विशिष्ट ज्ञान तक पहुँचने की चाबी था।

4. "मैजिक वांड" (जादुई छड़ी) परीक्षण (स्विच को चालू करना)

इसके बाद, उन्होंने इसके विपरीत प्रयास किया। उन्होंने एक ऐसा प्रश्न लिया जिसका उत्तर AI को नहीं पता था (क्योंकि उन्होंने नाम को "X" जैसे प्लेसहोल्डर से बदल दिया था)। फिर, उन्होंने मैन्युअल रूप से "ओबामा स्विच" को बलपूर्वक चालू कर दिया।

  • परिणाम: अचानक, AI को याद आ गया! भले ही नाम गायब था, AI ओबामा के बारे में तथ्य उगलने लगा।
  • निष्कर्ष: आपको पूरे AI को फिर से प्रोग्राम करने की आवश्यकता नहीं है। बस एक एकल स्विच को चालू करना अक्सर AI को सही तथ्यों को याद करने के लिए पर्याप्त था।

5. यह क्यों मायने रखता है (द "कैनोनिकल" पहचान)

सबसे दिलचस्प बात यह है कि ये स्विच तब भी काम करते हैं जब नाम की स्पेलिंग गलत हो या संक्षिप्त नाम (acronym) का उपयोग किया गया हो।

  • यदि आप "FBI" टाइप करते हैं, तो AI उसी स्विच का उपयोग करता है जैसा कि यदि आपने "Federal Bureau of Investigation" टाइप किया होता।
  • यदि आप फ्रेंच, चीनी या हिब्रू में "पेरिस" टाइप करते हैं, तो यह उसी स्विच का उपयोग करता है।

यह सुझाव देता है कि AI केवल अक्षरों के स्ट्रिंग्स को याद नहीं कर रहा है। इसने प्रत्येक इकाई के लिए एक कैनोनिकल आइडेंटिटी कार्ड (मानक पहचान पत्र) बनाया है। "ग्रैंडमदर सेल" वह आईडी कार्ड रीडर है। एक बार आईडी स्कैन हो जाने के बाद, AI का बाकी मस्तिष्क जानता है कि किसके बारे में बात करनी है।

सावधानी (The Catch)

यह दुनिया की हर इकाई के लिए सच नहीं है।

  • यह लोकप्रिय चीजों (जैसे प्रसिद्ध राष्ट्रपति या बड़े शहर) के लिए सबसे अच्छा काम करता है।
  • यह कुछ AI मॉडलों (जैसे Qwen परिवार) में सबसे अच्छा काम करता है। अन्य मॉडलों में भी ये स्विच होते हैं, लेकिन वे अधिक बिखरे हुए और खोजने में कठिन होते हैं।
  • यह 100% का सटीक नियम नहीं है; कभी-कभी "कोहरा" (वितरित ज्ञान/distributed knowledge) अभी भी शामिल होता है।

बड़ी तस्वीर की उपमा (The Big Picture Analogy)

कल्पना कीजिए कि AI का मस्तिष्क एक विशाल, अंधेरा गोदाम है।

  • पुराना सिद्धांत: "ओबामा" लेबल वाले बॉक्स को खोजने के लिए, आपको पूरे गोदाम की तलाश करनी होगी, हर कोने से सुराग इकट्ठा करने होंगे जब तक कि आप बॉक्स को न ढूंढ लें।
  • इस शोध पत्र की खोज: वास्तव में प्रवेश द्वार के पास दीवार पर एक लाइट स्विच है। यदि आप उस विशिष्ट स्विच को चालू करते हैं, तो लाइटें जल जाती हैं, और "ओबामा" वाला बॉक्स तुरंत दिखाई देने लगता है और सुलभ हो जाता है। यदि आप उस स्विच को तोड़ देते हैं, तो बॉक्स अंधेरे में गायब हो जाता है, भले ही गोदाम अन्य बक्सों से भरा हो।

संक्षेप में: शोधकर्ताओं ने पाया कि कई तथ्यों के लिए, AI मॉडल अपने प्रसंस्करण के शुरुआती चरणों में स्थित विरल (sparse), विशिष्ट "चाबियों" पर भरोसा करते हैं। ये चाबियाँ एक मास्टर आईडी कार्ड की तरह काम करती हैं, जिससे AI को किसी व्यक्ति या स्थान के लिए एक सुसंगत पहचान को तुरंत प्राप्त करने में मदद मिलती है, चाहे आप उनके बारे में कैसे भी पूछें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →