← नवीनतम पेपर
🤖 machine learning

Where's the Plan? Locating Latent Planning in Language Models with Lightweight Mechanistic Interventions

यह शोध पत्र इस बात की जांच करता है कि भाषा मॉडल योजना बनाने के दौरान भविष्य के बाधाओं (constraints) के आंतरिक निरूपण कहाँ और कैसे बनाते हैं, यह प्रकट करते हुए कि जबकि भविष्य-तुकबंदी (future-rhyme) की जानकारी कई मॉडल परिवारों और पैमानों में रैखिक रूप से डिकोडेबल है, केवल Gemma-3-27B इस जानकारी का उपयोग करने के लिए एक विशिष्ट विलंबित-परत हैंडऑफ तंत्र (late-layer handoff mechanism) पर कारणवश निर्भर करता है, जबकि अन्य मॉडल तुकबंदी वाले शब्द पर ही आधारित होते हैं बावजूद इसके कि वे मजबूत प्रोब सिग्नल प्रदर्शित करते हैं।

मूल लेखक: Nicole Ma, Nick Rui

प्रकाशित 2026-05-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nicole Ma, Nick Rui

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जादूगर को करतब दिखाते हुए देख रहे हैं। आप उन्हें टोपी से खरगोश निकालते हुए देखते हैं, लेकिन आपको नहीं पता कि उन्होंने यह कैसे किया। क्या खरगोश उनके पूरे समय उनकी आस्तीन में छिपा हुआ था? या क्या उन्होंने टोपी में हाथ डालते ही उसे जादुई रूप से प्रकट कर दिया?

यह पेपर AI मॉडल्स के लिए एक्स-रे चश्मे की तरह है। शोधकर्ता जानना चाहते थे: जब एक AI कविता लिखता है, तो क्या वह अगली पंक्ति लिखने से पहले ही अंत को गुप्त रूप से "योजना" (plan) बनाता है?

यहाँ उनकी खोज की कहानी है, जिसे सरल भागों में विभाजित किया गया है।

परीक्षण: तुकबंदी की चुनौती (The Rhyming Challenge)

इसका परीक्षण करने के लिए, शोधकर्ताओं ने AI मॉडल्स को एक सरल कार्य दिया: एक तुकबंदी वाली दो पंक्तियों (couplet) को पूरा करना।

  • प्रॉम्प्ट (Prompt): "She felt a sudden sense of fright," (उसे अचानक डर महसूस हुआ,)
  • लक्ष्य: AI को दूसरी पंक्ति लिखनी होगी जिसका अंत ऐसे शब्द से हो जो "fright" के साथ तुकबंदी करता हो (जैसे "night" या "light")।

सवाल यह था: क्या AI के पास एक गुप्त आंतरिक नोट है जिसमें लिखा है "मुझे 'fright' के साथ तुकबंदी करनी है" इससे पहले कि वह दूसरी पंक्ति टाइप करना शुरू करे? या क्या वह बस जैसे-जैसे आगे बढ़ता है, शब्द-दर-शब्द इसे समझ लेता है?

दो उपकरण: "जासूस" और "समय यात्री" (The Spy and the Time Traveler)

शोधकर्ताओं ने AI के मस्तिष्क (इसके "हिडन स्टेट्स" या छिपी हुई अवस्थाओं) के भीतर झांकने के लिए दो अलग-अलग तरीकों का उपयोग किया।

  1. जासूस (लिनियर प्रोबिंग - Linear Probing):
    कल्पना कीजिए कि एक जासूस है जो AI के नोट्स में झाँक सकता है और पूछ सकता है, "हे, क्या तुम्हें पता है कि अगला शब्द क्या होगा?"
  • उन्होंने क्या पाया: लगभग हर AI मॉडल (Qwen, Llama, और Gemma) में, जिसे उन्होंने टेस्ट किया, जासूस को उत्तर मिल गया! ठीक उसी क्षण जब AI ने पहली पंक्ति पूरी की (न्यूलाइन कैरेक्टर पर), AI के आंतरिक नोट्स में तुकबंदी के बारे में जानकारी मौजूद थी।
  • पेंच (The Catch): सिर्फ इसलिए कि जासूस ने नोट ढूँढ लिया, इसका मतलब यह नहीं है कि AI वास्तव में उसका उपयोग कर रहा है। यह ऐसा हो सकता है जैसे आपकी जेब में एक नक्शा हो लेकिन आप उसे अनदेखा कर दें और बस बेतरतीब ढंग से चलते रहें।
  1. समय यात्री (एक्टिवेशन पैचिंग - Activation Patching):
    यह असली परीक्षण है। कल्पना कीजिए कि आप AI हैं। आप दूसरी पंक्ति लिखने वाले हैं। शोधकर्ता "टाइम ट्रैवल" करते हैं और आपके वर्तमान मस्तिष्क की स्थिति को एक अलग AI की मस्तिष्क स्थिति के साथ बदल देते हैं जो एक अलग शब्द के साथ तुकबंदी करने की कोशिश कर रहा था (उदाहरण के लिए, "fright" के बजाय "fear" के साथ तुकबंदी करना)।
  • प्रश्न: यदि आप मस्तिष्क की स्थिति बदलते हैं, तो क्या AI अचानक ऐसे शब्द लिखना शुरू कर देता है जो "fear" के साथ तुकबंदी करते हैं?
  • यदि हाँ: तो AI वास्तव में योजना बना रहा था और उस जानकारी का उपयोग कर रहा था।
  • यदि नहीं: तो AI केवल दिखावा कर रहा था कि उसके पास योजना है, या उसने इसे बाद में समझ लिया।

बड़ा आश्चर्य: केवल एक मॉडल ने वास्तव में योजना बनाई

यहाँ कहानी दिलचस्प हो जाती है। अलग-अलग मॉडल्स के लिए परिणाम बहुत अलग थे:

  • "नकली योजनाकार" (Qwen और Llama):
    ये मॉडल्स "जासूस" टेस्ट में बहुत अच्छे थे। पहली पंक्ति के अंत में इनके मस्तिष्क में तुकबंदी की जानकारी मौजूद थी। लेकिन जब शोधकर्ताओं ने "समय यात्री" टेस्ट किया, तो कुछ नहीं हुआ। मस्तिष्क की स्थिति बदलने से आउटपुट में कोई बदलाव नहीं आया।

  • उपमा: यह एक ऐसे शेफ की तरह है जिसके काउंटर पर रेसिपी कार्ड रखा है (जानकारी मौजूद है) लेकिन वह उसे अनदेखा कर देता है और बस गंध और सहज ज्ञान से खाना बनाता है। उन्होंने अपने खाना पकाने को निर्देशित करने के लिए वास्तव में उस योजना का उपयोग नहीं किया; वे बस आखिरी शब्द ("fright") को देखते रहे ताकि अगला शब्द तय कर सकें।

  • "असली योजनाकार" (Gemma-3-27B):
    यह विशिष्ट मॉडल अलग था।

  • प्रारंभिक परतें (Early layers): दूसरी पंक्ति की शुरुआत में, यह पिछले शब्द ("fright") पर निर्भर था।

  • हैंडऑफ (The Handoff): लेयर 30 (AI के मस्तिष्क में एक विशिष्ट गहराई) के आसपास, कुछ जादुई हुआ। "योजना बनाने का कर्तव्य" पिछले शब्द से हटकर न्यूलाइन (पहली पंक्ति के बाद का खाली स्थान) पर चला गया।

  • परिणाम: जब शोधकर्ताओं ने न्यूलाइन पर मस्तिष्क की स्थिति बदली, तो AI तुरंत नए शब्द के साथ तुकबंदी करने की कोशिश करने लगा।

  • उपमा: यह मॉडल एक कंडक्टर की तरह है। गाने की शुरुआत में, वे शीट संगीत (पिछले शब्द) को देखते हैं। लेकिन आधे रास्ते में, वे शीट संगीत रख देते हैं और उस मानसिक मानचित्र के आधार पर ऑर्केस्ट्रा का संचालन करना शुरू कर देते हैं जो उन्होंने ब्रेक (न्यूलाइन) के समय बनाया था। वे संगीत को निर्देशित करने के लिए वास्तव में उस योजना का उपयोग करते हैं।

"किसने किया?" जांच (The "Who Did It?" Investigation)

Gemma मॉडल के लिए, शोधकर्ता जानना चाहते थे कि ठीक से कौन से हिस्से योजना बना रहे थे। उन्होंने इसे एक बहुत ही विशिष्ट टीम तक सीमित कर दिया: पाँच अटेंशन हेड्स (सोचिए कि ये AI के मस्तिष्क में पाँच विशिष्ट न्यूरॉन्स या "वर्कर्स" हैं)।

जब उन्होंने केवल इन पाँच वर्कर्स के साथ छेड़छाड़ की, तो AI अपनी योजना बनाने की क्षमता खो बैठा। जब उन्होंने उन्हें अकेला छोड़ दिया, तो AI ने पूरी तरह से योजना बनाई। यह एक अस्त-व्यस्त, सामान्य प्रक्रिया नहीं थी; यह एक बहुत ही सूक्ष्म टीम द्वारा किया गया एक सटीक, सर्जिकल ऑपरेशन था।

मुख्य निष्कर्ष

यह पेपर निष्कर्ष निकालता है कि सिर्फ इसलिए कि एक AI के पास जानकारी है, इसका मतलब यह नहीं है कि वह योजना बना रहा है

  • कई मॉडल्स भविष्य की तुकबंदी के विचार को स्टोर कर सकते हैं (उनके पास नक्शा है)।
  • लेकिन केवल एक मॉडल (Gemma-3-27B) ने वास्तव में अपने भविष्य के कार्यों को निर्देशित करने के लिए उस स्टोर किए गए नक्शे का उपयोग किया (वह नक्शे का पालन करता है)।
  • अन्य मॉडल्स के लिए, वे केवल तत्काल अतीत पर प्रतिक्रिया दे रहे हैं, भविष्य के लिए योजना नहीं बना रहे हैं, भले ही भविष्य की जानकारी तकनीकी रूप से उनके मस्तिष्क में मौजूद हो।

यह महत्वपूर्ण है क्योंकि यह दिखाता है कि "बुद्धिमत्ता" या "योजना बनाना" केवल डेटा होने के बारे में नहीं है; यह इस बारे में है कि उस डेटा का उपयोग आगे क्या होगा, इसे आकार देने के लिए कैसे किया जाता है। और आश्चर्यजनक रूप से, यह "योजना बनाने" की क्षमता सभी बड़े AI की एक सामान्य विशेषता नहीं है; यह एक विशिष्ट विशेषता है जो केवल कुछ मॉडल्स में विकसित हुई है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →