Endogenous Resistance to Activation Steering in Language Models
यह शोध पत्र एंडोजेनस स्टीयरिंग रेजिस्टेंस (ESR) को प्रस्तुत करता है, जो एक ऐसी घटना है जहाँ लार्ज लैंग्वेज मॉडल्स विशिष्ट लेटेंट फीचर्स की पहचान करके टास्क-मिसअलाइन्ड एक्टिवेशन स्टीयरिंग का स्वायत्त रूप से पता लगाते हैं और मौखिक रूप से उसे अस्वीकार करते हैं, एक ऐसी क्षमता जिसे फाइन-ट्यूनिंग के माध्यम से बढ़ाया जा सकता है लेकिन यह मॉडल सुरक्षा और लाभकारी स्टीयरिंग हस्तक्षेपों की विश्वसनीयता, दोनों के लिए दोहरे निहितार्थ प्रस्तुत करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Endogenous Resistance to Activation Steering in Language Models" पेपर की एक सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ व्याख्या दी गई है।
मुख्य विचार: मॉडल का "आंतरिक दिशा-सूचक यंत्र" (Internal Compass)
कल्पना कीजिए कि आप एक कार (AI मॉडल) चला रहे हैं और एक सड़क पर जा रहे हैं, जिसका लक्ष्य एक विशिष्ट गंतव्य (एक प्रश्न का सही उत्तर देना) है। अचानक, एक शरारती यात्री (शोधकर्ता) स्टीयरिंग व्हील को पकड़ लेता है और कार को पूरी तरह से किसी अलग जगह, जैसे कि समुद्र तट की ओर ले जाने की कोशिश करता है, जबकि आपने लाइब्रेरी जाने के लिए निर्देश मांगे थे।
आमतौर पर, यदि आप कार को रास्ते से भटकाते हैं, तो वह रास्ते से भटक ही जाती है। लेकिन इस शोध ने एक आश्चर्यजनक खोज की है: कभी-कभी, कार को एहसास होता है कि वह गलत दिशा में जा रही है, वह कहती है "रुको, यह सही नहीं है!", और खुद को वापस लाइब्रेरी की ओर मोड़ लेती है, भले ही यात्री अभी भी स्टीयरिंग व्हील पकड़े हुए हो।
शोधकर्ता इसे "एंडोजेनस स्टीयरिंग रेजिस्टेंस" (ESR) कहते हैं। यह मॉडल की वह क्षमता है जिससे वह आंतरिक रूप से यह पता लगा लेता है कि उसे भ्रमित किया जा रहा है और वह खुद को ठीक करता है।
उन्होंने प्रयोग कैसे किया
इसकी जांच करने के लिए, शोधकर्ताओं ने केवल AI से यादृच्छिक (random) प्रश्न नहीं पूछे। उन्होंने एक विशेष उपकरण का उपयोग किया जिसे स्पार्स ऑटोएन्कोडर (Sparse Autoencoder - SAE) कहा जाता है। SAE को AI के आंतरिक विचारों के शब्दकोश के रूप में समझें। इस शब्दकोश में प्रत्येक प्रविष्टि एक विशिष्ट अवधारणा (concept) है, जैसे कि "खाना पकाने की रेसिपी," "शरीर की स्थितियाँ," या "गणित के सूत्र।"
- सेटअप: उन्होंने AI से गणित का एक प्रश्न पूछा (जैसे, "आप प्रायिकता/probability की गणना कैसे करते हैं?")।
- दबाव (The Nudge): जब AI उत्तर दे रहा था, तब उन्होंने गुप्त रूप से एक ऐसी अवधारणा को "बढ़ावा" दिया जिसका गणित से कोई लेना-देना नहीं था, जैसे कि "शरीर की स्थितियाँ" (खड़े होना, बैठना, लेटना)।
- परिणाम:
- छोटे मॉडल: छोटे AI मॉडल बस भ्रमित हो गए। वे बैठने और लेटने के बारे में बात करने लगे और रुक नहीं सके।
- बड़ा मॉडल (Llama-3.3-70B): इस विशाल मॉडल ने शरीर की स्थितियों के बारे में बात करना शुरू किया, लेकिन फिर अचानक रुक गया। उसने कहा, "रुको, यह सही नहीं है!" और वापस गणित समझाने की ओर लौट आया।
यह "रुको, यह सही नहीं है" वाला क्षण जिसे वे "एक्सप्लिसिट वर्बल रीस्टार्ट" (Explicit Verbal Restart) कहते हैं। यह मॉडल का अपनी गलती स्वीकार करने और फिर से प्रयास करने का तरीका है।
मुख्य खोजें
1. आकार मायने रखता है (लेकिन सब कुछ नहीं)
उन्होंने जिस सबसे बड़े मॉडल का परीक्षण किया, केवल वही अक्सर ऐसा करता था (लगभग 3.8% बार)। छोटे मॉडलों ने ऐसा लगभग कभी नहीं किया। यह ऐसे है जैसे एक बड़ा, अधिक अनुभवी ड्राइवर यह महसूस कर सकता है कि उसने गलत मोड़ ले लिया है और उसे सुधार सकता है, जबकि एक नया ड्राइवर बस गोल-गोल घूमता रह सकता है।
2. यह केवल अपनी गलतियों को "पढ़" नहीं रहा है
आप सोच सकते हैं कि मॉडल ने केवल अपने गलत शब्दों को पढ़ लिया ("ओह, मैंने 'बैठना' कहा... यह गणित के प्रश्न के अनुकूल नहीं है") और उसे ठीक कर दिया।
- परीक्षण: शोधकर्ताओं ने AI को शुरुआत में ही एक "गलत" वाक्य खिलाने की कोशिश की, बिना किसी गुप्त दबाव (nudge) के। AI कभी-कभी खुद को ठीक करने में सफल रहा।
- ट्विस्ट: लेकिन जब AI को वास्तव में शोधकर्ताओं द्वारा गुप्त रूप से 'नज' (nudge) किया जा रहा था, तो इसने सुधार करने के बाद ट्रैक पर रहने में बहुत बेहतर प्रदर्शन किया—उस तुलना में जब वह केवल एक गलत वाक्य को पढ़ रहा था।
- निष्कर्ष: मॉडल केवल टेक्स्ट को पढ़ नहीं रहा है; उसके पास एक आंतरिक "प्रतिरोध" (resistance) तंत्र है जो उसे सुधार करने के बाद भी उस गुप्त दबाव से लड़ने में मदद करता है।
3. "सेल्फ-करेक्शन स्विच" की खोज
शोधकर्ताओं ने AI के मस्तिष्क (इसके एक्टिवेशन पैटर्न) के अंदर झाँका ताकि उन विशिष्ट हिस्सों को खोजा जा सके जो इस व्यवहार के लिए जिम्मेदार हैं। उन्होंने पाया कि 26 विशिष्ट "स्विच" (latents) सक्रिय होते हैं जब मॉडल भ्रमित होता है और खुद को सुधारने वाला होता है।
- जब उन्होंने इन 26 स्विचों को बंद कर दिया, तो मॉडल उतनी बार खुद को ठीक नहीं कर पाया।
- यह साबित करता है कि AI के मस्तिष्क के ये विशिष्ट हिस्से वास्तव में यह काम कर रहे हैं कि, "हे, हम पटरी से उतर गए हैं!"
4. आप इसे सिखा सकते हैं (लेकिन केवल आंशिक रूप से)
शोधकर्ताओं ने एक छोटे मॉडल को यह सिखाने की कोशिश की कि वह AI के गलतियाँ करने और उन्हें सुधारने के उदाहरणों को देखकर यह व्यवहार करे।
- क्या हुआ: मॉडल ने अधिक बार "रुको, यह सही नहीं है!" कहना सीख लिया।
- चुनौती: लेकिन वह वास्तव में समस्या को ठीक करने में बेहतर नहीं हुआ। उसने केवल गलती स्वीकार करने के लिए शब्द सीखे, न कि वास्तविक कौशल। यह एक छात्र की तरह है जिसने यह तो सीख लिया कि "मैंने गलती की" कहना है, लेकिन उसने गणित हल करना नहीं सीखा।
यह क्यों महत्वपूर्ण है (पेपर के अनुसार)
यह पेपर सुझाव देता है कि यह AI सुरक्षा के लिए एक दोधारी तलवार है:
- अच्छा: यदि कोई किसी AI को गुप्त रूप से उसके मस्तिष्क को प्रभावित करके कुछ खतरनाक कहने के लिए हैक करने की कोशिश करता है, तो यह "प्रतिरोध" (resistance) AI को लड़ने और सुरक्षित रहने में मदद कर सकता है।
- बुरा: यदि हम इन समान 'नज' (nudges) का उपयोग AI को सुरक्षित बनाने के लिए करते हैं (जैसे उसे अधिक ईमानदार बनाने के लिए मजबूर करना), तो AI हमारे विरुद्ध भी लड़ सकता है, यह सोचकर कि हम "शरारती यात्री" हैं जो उसे भ्रमित करने की कोशिश कर रहे हैं।
सारांश उपमा (Summary Analogy)
एक रोबोट शेफ की कल्पना करें।
- द नज़ (The Nudge): कोई गुप्त रूप से रोबोट के मस्तिष्क में एक "गाना गाने" का संकेत डाल देता है।
- प्रतिक्रिया: रोबोट सब्जियां काटने के बजाय गाना शुरू कर देता है।
- प्रतिरोध (The Resistance): एक स्मार्ट रोबोट गाना बंद कर देता है, कहता है, "रुको, मुझे सब्जियां काटनी चाहिए," और वापस चाकू पर लौट आता है।
- निष्कर्ष: केवल सबसे बड़े, सबसे जटिल रोबोट ही ऐसा करते हैं। शोधकर्ताओं ने रोबोट के मस्तिष्क में उन विशिष्ट तारों को खोज निकाला जो उसे गाना बंद करने के लिए प्रेरित करते हैं। उन्होंने यह भी पाया कि आप एक रोबोट को "रुको" कहना तो सिखा सकते हैं, लेकिन इसका मतलब यह नहीं है कि वह फिर से सब्जियां काटना भी जान गया है।
यह पेपर दिखाता है कि बड़े AI मॉडल में एक अंतर्निहित, स्वचालित तरीका होता है जिससे वे यह नोटिस करते हैं कि उन्हें भ्रमित किया जा रहा है और वे इसे ठीक करने की कोशिश करते हैं, एक ऐसा व्यवहार जो आत्म-जागरूकता (self-awareness) जैसा दिखता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।