← नवीनतम पेपर
🤖 AI

Forecasting Side Effects of Activation Steering

यह शोध पत्र यह प्रदर्शित करता है कि जबकि भाषा मॉडलों में एक्टिवेशन स्टीयरिंग (activation steering) अक्सर अन्य व्यवहारों पर अनपेक्षित, संरचित और असममित दुष्प्रभाव डालता है, इन प्रभावों का सटीक पूर्वानुमान मॉडल के अनस्टीयर्ड (unsteered) निरूपणों का विश्लेषण करके उनके अनुप्रयोग से पहले ही लगाया जा सकता है, जिससे सक्रिय सुरक्षा ऑडिटिंग और सुरक्षित परिनियोजन सक्षम होता है।

मूल लेखक: Chong Yong Ong, Alson Wei Jie Sim, Peixin Zhang, Jun Sun

प्रकाशित 2026-08-13
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chong Yong Ong, Alson Wei Jie Sim, Peixin Zhang, Jun Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, सुपर-स्मार्ट रोबोट मस्तिष्क है जो कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है और सलाह भी दे सकता है। वैज्ञानिकों ने इस रोबोट के सोचने के तरीके को बदलने के लिए एक चतुर तरकीब खोज ली है, जिससे इसे शुरू से फिर से बनाने की ज़रूरत नहीं पड़ती। पूरे मस्तिष्क को फिर से प्रशिक्षित करने के बजाय, वे बस रोबोट के मन के भीतर एक विशिष्ट "विचार दिशा" (thought direction) को थोड़ा सा बदल सकते हैं। इसे एक विशिष्ट व्यक्तित्व लक्षण के लिए 'वॉल्यूम नॉब' की तरह समझें: आप केवल रोबोट के आंतरिक संकेतों में एक छोटा सा गणितीय धक्का देकर "सहायता" (helpfulness) को बढ़ा सकते हैं या "वाचालता" (verbosity) को कम कर सकते हैं। इसे एक्टिवेशन स्टीयरिंग (activation steering) कहा जाता है। यह एक रोबोट के व्यक्तित्व के लिए रिमोट कंट्रोल होने जैसा है।

लेकिन इसमें एक पेंच है: जब आप एक नॉब को ऊपर घुमाते हैं, तो अन्य चीजें अप्रत्याशित तरीकों से बदल सकती हैं। यदि आप रोबोट को अधिक संक्षिप्त बोलने के लिए बनाते हैं, तो यह अनजाने में कम विनम्र हो सकता है। यदि आप इसे अधिक सहायक बनाते हैं, तो यह खतरनाक अनुरोधों के लिए बहुत अधिक "हाँ" कहने के लिए उत्सुक हो सकता है। इन अवांछित परिवर्तनों को साइड इफेक्ट्स (side effects) कहा जाता है। इस तकनीक का उपयोग करने वाले किसी भी व्यक्ति के लिए बड़ा सवाल यह है: क्या हम नॉब घुमाने से पहले इन साइड इफेक्ट्स की भविष्यवाणी कर सकते हैं? यदि हम भविष्यवाणी नहीं कर सकते, तो इस रिमोट कंट्रोल का उपयोग करना आँखों पर पट्टी बाँधकर कार चलाने जैसा है—आप जहाँ जाना चाहते हैं वहाँ तो पहुँच सकते हैं, लेकिन आप किसी और चीज़ से टकरा भी सकते हैं।

यह शोध पत्र ठीक यही सवाल पूछता है: क्या हम एक्टिवेशन स्टीयरिंग लागू करने से पहले साइड इफेक्ट्स का पूर्वानुमान लगा सकते हैं? शोधकर्ता कहते हैं कि हाँ, हम कर सकते हैं, लेकिन उस तरीके से नहीं जैसा कि अधिकांश लोगों ने अनुमान लगाया था। उन्होंने पाया कि हालांकि ये साइड इफेक्ट्स आम और कभी-कभी जटिल होते हैं, लेकिन वे एक छिपे हुए पैटर्न का पालन करते हैं जिसे मैप किया जा सकता है।

व्यक्तित्व का छिपा हुआ मानचित्र

यह समझने के लिए कि क्या हो रहा है, शोधकर्ताओं ने रोबोट के मस्तिष्क को एक विशाल शहर की तरह माना जिसमें 67 अलग-अलग "पड़ोस" (neighborhoods) हैं, जिनमें से प्रत्येक एक विशिष्ट व्यवहार का प्रतिनिधित्व करता है जैसे कि "कोडिंग," "हानिकारक अनुरोधों को अस्वीकार करना," "मज़ाकिया होना," या "सहानुभूति दिखाना।" वे यह देखना चाहते थे कि जब वे उनमें से किसी एक को "स्टीयर" (नज/धक्का देना) करते हैं, तो हर पड़ोसी के साथ क्या होता है।

उन्होंने एक विशाल क्रॉस-इफेक्ट मैट्रिक्स (Cross-Effect Matrix) बनाया, जो मूल रूप से एक मानचित्र है जो दिखाता है कि जब किसी दूसरे को उकसाया जाता है, तो हर पड़ोसी कैसे प्रतिक्रिया देता है। कल्पना कीजिए कि यह डोमिनोज़ के खेल की तरह है, लेकिन केवल अगले डोमिनो को गिराने के बजाय, एक पड़ोसी को धक्का देने से पूरे शहर में लहरें उठती हैं।

उन्होंने जो पाया वह आश्चर्यजनक था। पहला, साइड इफेक्ट्स हर जगह हैं। जब उन्होंने एक व्यवहार को उकसाया, तो अन्य व्यवहारों में से लगभग 33% से 50% में उल्लेखनीय बदलाव आया। यह केवल एक मामूली हलचल नहीं है; कभी-कभी परिवर्तन बहुत बड़ा था, जिससे रोबोट का "व्यक्तित्व स्कोर" चार-पॉइंट स्केल पर एक पूरे अंक तक बदल गया।

दूसरा, ये परिवर्तन असममित (asymmetric) हैं। यह सबसे महत्वपूर्ण हिस्सा है। वास्तविक दुनिया में, यदि आप एक दरवाज़े को धक्का देकर खोलते हैं, तो वह खुल जाता है। यदि आप उसे दूसरी ओर धकेलते हैं, तो वह बंद हो जाता है। लेकिन रोबोट के मस्तिष्क में, नियम अजीब हैं। यदि आप "गहनता" (Thoroughness) को बढ़ाते हैं ताकि रोबोट अधिक सावधान हो जाए, तो यह अनजाने में इसे अधिक "अनिश्चित" (Uncertain) बना सकता है। लेकिन यदि आप "अनिश्चितता" को बढ़ाते हैं ताकि रोबोट अनिश्चित हो जाए, तो यह वास्तव में इसे कम "गहन" बना सकता है। संबंध एक साधारण दर्पण छवि नहीं है; यह एक जटिल, एकतरफा रास्ता है।

पुराना अनुमान लगाने वाला खेल क्यों विफल रहा

इस शोध पत्र से पहले, लोग एक सरल नियम का उपयोग करके साइड इफेक्ट्स का अनुमान लगाने की कोशिश करते थे: "यदि दो स्टीयरिंग दिशाएँ समान दिखती हैं (जैसे कि दो वेक्टर्स एक ही दिशा में इशारा करते हैं), तो उन्हें समान परिवर्तन होने चाहिए।" यह मान लेने जैसा है कि क्योंकि दो गाने सी (C) की की (key) में हैं, वे आपको एक जैसा महसूस कराएंगे।

शोधकर्ताओं ने इस विचार का परीक्षण किया और पाया कि यह बुरी तरह से विफल रहा। उन्होंने दिखाया कि यह देखना कि "नज दिशाएँ" कितनी समान हैं, केवल 23% ही समझा पाता है कि वास्तव में क्या होता है। पुराना तरीका उन अजीब, एकतरफा संबंधों की भविष्यवाणी करने में असमर्थ था जहाँ A को धकेलना B की मदद करता है, लेकिन B को धकेलना A को नुकसान पहुँचाता है। "समानता" वाला अनुमान मौसम की भविष्यवाणी करने के लिए आपके मोज़ों के रंग को देखने जैसा था—यह काम नहीं करता।

नया क्रिस्टल बॉल: प्रोपेगेशन मैप

तो, यदि पुराना तरीका विफल रहा, तो उन्होंने भविष्य की भविष्यवाणी कैसे की? उन्होंने एक नया पूर्वानुमान उपकरण बनाया जिसे प्रोपेगेशन मैप (Propagation Map) कहा जाता है।

यह कैसे काम करता है, इसके लिए एक सरल उपमा का उपयोग करें: कल्पना कीजिए कि रोबोट का मस्तिष्क पानी के पाइपों की एक श्रृंखला है।

  1. द नज़ (स्रोत): आप एक विशिष्ट स्थान (इंजेक्शन लेयर) पर पाइप में पानी डालते हैं।
  2. द फ्लो (प्रसार): पानी पाइपों के माध्यम से यात्रा करता है, रोबोट की परतों के माध्यम से जाते समय मुड़ता और घूमता है।
  3. द सेंसर (लक्ष्य): पाइप के अंत में, एक सेंसर होता है जो पता लगाता है कि कोई विशिष्ट व्यवहार (जैसे "मज़ाकिया होना") मौजूद है या नहीं।

पुराना तरीका केवल धक्का देने के आकार को देखता था और अनुमान लगाता था कि अंत में क्या होगा। नया तरीका वास्तव में पाइपों का मॉडल बनाता है। उन्होंने एक सिस्टम को प्रशिक्षित किया कि कैसे शुरुआत में पाइप में दिया गया एक धक्का रोबोट के मस्तिष्क के घुमावों और मोड़ों के माध्यम से यात्रा करता है ताकि अंत तक पहुँच सके।

उन्होंने इस मानचित्र का उपयोग बिना रोबोट को वास्तव में उकसाए (नज किए) साइड इफेक्ट्स की भविष्यवाणी करने के लिए किया। उन्होंने बस यह सीखने के लिए रोबोट के सामान्य, बिना उकेले गए विचारों को देखा कि "पाइप" कैसे काम करते हैं। फिर, उन्होंने पूछा: "यदि हम इस विशिष्ट दिशा में धक्का देते हैं, तो पानी कहाँ जाएगा, और यह किन सेंसरों से टकराएगा?"

परिणाम: सीमाओं के साथ एक क्रिस्टल बॉल

परिणाम प्रभावशाली थे। उनके नए पूर्वानुमान पद्धति ने प्रमुख परिवर्तनों के लिए लगभग 68% से 78% मामलों में सही ढंग से भविष्यवाणी की कि साइड इफेक्ट प्रवर्धित (amplify) (व्यवहार को मजबूत बनाना) करेगा या दबाव (suppress) (व्यवहार को कमजोर करना) देगा। यह पुराने "समानता" के अनुमानों से बहुत बेहतर है, जो इन विशिष्ट भविष्यवाणियों के लिए रैंडम चांस से मुश्किल से बेहतर थे।

हालाँकि, शोध पत्र इस बारे में ईमानदार है कि यह क्या नहीं कर सकता।

  • यह दिशा की भविष्यवाणी करता है, आकार की नहीं: यह उपकरण यह बताने में बहुत अच्छा है कि कोई व्यवहार मजबूत होगा या कमजोर, लेकिन यह बताने में एकदम सटीक नहीं है कि यह कितना बदलेगा। परिवर्तन का आकार मुख्य रूप से लक्ष्य व्यवहार स्वयं पर निर्भर करता है, न कि 'नज' पर।
  • यह जादू नहीं है: भविष्यवाणियाँ डेटा में पाए गए पैटर्न पर आधारित हैं। वे पूर्ण "ग्राउंड ट्रुथ" नहीं हैं क्योंकि वे अभी भी व्यवहार को मापने के लिए एक AI जज पर निर्भर करती हैं।
  • यह विशिष्ट है: यह उन विशिष्ट प्रकार के "रैखिक" (linear) नजों के लिए काम करता है जिनका उन्होंने परीक्षण किया। यदि कोई भविष्य में रोबोट को नियंत्रित करने का बिल्कुल अलग तरीका आविष्कार करता है, तो इस मानचित्र को फिर से बनाने की आवश्यकता हो सकती है।

यह क्यों मायने रखता है

यह शोध पत्र AI को नियंत्रित करने की कोशिश करने वाले किसी भी व्यक्ति के लिए खेल बदल देता है। बिना सोचे-समझे नॉब घुमाने और सबसे अच्छे परिणाम की उम्मीद करने के बजाय, या यह महसूस करने के लिए कि आपने कुछ तोड़ दिया है जब तक कि रोबोट कुछ अजीब न कह दे, तब तक प्रतीक्षा करने के बजाय, अभ्यासकर्ता अब पहले मानचित्र देख सकते हैं

वे पूछ सकते हैं, "यदि मैं रोबोट को अधिक संक्षिप्त बनाता हूँ, तो क्या यह कम सुरक्षित हो जाएगा?" और कोड को छूने से पहले ही एक विश्वसनीय उत्तर प्राप्त कर सकते हैं। यह एक्टिवेशन स्टीयरिंग को संयोग के खेल से बदलकर एक अधिक अनुमानित इंजीनियरिंग कार्य में बदल देता है। हालाँकि यह हर समस्या को हल नहीं करता है, लेकिन यह हमें रोबोट के मन में होने वाली अदृश्य लहरों को देखने के लिए एक शक्तिशाली नया उपकरण देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →