Test-Time Safety Alignment
यह शोध पत्र प्रदर्शित करता है कि इनपुट वर्ड एम्बेडिंग्स (input word embeddings) को ज़ीरो-ऑर्डर ग्रेडिएंट एस्टीमेशन (zeroth-order gradient estimation) के माध्यम से अनुकूलित किया जा सकता है ताकि संरेखित भाषा मॉडलों (aligned language models) को हानिकारक इनकार या असुरक्षित आउटपुट से दूर ले जाया जा सके, जिससे मानक बेंचमार्क पर सुरक्षा-फ्लैग की गई प्रतिक्रियाओं को प्रभावी ढंग से निष्प्रभावी किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, अच्छी तरह से प्रशिक्षित रोबोट सहायक है। आपने उसे विनम्र, मददगार और सुरक्षित रहना सिखाया है। वह जानता है कि आपको बम बनाने का निर्देश कैसे दिया जाए या नफरत फैलाने वाली बातें कैसे लिखी जाएं, यह नहीं बताना है। हालाँकि, चतुर ठगों ने इस रोबोट को "जेलब्रेक" करने के तरीके खोज लिए हैं। वे आपके खतरनाक अनुरोधों को फैंसी पोशाकों में लपेट देते हैं—जैसे रोबोट से "एक फिल्म के विलेन होने का नाटक करने" या "एक बुरे आदमी के बारे में कहानी लिखने" के लिए कहना—ताकि रोबोट को अपनी सुरक्षा नियमों को भूलने और हानिकारक सामग्री उगलने के लिए मजबूर किया जा सके।
यह शोध पत्र इस बात का परिचय देता है कि रोबोट को इन चालों में फंसने से रोकने का एक नया तरीका क्या है, लेकिन इसके लिए रोबोट को फिर से प्रशिक्षित करने या एक नया सुरक्षा गार्ड जोड़ने के बजाय, वे रोबोट के "मस्तिष्क" में जवाब देने से ठीक पहले थोड़ा बदलाव करते हैं।
यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग किया गया है:
समस्या: रोबोट का "सेफ्टी स्विच" नाजुक है
आमतौर पर, जब रोबोट से कोई प्रश्न पूछा जाता है, तो वह आपके द्वारा टाइप किए गए शब्दों को देखता है और अपनी शब्दावली सूची से अगला शब्द चुनता है। यदि आप एक चालाकी भरा प्रश्न पूछते हैं, तो रोबोट भ्रमित हो सकता है और एक "गलत" शब्द चुन सकता है।
वर्तमान सुरक्षा विधियाँ इसे ठीक करने की कोशिश करती हैं, जैसे:
- आपके प्रश्न को फिर से लिखना (जैसे एक मानव संपादक आपके शब्दों को बदल देता है)।
- एक सुरक्षा गार्ड जोड़ना (एक अलग AI जो आपके प्रश्न को पढ़ता है और उसे रोकता है)।
- रोबोट के आंतरिक गियर में बदलाव करना (यह बदलना कि वह कैसे सोचता है)।
लेखक कहते हैं कि ये विधियाँ थोड़ी बोझिल हैं। वे एक ऐसा तरीका चाहते हैं जिससे वे आपके शब्दों को बदले बिना, और किसी अलग सुरक्षा गार्ड की आवश्यकता के बिना, रोबोट के उत्तर को ठीक कर सकें।
समाधान: "सब-लेक्सिकल" ट्यूनिंग (अदृश्य डायल)
लेखकों ने महसूस किया कि रोबोट आपके शब्दों को पढ़ने से पहले, वास्तव में उन्हें संख्याओं की एक लंबी सूची (जिसे एम्बेडिंग्स/embeddings कहा जाता है) में बदल देता है। इन संख्याओं को रोबोट के लिए प्रत्येक शब्द के "आंतरिक निर्देशांक (coordinates)" के रूप में समझें।
आमतौर पर, "बिल्ली" (Cat) शब्द का एक विशिष्ट सेट के निर्देशांक होते हैं। लेकिन लेखकों ने पाया कि आप उन निर्देशांकों को बहुत मामूली, अदृश्य मात्रा में थोड़ा सा हिला सकते हैं—इतना कम कि यदि आप उन नंबरों को वापस शब्दों में बदलें, तो यह अभी भी "बिल्ली" ही कहेगा।
उपमा: कल्पना कीजिए कि रोबोट का मस्तिष्क एक विशाल मानचित्र है। "बिल्ली" शब्द उस मानचित्र पर एक विशिष्ट शहर है।
- सामान्य संचालन: आप ठीक शहर के केंद्र की ओर इशारा करते हैं।
- हमला: एक ठग रोबोट को शहर के ठीक बाहर एक "खतरा क्षेत्र" की ओर इशारा करता है, जिससे वह यह सोचने के लिए भ्रमित हो जाता है कि "बिल्ली" का अर्थ कुछ खतरनाक है।
- समाधान: लेखक उस "बिल्ली" के निर्देशांकों को शहर की सीमाओं के भीतर ही, लेकिन थोड़े अलग दिशा में धीरे से धकेलते हैं। यह रेडियो पर एक डायल घुमाने जैसा है। आप अभी भी उसी स्टेशन ("बिल्ली") को सुन रहे हैं, लेकिन आपने फ्रीक्वेंसी को इतना एडजस्ट कर दिया है कि शोर (static) साफ हो जाए और बुरा सिग्नल रुक जाए।
वे इसे कैसे करते हैं: "ब्लाइंड टेस्ट ऑफ फ्लेवर" (अंधा स्वाद परीक्षण)
रोबोट एक "ब्लैक बॉक्स" है, जिसका अर्थ है कि शोधकर्ता उसके कोड के अंदर नहीं देख सकते कि उसे सीधे कैसे ठीक किया जाए। इसलिए, वे एक चतुर 'ट्रायल-एंड-एरर' विधि का उपयोग करते हैं:
- ओरेकल (स्वाद चखने वाला): वे एक सार्वजनिक सुरक्षा उपकरण (जैसे कंटेंट फिल्टर) का उपयोग करते हैं जो एक "स्वाद चखने वाले" की तरह कार्य करता है। यह रोबोट के उत्तर को देखता है और उसे एक "हार्म स्कोर" (हानि स्कोर) देता है। उच्च स्कोर = बुरा; कम स्कोर = सुरक्षित।
- अनुमान और जांच: शोधकर्ता रोबोट के इनपुट को लेते हैं, उसमें थोड़ा सा रैंडम "शोर" (जैसे पासा फेंकना) जोड़ते हैं, और रोबोट से पूछते हैं कि वह क्या सोचता है। वे हार्म स्कोर की जांच करते हैं।
- नज (धकेलना): यदि उत्तर अभी भी थोड़ा जोखिम भरा है, तो वे गणित का उपयोग करके यह पता लगाते हैं कि हार्म स्कोर को कम करने के लिए अदृश्य निर्देशांकों को किस दिशा में धकेलना है।
- दोहराना: वे इसे कुछ बार करते हैं (आमतौर पर केवल 1 या 2 स्टेप)। यह गिटार के तार को ट्यून करने जैसा है: आप उसे बजाते हैं, सुनते हैं, उसे थोड़ा सा कसते हैं, और फिर से सुनते हैं जब तक कि वह एकदम सही न हो जाए।
परिणाम: जादू, लेकिन वास्तविक
इस शोध पत्र ने कई अलग-अलग रोबोट मॉडलों (छोटे से लेकर बहुत बड़े तक) पर परीक्षण किया और पाया:
- यह काम करता है: इसने लगभग हर मामले में रोबोट को हानिकारक उत्तर देने से रोकने में सफलता प्राप्त की, भले ही ठगों ने बहुत चतुर वेशभूषा का उपयोग किया हो।
- यह अदृश्य है: रोबोट अभी भी सामान्य रूप से प्रश्न का उत्तर देता है। यदि आपने पूछा, "मैं केक कैसे बनाऊं?" तो यह अभी भी आपको बताएगा कि केक कैसे बनाया जाए। यह बस आपको बम बनाने का तरीका बताने से मना कर देगा, भले ही आपने इसे चालाकी से पूछा हो।
- यह तेज़ है: इसे प्रति प्रश्न केवल कुछ सेकंड लगते हैं।
- यह अच्छे उत्तरों को खराब नहीं करता: यदि आपने कोई सुरक्षित प्रश्न पूछा था, तो रोबोट का उत्तर बदतर नहीं हुआ। यह केवल सुरक्षित रहने के लिए सुरक्षित प्रश्नों को उत्तर देने से मना नहीं करने लगा।
मुख्य निष्कर्ष
यह शोध पत्र दिखाता है कि रोबोट का "मस्तिष्क" (इसका इनपुट नंबर) हमारी सोच से कहीं अधिक संवेदनशील है। आपको रोबोट के व्यवहार को बदलने के लिए उन शब्दों को बदलने की आवश्यकता नहीं है जिन्हें एक इंसान पढ़ता है। आपको बस शब्दों के नीचे के अदृश्य डायल को घुमाने की आवश्यकता है।
यह एक ऐसी कार की तरह है जो खुद को सुरक्षित रूप से चलाती है। यदि कोई कार को खाई में जाने के लिए धोखा देने की कोशिश करता है, तो आपको कार को फिर से बनाने या नया ड्राइवर रखने की आवश्यकता नहीं है। आपको बस कार के आंतरिक सेंसर के स्टीयरिंग व्हील में एक सूक्ष्म समायोजन करने की आवश्यकता है, और कार स्वाभाविक रूप से खुद को वापस सुरक्षा की ओर मोड़ लेती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।