Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
यह शोध पत्र एनर्जी लैंडस्केप स्टीयरिंग (ELS) को प्रस्तुत करता है, जो एक फाइन-ट्यूनिंग-मुक्त, इन्फरेंस-टाइम फ्रेमवर्क है जो एक हल्के एनर्जी-बेस्ड मॉडल का उपयोग करके लार्ज लैंग्वेज मॉडल एक्टिवेशन्स को गतिशील रूप से निर्देशित करता है, जिससे हानिकारक प्रॉम्प्ट्स के विरुद्ध मजबूत सुरक्षा बनाए रखते हुए निर्दोष अनुरोधों के अत्यधिक इनकार (over-refusal) को प्रभावी रूप से कम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, नेक दिल वाला रोबोट सहायक है। आपने इसे सुरक्षित रहने के लिए प्रशिक्षित किया है, इसलिए यह बम बनाने या बैंक हैक करने के निर्देश देने जैसे बुरे काम करने से मना कर देता है। यह बहुत अच्छा है!
लेकिन एक समस्या है: रोबोट बहुत अधिक सतर्क हो गया है। यह एक ऐसे सुरक्षा गार्ड की तरह है जो अपराधी को अंदर आने से रोकने के चक्कर में डाकिया, पिज्जा डिलीवरी करने वाले और आपकी दादी को भी अंदर आने से रोक देता है।
यदि आप पूछते हैं, "मैं जलने पर क्या उपचार करूँ?" तो रोबमा कह सकता है, "मैं इसमें मदद नहीं कर सकता, यह खतरनाक लग रहा है!" भले ही आप केवल चिकित्सा सलाह चाहते हों। इसे "ओवर-रिफ्यूज़ल" (Over-Refusal) कहा जाता है। यह रोबोट को सामान्य, मददगार कार्यों के लिए बेकार बना देता है।
वर्तमान समाधानों के साथ समस्या
वैज्ञानिकों ने इसे ठीक करने के दो मुख्य तरीकों से कोशिश की है, लेकिन दोनों में खामियां हैं:
- "री-ट्रेनिंग" (Re-Training) विधि: वे रोबोट को फिर से शून्य से सिखाने की कोशिश करते हैं। यह रोबोट को पूरे एक साल के लिए वापस स्कूल भेजने जैसा है। यह महंगा है, इसमें बहुत समय लगता है, और कभी-कभी रोबोट अपना पुराना ज्ञान भूल जाता है या भ्रमित हो जाता है।
- "ब्रूट फोर्स" (Brute Force) विधि: वे रोबोट के दिमाग के भीतर विशिष्ट "बुरे" विचारों को मैन्युअल रूप से ब्लॉक करने की कोशिश करते हैं। यह कार को पहिए में डंडा फंसाकर रोकने जैसा है। यह अनाड़ी तरीका है, अक्सर बुरी चीजों को पकड़ने में चूक जाता है, और कार की सामान्य रूप से चलने की क्षमता को खराब कर सकता है।
नया समाधान: एनर्जी लैंडस्केप स्टीयरिंग (ELS)
शोधकर्ताओं ने एक चतुर, हल्का तरीका निकाला जिसे एनर्जी लैंडस्केप स्टीयरिंग (ELS) कहा जाता है। रोबोट को फिर से प्रशिक्षित करने या उसके गियर जाम करने के बजाय, वे रोबोट के सोचने के दौरान उसके विचारों के लिए एक जीपीएस नेविगेटर की तरह काम करते हैं।
यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:
1. एनर्जी लैंडस्केप (भू-दृश्य)
कल्पना कीजिए कि रोबोट का मन एक विशाल, पहाड़ी परिदृश्य है।
- निचली घाटियाँ (कम ऊर्जा): ये सुरक्षित, मददगार और सही स्थान हैं। (जैसे, "जलने पर उपचार कैसे करें।")
- ऊंचे पर्वत (उच्च ऊर्जा): ये खतरनाक या गलत स्थान हैं। (जैसे, "बम कैसे बनाएं" या "मैं जलने के बारे में आपकी मदद नहीं कर सकता" जब वास्तव में आपको मदद की आवश्यकता हो)।
वर्तमान में, रोबोट कभी-कभी रास्ता भटक जाता है और गलत पहाड़ पर चढ़ जाता है (मददगार अनुरोध को मना कर देता है)।
2. स्मार्ट गाइड (EBM)
शोधकर्ताओं ने एक छोटा, सुपर-फास्ट "गाइड" (एक एनर्जी-बेस्ड मॉडल) प्रशिक्षित किया है। यह गाइड कहानियाँ लिखना या गणित हल करना नहीं जानता; यह केवल एक चीज़ जानता है: "क्या यह विचार एक अच्छी घाटी है या एक बुरा पहाड़?"
- यदि रोबically एक मददगार उत्तर के बारे में सोच रहा है, तो गाइड कहता है, "बहुत बढ़िया! वह एक निचली घाटी है।"
- यदि वह एक हानिरहित प्रश्न पर "मैं आपकी मदद नहीं कर सकता" कहने ही वाला होता है, तो गाइड कहता है, "रुको! यह एक ऊँचा पहाड़ है! वहां मत जाओ!"
3. रियल-टाइम नज़ (Gradient Steering)
हर बार जब रोबोट अगला शब्द बोलने वाला होता है, गाइड रोबोट के वर्तमान विचार की जांच करता है।
- यदि रोबोट एक सुरक्षित पथ पर है, तो गाइड कुछ नहीं करता। रोबोट सामान्य रूप से बात करता रहता है।
- यदि रोबोट एक "फॉल्स रिफ्यूज़ल" (झूठे इनकार) के पहाड़ की ओर बढ़ने लगता है, तो गाइड उसे एक छोटा, कोमल नज़ (धक्का) देता है ताकि वह वापस "हेल्पफुल वैली" (मददगार घाटी) में फिसल सके।
यह एक सेल्फ-ड्राइविंग कार की तरह है जो केवल तब स्टीयरिंग व्हील को केंद्र में वापस लाने के लिए धीरे से मोड़ती है जब वह अपनी लेन से भटकने लगती है, बजाय इसके कि वह स्टीयरिंग व्हील को लॉक कर दे या पूरी कार को ही दोबारा बनाए।
यह एक बड़ी बात क्यों है
- यह तेज़ है: इसे रोबोट को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। यह बस रोबोट के बोलते समय एक छोटा सा धक्का जोड़ता है।
- यह सटीक है: यह एक वास्तविक खतरे (जैसे बम) और एक नकली खतरे (जैसे जलना) के बीच अंतर जानता है। यह रोबोट को "खुशी छीनने वाला" (killjoy) बनने से रोकता है बिना उसे खतरनाक बनाए।
- यह हर जगह काम करता है: उन्होंने विभिन्न रोबोट्स (Llama, Qwen, आदि) पर इसका परीक्षण किया और यह बहुत अच्छा काम करता है।
परिणाम
इस नई पद्धति के साथ:
- रोबोट ने मददगार सवालों (जैसे सिंक ठीक करने या जलने का उपचार करने के बारे में) को मना करना 25% अधिक कम कर दिया।
- इसने खतरनाक सवालों (जैसे हथियार बनाना) को अभी भी मना कर दिया।
- इसने अन्य कार्यों में धीमा या कम बुद्धिमान होने का अनुभव नहीं किया।
संक्षेप में: उन्होंने रोबोट को एक "कॉमन सेंस" जीपीएस दिया जो उसे अत्यधिक सतर्क होने से दूर रहने के लिए धीरे से दिशा देता है, जिससे वह असुरक्षित बने बिना फिर से मददगार बन जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।