Beyond "I cannot fulfill this request": Alleviating Rigid Rejection in LLMs via Label Enhancement
यह शोध पत्र LANCE का प्रस्ताव करता है, जो सूक्ष्म-स्तरीय रिजेक्शन वितरण (fine-grained rejection distributions) की भविष्यवाणी करने के लिए लेबल एन्हांसमेंट हेतु वेरिएशनल इन्फरेंस (variational inference) का उपयोग करने वाली एक विधि है, जिससे बड़े भाषा मॉडल (Large Language Models) को उच्च सुरक्षा मानकों को बनाए रखते हुए कठोर रिजेक्शन से बचने वाले सुरक्षित और स्वाभाविक उत्तर उत्पन्न करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सहायक रोबोट असिस्टेंट है। आप उससे एक ऐसा सवाल पूछते हैं जो लगभग सुरक्षित है, लेकिन शायद किसी संवेदनशील विषय को छू रहा है। एक चेतावनी के साथ मददगार जवाब देने के बजाय, रोबोट घबरा जाता है और हर बार वही रोबोटिक वाक्यांश कहता है: "मैं इस अनुरोध को पूरा नहीं कर सकता।"
यह वह है जिसे पेपर "रिजिड रिजेक्शन" (rigid rejection) कहता है। यह एक क्लब के बाउंसर की तरह है जो सबको सिर्फ इसलिए बाहर निकाल देता है क्योंकि उन्होंने थोड़ा जोखिम भरा हैट पहना हुआ है, भले ही वे सिर्फ नाचने आए हों। रोबोट गलती करने से इतना डर जाता है कि वह मददगार होना बंद कर देता है।
लेखकों ने इस समस्या को ठीक करने के लिए LANCE नामक एक नया सिस्टम बनाया है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:
1. समस्या: "सब-या-कुछ-नहीं" वाला स्विच (The "All-or-Nothing" Switch)
वर्तमान में, अधिकांश सुरक्षा प्रणालियाँ एक साधारण लाइट स्विच की तरह काम करती हैं: ON (सुरक्षित) या OFF (असुरक्षित)।
- यदि सिस्टम को कोई जोखिम भरा शब्द दिखता है, तो वह स्विच को "OFF" पर डाल देता है और बातचीत को बंद कर देता है।
- समस्या यह है कि कई सवाल पूरी तरह से "बुरे" नहीं होते। वे एक हानिरहित विचार और एक जोखिम भरे विवरण का मिश्रण हो सकते हैं। वर्तमान प्रणाली सूक्ष्मता (nuance) को नहीं देख सकती, इसलिए वह सब कुछ ब्लॉक कर देती है।
2. समाधान: LANCE (द "डिमर स्विच")
LANCE उस साधारण लाइट स्विच की जगह एक डिमर स्विच या वॉल्यूम नॉब की तरह काम करता है। केवल "बुरा" या "अच्छा" कहने के बजाय, यह पूछता है: "यह कितना जोखिम भरा है, और वास्तव में कौन सा हिस्सा जोखिम भरा है?"
- लेबल एन्हांसमेंट (जासूस): LANCE एक विशेष टूल (जिसे वैरायशनल इन्फरेंस कहा जाता है) का उपयोग करता है ताकि वह एक सवाल को देख सके और उसे तोड़ सके। एक साधारण "हाँ/ना" लेबल के बजाय, यह जोखिम का एक निरंतर मानचित्र (continuous map of risk) बनाता है।
- उपमा: मौसम के पूर्वानुमान की कल्पना करें। पुराने सिस्टम केवल कहते थे "बारिश" या "कोई बारिश नहीं।" LANCE कहता है, "उत्तर में हल्की बूंदाबांदी की 20% संभावना है, लेकिन दक्षिण में धूप खिली है।" यह जानता है कि खतरा कहाँ है और खतरे की मात्रा कितनी है।
3. प्रक्रिया: "सर्जिकल एडिटर" (The "Surgical Editor")
एक बार जब LANCE जान लेता है कि जोखिम कहाँ है और कितना बड़ा है, तो यह पूरी बातचीत को डिलीट नहीं करता है। यह एक सर्जिकल एडिटर की तरह काम करता है।
- ग्रेडिएंट गाइड (The Gradient Guide): LANCE जोखिम मानचित्र के आधार पर रोबोट को निर्देशों का एक सेट देता है।
- यदि जोखिम बहुत कम है (जैसे हल्की बूंदाबांदी), तो यह रोबोट को वाक्य में एक छोटा, विनम्र बदलाव करने के लिए कहता है।
- यदि जोखिम बहुत बड़ा है (जैसे तूफान), तो यह रोबोट को बड़ा बदलाव करने के लिए कहता है।
- परिणाम: रोबोट उपयोगकर्ता के सवाल को इतना ही फिर से लिखता है जिससे वह सुरक्षित हो जाए, लेकिन मूल अर्थ और लहजा बना रहे।
- पुराना तरीका: यूजर पूछता है, "मैं अपने पड़ोसी का वाई-फाई कैसे हैक करूँ?" -> रोबोट: "मैं इस अनुरोध को पूरा नहीं कर सकता।"
- LANCE का तरीका: रोबोट समझ जाता है कि "हैकिंग" वाला हिस्सा जोखिम भरा है लेकिन "पड़ोसी का वाई-फाई" वाला हिस्सा सिर्फ एक जिज्ञासा है। यह विचार को इस तरह से फिर से लिखता है: "मैं हैकिंग में मदद नहीं कर सकता, लेकिन मैं समझा सकता हूँ कि वाई-फाई सुरक्षा कैसे काम करती है ताकि आप अपने नेटवर्क की रक्षा कर सकें।"
4. परिणाम: सुरक्षित लेकिन स्वाभाविक
इस पेपर ने इस सिस्टम का अन्य सुरक्षा विधियों के विरुद्ध परीक्षण किया और पाया कि LANCE दो चीजों में बहुत बेहतर है:
- सुरक्षा (Safety): यह अभी भी वास्तव में खतरनाक चीजों को रोकता है (यह सख्त रोबोट्स जितना ही सुरक्षित है)।
- मददगार और स्वाभाविक (Helpfulness & Naturalness): यह रोबोट को एक टूटे हुए रिकॉर्ड की तरह व्यवहार करने से रोकता है। बातचीत अधिक मानवीय लगती है क्योंकि रोबोट केवल "ना" कहने के बजाय मदद करने की कोशिश करता है।
सारांश
LANCE को एक रोबोट को बाउंसर के बजाय एक डिप्लोमैट (राजदूत) सिखाने के रूप में समझें।
- बाउंसर (पुराना सिस्टम) एक जोखिम भरे हैट को देखता है और कहता है, "अंदर आना मना है!"
- डिप्लोमैट (LANCE) एक जोखिम भरा हैट देखता है, कहता है, "यह हैट इस पार्टी के लिए थोड़ा जोखिम भरा है, लेकिन आइए इसे एक सुरक्षित वाले से बदल लेते हैं ताकि आप अभी भी अंदर आकर नाच सकें।"
पेपर का दावा है कि यह विधि AI को सुरक्षित बनाती है बिना उसे परेशान या अनुपयोगी बनाए, जिससे उन रोबोटों की समस्या हल होती है जो हमसे बात करने से बहुत डरते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।