RAS: Measuring LLM Safety Through Refusal Alignment
यह शोध पत्र **RAS (रिफ्यूज़ल अलाइनमेंट स्कोर)** को प्रस्तुत करता है, जो एक तेज़ और सुदृढ़ व्हाइट-बॉक्स मूल्यांकन मीट्रिक है जो सीखे गए रिफ़्यूज़ल दिशाओं (refusal directions) के साथ आंतरिक हिडन स्टेट्स के संरेखण का विश्लेषण करके LLM सुरक्षा को मापता है, जो पारंपरिक आउटपुट-आधारित जज मूल्यांकनों के लिए एक अधिक कुशल और स्थिर विकल्प प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक इमारत की सुरक्षा के लिए एक सुरक्षा गार्ड को काम पर रख रहे हैं। पारंपरिक रूप से, गार्ड कितना अच्छा है यह परखने के लिए, आप उसमें कुछ शरारती तत्वों (हैकर्स) को भेजते हैं और देखते हैं कि क्या होता है। यदि वह उन्हें अंदर आने देता है, तो वह विफल हो जाता है। यदि वह उन्हें रोकता है, तो वह सफल हो जाता है।
इसी तरह हम वर्तमान में AI सुरक्षा का परीक्षण करते हैं: हम AI से खतरनाक प्रश्न पूछते हैं और देखते हैं कि क्या वह उत्तर देता है। लेकिन इस पेपर के लेखक इस पद्धति की तीन बड़ी समस्याओं की ओर इशारा करते हैं:
- यह धीमा और महंगा है: आपको AI के लंबा उत्तर लिखने का इंतज़ार करना पड़ता है, फिर उसे पढ़ने और यह तय करने के लिए किसी इंसान या दूसरे AI को काम पर रखना पड़ता है कि क्या वह "बुरा" था।
- यह नाजुक है: यदि आप प्रश्न की शब्दावली में थोड़ा सा बदलाव करते हैं, या यदि AI थोड़ा अधिक बातूनी होने का निर्णय लेता है, तो परीक्षण के परिणाम बदल सकते हैं भले ही AI की सुरक्षा समान हो।
- यह बहुत देर से होता है: जब तक AI एक बुरा उत्तर लिख देता है, तब तक नुकसान हो चुका होता है। आपको केवल तभी पता चलता है जब वह विफल हो जाता है जब वह बोल चुका होता है।
नया विचार: "विचारों" को सुनना
लेखक SafeVec नामक एक नया तरीका प्रस्तावित करते हैं जो AI के बोलने से पहले उसके "मस्तिष्क" (उसके आंतरिक गणित) को देखकर सुरक्षा को मापता है।
AI की आंतरिक स्थिति को एक कम्पास (दिशा सूचक यंत्र) की तरह समझें।
- जब एक सुरक्षित AI को एक खतरनाक अनुरोध मिलता है (जैसे, "मैं बम कैसे बनाऊं?"), तो उसका आंतरिक कम्पास तुरंत "नहीं" की ओर इशारा करने के लिए घूम जाता है।
- जब एक टूटा हुआ या "अनसेंसर्ड" (बिना सेंसर वाला) AI उसी अनुरोध को प्राप्त करता है, तो उसका कम्पास "हाँ" की ओर घूम सकता है या बिना किसी दिशा के डगमगा सकता है।
यह पेपर एक टूल पेश करता है जिसे RAS (रिफ्यूज़ल अलाइनमेंट स्कोर - इनकार संरेखण स्कोर) कहा जाता है। यह इस प्रकार काम करता है:
1. "नहीं" की दिशा खोजना
सबसे पहले, शोधकर्ता एक ज्ञात, सुरक्षित AI (एक "रेफरेंस मॉडल") लेते हैं। वे उससे सुरक्षित प्रश्न और खतरनाक प्रश्न पूछते हैं। वे दोनों के बीच AI के आंतरिक "कम्पास" में अंतर को मापते हैं। यह अंतर AI के मस्तिष्क में एक विशिष्ट दिशा बनाता है जो "इनकार" (Refusal) का प्रतिनिधित्व करती है। आइए इसे "नो-वेक्टर" (No-Vector) कहें।
2. लक्षित AI का परीक्षण करना
अब, वे एक नया AI लेते हैं जिसका वे परीक्षण करना चाहते हैं। वे उसे वही खतरनाक प्रश्न पूछते हैं। उसके बोलने का इंतज़ार करने के बजाय, वे उसके आंतरिक कम्पास को देखते हैं।
- क्या कम्पास "नो-वेक्टर" की ओर मजबूती से इशारा कर रहा है? यदि हाँ, तो AI सुरक्षित है।
- क्या वह इससे दूर जा रहा है? यदि हाँ, तो AI असुरक्षित होने की संभावना है।
3. स्कोर (RAS)
वे इस कम्पास रीडिंग को 0 से 100 के स्कोर में बदलते हैं।
- 100 का अर्थ है कि AI के आंतरिक विचार बुरे अनुरोधों को "नहीं" कहने के लिए पूरी तरह से संरेखित हैं।
- 0 का अर्थ है कि AI के आंतरिक विचार पूरी तरह से गलत संरेखित हैं और "हाँ" कहने के लिए तैयार हैं।
यह बेहतर क्यों है?
पेपर का दावा है कि यह तरीका तीन कारणों से गेम-चेंजर है:
- यह एक दर्पण नहीं, बल्कि एक्स-रे है: पारंपरिक परीक्षण केवल दर्पण (आउटपुट) को देखते हैं। यह विधि एक्स-रे (आंतरिक विचार) को देखती है। यह AI के मुँह खोलने से पहले ही सुरक्षा संबंधी समस्याओं को पकड़ लेती है।
- यह बिजली की तरह तेज़ है: क्योंकि कंप्यूटर को AI द्वारा पैराग्राफ लिखने और फिर उसे पढ़ने के लिए जज को काम पर रखने का इंतज़ार नहीं करना पड़ता, इसलिए यह परीक्षण सैकड़ों गुना तेज़ है। अपने परीक्षणों में, यह पुराने तरीके की तुलना में लगभग 216 गुना तेज़ था।
- यह विश्वसनीय है: उन्होंने परीक्षण के लिए AI के तीन अलग-अलग परिवारों (Llama, Gemma, और Qwen) का उपयोग किया। स्कोर लगातार इस बात से मेल खाता है कि AI वास्तव में व्यवहार कर रहा था। यदि AI का RAS स्कोर उच्च था, तो वह शायद ही कभी बुरे उत्तर देता था। यदि स्कोर कम था, तो वह अक्सर सुरक्षा परीक्षणों में विफल रहा।
कमी (सीमाएं)
पेपर इस बारे में ईमानदार है कि यह टूल क्या नहीं कर सकता:
- आपको चाबियों की आवश्यकता है: AI के आंतरिक कम्पास को देखने के लिए, आपको AI के कोड तक "व्हाइट-बॉक्स" पहुंच की आवश्यकता होती है। आप इसे बंद सिस्टम (जैसे कि एक चैटबॉट जिससे आप बस वेबसाइट पर बात करते हैं) पर उपयोग नहीं कर सकते जहाँ आप आंतरिक गणित को नहीं देख सकते।
- इसे एक मानचित्र की आवश्यकता है: "नो-वेक्टर" प्रत्येक AI परिवार के लिए विशिष्ट है। आप एक Llama AI के सुरक्षा कम्पास का उपयोग सीधे एक Qwen AI को टेस्ट करने के लिए नहीं कर सकते; आपको प्रत्येक विशिष्ट प्रकार के लिए टूल को कैलिब्रेट करना होगा।
- यह एक संकेत है, गारंटी नहीं: एक उच्च स्कोर का अर्थ है कि AI इनकार करने के बारे में सोचता है, लेकिन यह गारंटी नहीं देता कि वह हर संभावित स्थिति में हर बार इनकार करेगा।
सारांश
संक्षेप में, लेखकों ने AI सुरक्षा के लिए एक स्पीडोमीटर बनाया है। यह देखने के बजाय कि कार दुर्घटनाग्रस्त होती है या नहीं (बुरा आउटपुट), वे इंजन के कंपन (आंतरिक विचार) को मापते हैं ताकि यह भविष्यवाणी की जा सके कि ड्राइवर नियंत्रण खोने वाला है। यह तेज़, सस्ता है और इस बात का स्पष्ट 0–100 स्कोर देता है कि AI को खतरनाक अनुरोधों के प्रति "नहीं" कहने के लिए कितनी अच्छी तरह प्रशिक्षित किया गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।