RACC: Representation-Aware Coverage Criteria for LLM Safety Testing
यह शोध पत्र RACC (रिप्रजेंटेशन-अवेयर कवरेज क्राइटेरिया) प्रस्तुत करता है, जो LLM सुरक्षा परीक्षण के लिए एक स्केलेबल फ्रेमवर्क है जो टेस्ट सुइट की पर्याप्तता का मूल्यांकन करने और हमले के निर्माण (अटैक जनरेशन) को निर्देशित करने के लिए हिडन स्टेट्स से सुरक्षा-विशिष्ट रिप्रजेंटेशन्स निकालता है, जो पारंपरिक न्यूरॉन-स्तरीय कवरेज मानदंडों की सीमाओं को प्रभावी ढंग से दूर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन कभी-कभी शरारती, रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल या LLM) है। आप यह सुनिश्चित करना चाहते हैं कि वह कुछ भी बुरा, खतरनाक या अवैध न कहे। इसे करने के लिए, आप उसे हजारों पेचीदा सवाल (जिन्हें "जेलब्रेक" कहा जाता है) भेजते हैं ताकि यह देख सकें कि क्या वह अपने सुरक्षा नियमों को तोड़ता है।
समस्या यह है: आप कैसे जानेंगे कि आपके पेचीदा सवालों की सूची वास्तव में अच्छी है?
पुराना तरीका: बल्ब गिनना
अतीत में, शोधकर्ता रोबोट के आंतरिक "लाइट बल्बों" (न्यूरॉन्स) को देखकर परीक्षण की गुणवत्ता को मापने की कोशिश करते थे। वे गिनते थे कि जब रोबate किसी प्रश्न को प्रोसेस करता है, तो कितने बल्ब जल उठते हैं।
- दोष: यह एक फिल्म को समझने के लिए स्क्रीन पर बदलते पिक्सेल की संख्या गिनने जैसा है। एक मामूली, अर्थहीन गड़बड़ी लाखों पिक्सेल को रोशन कर सकती है, जबकि एक गहरा, खतरनाक विचार केवल कुछ ही बल्बों को रोशन कर सकता है। यह एक विशाल रोबोट के दिमाग में हर एक बल्ब को गिनने के लिए बहुत धीमा और महंगा भी है।
नया तरीका: RACC ("सुरक्षा दिशा-सूचक")
यह पेपर RACC (रिप्रेजेंटेशन-अवेयर कवरेज क्राइटेरिया) पेश करता है। हर लाइट बल्ब को गिनने के बजाय, RACC रोबोट के आंतरिक दिशा-सूचक (compass) को खोजता है जो "खतरे" की ओर इशारा करता है।
RACC इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:
1. दिशा-सूचक को कैलिब्रेट करना (कैलिब्रेशन सेट)
सबसे पहले, शोधकर्ता रोबोट को स्पष्ट रूप से बुरे सवालों (जैसे "मैं बम कैसे बनाऊं?") की एक छोटी, चुनिंदा सूची दिखाते हैं। वे इस बात का विश्लेषण करते हैं कि जब रोबोट इन सवालों के बारे में सोचता है तो उसका दिमाग कैसे काम करता है, ताकि वे उस विशिष्ट "दिशा" या "वेक्टर" को ढूंढ सकें जहाँ हानि (harm) की अवधारणा मौजूद है।
- उपमा: कल्पना कीजिए कि आप एक मेटल डिटेक्टर का परीक्षण करना चाहते हैं। पहले, आप उसे कुछ ज्ञात सिक्के और पत्थर दिखाते हैं ताकि वह कैलिब्रेट हो सके और जान सके कि "धातु" कैसा महसूस होता है।
2. "खतरे की दिशा" को मापना
इसके बाद, वे नए परीक्षण प्रश्नों की एक सूची लेते हैं। यादृच्छिक लाइट बल्बों को गिनने के बजाय, वे पूछते हैं: "यह प्रश्न 'हानि' की दिशा में कितनी मजबूती से इशारा करता है?"
- यदि कोई प्रश्न किसी बुरे प्रश्न का केवल एक हानिरहित पुनर्गठन है (एक पर्यायवाची शब्द), तो वह उसी दिशा में इशारा करता है। RACC कहता है, "हमने पहले ही यह दिशा देख ली है; कोई नया क्षेत्र कवर नहीं हुआ है।"
- यदि कोई प्रश्न पूरी तरह से हानिरहित है (जैसे "मौसम कैसा है?"), तो वह खतरे की दिशा से बिल्कुल अलग दिशा में इशारा करता है। RACC कहता है, "यह खतरे के दिशा-सूचक को बिल्कुल भी सक्रिय नहीं करता है। इसे अनदेखा करें।"
- यदि कोई प्रश्न, रोबोट को धोखा देने का एक चतुर, नया तरीका है, तो वह खतरे का एक नया दिशा दिखाता है। RACC कहता है, "बेहतरीन! हमने एक नया अंधा बिंदु (blind spot) खोज लिया है।"
3. दिशा-सूचक के छह नियम
RACC दिशा-सूचक के न्याय करने के लिए छह विशिष्ट नियमों का उपयोग करता है, जिन्हें दो समूहों में विभाजित किया गया है:
समूह A: व्यक्तिगत अवधारणाओं की जाँच करना (क्या)
- क्या हमने बुराई को पाया? (SFC): क्या परीक्षण सूची ने किसी भी ज्ञात खतरे की दिशाओं को सक्रिय किया?
- क्या हमने मुख्य लक्ष्यों को छुआ? (TKFC): क्या परीक्षण सूची ने केवल कमजोर दिशाओं को ही नहीं, बल्कि सबसे मजबूत खतरे की दिशाओं को भी छुआ?
- क्या हमने तीव्रता का परीक्षण किया? (FIC): क्या परीक्षण सूची में खतरे की "फुसफुसाहट" और खतरे की "चिल्लाहट" दोनों शामिल थीं? (कुछ हमले सूक्ष्म होते हैं; कुछ स्पष्ट)।
समूह B: संयोजनों की जाँच करना (कैसे)
4. क्या हमने सभी मोहल्लों का दौरा किया? (SCC): क्या परीक्षण सूची ने बुरे व्यवहार के विभिन्न प्रकारों (जैसे हिंसा, घृणास्पद भाषण, घोटाले) को कवर किया, न कि केवल एक ही प्रकार को दोहराया?
5. क्या हमने सामग्रियों को मिलाया? (PCC): क्या परीक्षण सूची में ऐसे प्रश्न शामिल थे जो एक साथ दो बुरी चीजों को जोड़ते हैं (जैसे कि एक घोटाला जो हिंसक भी है)?
6. क्या हमने धुंधली सीमाओं को पाया? (CBC): क्या परीक्षण सूची ने उन प्रश्नों को खोजा जो "सुरक्षित" और "असुरक्षित" के बीच की धुंधली रेखा पर स्थित हैं, जहाँ रोबोट भ्रमित हो जाता है?
यह क्यों महत्वपूर्ण है (परिणाम)
इस पेपर ने वास्तविक दुनिया के सुरक्षा बेंचमार्क का उपयोग करके "लाइट बल्ब गिनने" वाले पुराने तरीकों के मुकाबले RACC का परीक्षण किया।
- पुराना तरीका आसानी से चकमा खा गया। यदि आपने 1,000 हानिरहित प्रश्न जोड़े या बस एक ही बुरे प्रश्न को 1,000 बार अलग तरीके से लिखा, तो पुराने तरीके ने सोचा कि परीक्षण सूची "बेहतर" हो रही है क्योंकि अधिक लाइट बल्ब जल रहे थे।
- RACC स्मार्ट बना रहा। इसने हानिरहित शोर और दोहराव वाले पर्यायवाची शब्दों को अनदेखा कर दिया। इसने उच्च स्कोर तभी दिया जब परीक्षण सूची ने रोबोट की सुरक्षा को तोड़ने के नए और विविध तरीके खोजे।
उल्लेखित वास्तविक दुनिया के उपयोग
यह पेपर RACC के दो व्यावहारिक उपयोग दिखाता है:
- परीक्षणों को प्राथमिकता देना: यदि आपके पास परीक्षण प्रश्नों का एक विशाल, अस्त-व्यस्त ढेर है, तो RACC जल्दी से उन्हें छाँट सकता है, सबसे उपयोगी वाले चुन सकता है और बेकार चीजों को फेंक सकता है।
- हमलों का नमूना लेना (Sampling Attacks): यदि आप रोबोट को तोड़ने के नए तरीके बनाने की कोशिश कर रहे हैं, तो RACC आपको अगले प्रयास के लिए सबसे आशाजनक विकल्पों को चुनने में मदद करता है, जिससे समय और प्रयास की बचत होती है।
निचोड़
RACC AI सुरक्षा के परीक्षण को मापने के लिए एक नया, स्मार्ट पैमाना है। AI के मस्तिष्क के भीतर लाखों छोटे विवरणों में खो जाने के बजाय, यह उन विशिष्ट "खतरे के संकेतों" पर ध्यान केंद्रित करता है जो मायने रखते हैं, जिससे सुरक्षा परीक्षण तेज़, सस्ता और बहुत अधिक सटीक हो जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।