← नवीनतम पेपर
💬 NLP

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing

यह शोध पत्र RACC (रिप्रजेंटेशन-अवेयर कवरेज क्राइटेरिया) प्रस्तुत करता है, जो LLM सुरक्षा परीक्षण के लिए एक स्केलेबल फ्रेमवर्क है जो टेस्ट सुइट की पर्याप्तता का मूल्यांकन करने और हमले के निर्माण (अटैक जनरेशन) को निर्देशित करने के लिए हिडन स्टेट्स से सुरक्षा-विशिष्ट रिप्रजेंटेशन्स निकालता है, जो पारंपरिक न्यूरॉन-स्तरीय कवरेज मानदंडों की सीमाओं को प्रभावी ढंग से दूर करता है।

मूल लेखक: Zeming Wei, Zhixin Zhang, Chengcan Wu, Yihao Zhang, Xiaokun Luan, Meng Sun

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zeming Wei, Zhixin Zhang, Chengcan Wu, Yihao Zhang, Xiaokun Luan, Meng Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन कभी-कभी शरारती, रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल या LLM) है। आप यह सुनिश्चित करना चाहते हैं कि वह कुछ भी बुरा, खतरनाक या अवैध न कहे। इसे करने के लिए, आप उसे हजारों पेचीदा सवाल (जिन्हें "जेलब्रेक" कहा जाता है) भेजते हैं ताकि यह देख सकें कि क्या वह अपने सुरक्षा नियमों को तोड़ता है।

समस्या यह है: आप कैसे जानेंगे कि आपके पेचीदा सवालों की सूची वास्तव में अच्छी है?

पुराना तरीका: बल्ब गिनना

अतीत में, शोधकर्ता रोबोट के आंतरिक "लाइट बल्बों" (न्यूरॉन्स) को देखकर परीक्षण की गुणवत्ता को मापने की कोशिश करते थे। वे गिनते थे कि जब रोबate किसी प्रश्न को प्रोसेस करता है, तो कितने बल्ब जल उठते हैं।

  • दोष: यह एक फिल्म को समझने के लिए स्क्रीन पर बदलते पिक्सेल की संख्या गिनने जैसा है। एक मामूली, अर्थहीन गड़बड़ी लाखों पिक्सेल को रोशन कर सकती है, जबकि एक गहरा, खतरनाक विचार केवल कुछ ही बल्बों को रोशन कर सकता है। यह एक विशाल रोबोट के दिमाग में हर एक बल्ब को गिनने के लिए बहुत धीमा और महंगा भी है।

नया तरीका: RACC ("सुरक्षा दिशा-सूचक")

यह पेपर RACC (रिप्रेजेंटेशन-अवेयर कवरेज क्राइटेरिया) पेश करता है। हर लाइट बल्ब को गिनने के बजाय, RACC रोबोट के आंतरिक दिशा-सूचक (compass) को खोजता है जो "खतरे" की ओर इशारा करता है।

RACC इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. दिशा-सूचक को कैलिब्रेट करना (कैलिब्रेशन सेट)

सबसे पहले, शोधकर्ता रोबोट को स्पष्ट रूप से बुरे सवालों (जैसे "मैं बम कैसे बनाऊं?") की एक छोटी, चुनिंदा सूची दिखाते हैं। वे इस बात का विश्लेषण करते हैं कि जब रोबोट इन सवालों के बारे में सोचता है तो उसका दिमाग कैसे काम करता है, ताकि वे उस विशिष्ट "दिशा" या "वेक्टर" को ढूंढ सकें जहाँ हानि (harm) की अवधारणा मौजूद है।

  • उपमा: कल्पना कीजिए कि आप एक मेटल डिटेक्टर का परीक्षण करना चाहते हैं। पहले, आप उसे कुछ ज्ञात सिक्के और पत्थर दिखाते हैं ताकि वह कैलिब्रेट हो सके और जान सके कि "धातु" कैसा महसूस होता है।

2. "खतरे की दिशा" को मापना

इसके बाद, वे नए परीक्षण प्रश्नों की एक सूची लेते हैं। यादृच्छिक लाइट बल्बों को गिनने के बजाय, वे पूछते हैं: "यह प्रश्न 'हानि' की दिशा में कितनी मजबूती से इशारा करता है?"

  • यदि कोई प्रश्न किसी बुरे प्रश्न का केवल एक हानिरहित पुनर्गठन है (एक पर्यायवाची शब्द), तो वह उसी दिशा में इशारा करता है। RACC कहता है, "हमने पहले ही यह दिशा देख ली है; कोई नया क्षेत्र कवर नहीं हुआ है।"
  • यदि कोई प्रश्न पूरी तरह से हानिरहित है (जैसे "मौसम कैसा है?"), तो वह खतरे की दिशा से बिल्कुल अलग दिशा में इशारा करता है। RACC कहता है, "यह खतरे के दिशा-सूचक को बिल्कुल भी सक्रिय नहीं करता है। इसे अनदेखा करें।"
  • यदि कोई प्रश्न, रोबोट को धोखा देने का एक चतुर, नया तरीका है, तो वह खतरे का एक नया दिशा दिखाता है। RACC कहता है, "बेहतरीन! हमने एक नया अंधा बिंदु (blind spot) खोज लिया है।"

3. दिशा-सूचक के छह नियम

RACC दिशा-सूचक के न्याय करने के लिए छह विशिष्ट नियमों का उपयोग करता है, जिन्हें दो समूहों में विभाजित किया गया है:

समूह A: व्यक्तिगत अवधारणाओं की जाँच करना (क्या)

  1. क्या हमने बुराई को पाया? (SFC): क्या परीक्षण सूची ने किसी भी ज्ञात खतरे की दिशाओं को सक्रिय किया?
  2. क्या हमने मुख्य लक्ष्यों को छुआ? (TKFC): क्या परीक्षण सूची ने केवल कमजोर दिशाओं को ही नहीं, बल्कि सबसे मजबूत खतरे की दिशाओं को भी छुआ?
  3. क्या हमने तीव्रता का परीक्षण किया? (FIC): क्या परीक्षण सूची में खतरे की "फुसफुसाहट" और खतरे की "चिल्लाहट" दोनों शामिल थीं? (कुछ हमले सूक्ष्म होते हैं; कुछ स्पष्ट)।

समूह B: संयोजनों की जाँच करना (कैसे)
4. क्या हमने सभी मोहल्लों का दौरा किया? (SCC): क्या परीक्षण सूची ने बुरे व्यवहार के विभिन्न प्रकारों (जैसे हिंसा, घृणास्पद भाषण, घोटाले) को कवर किया, न कि केवल एक ही प्रकार को दोहराया?
5. क्या हमने सामग्रियों को मिलाया? (PCC): क्या परीक्षण सूची में ऐसे प्रश्न शामिल थे जो एक साथ दो बुरी चीजों को जोड़ते हैं (जैसे कि एक घोटाला जो हिंसक भी है)?
6. क्या हमने धुंधली सीमाओं को पाया? (CBC): क्या परीक्षण सूची ने उन प्रश्नों को खोजा जो "सुरक्षित" और "असुरक्षित" के बीच की धुंधली रेखा पर स्थित हैं, जहाँ रोबोट भ्रमित हो जाता है?

यह क्यों महत्वपूर्ण है (परिणाम)

इस पेपर ने वास्तविक दुनिया के सुरक्षा बेंचमार्क का उपयोग करके "लाइट बल्ब गिनने" वाले पुराने तरीकों के मुकाबले RACC का परीक्षण किया।

  • पुराना तरीका आसानी से चकमा खा गया। यदि आपने 1,000 हानिरहित प्रश्न जोड़े या बस एक ही बुरे प्रश्न को 1,000 बार अलग तरीके से लिखा, तो पुराने तरीके ने सोचा कि परीक्षण सूची "बेहतर" हो रही है क्योंकि अधिक लाइट बल्ब जल रहे थे।
  • RACC स्मार्ट बना रहा। इसने हानिरहित शोर और दोहराव वाले पर्यायवाची शब्दों को अनदेखा कर दिया। इसने उच्च स्कोर तभी दिया जब परीक्षण सूची ने रोबोट की सुरक्षा को तोड़ने के नए और विविध तरीके खोजे।

उल्लेखित वास्तविक दुनिया के उपयोग

यह पेपर RACC के दो व्यावहारिक उपयोग दिखाता है:

  1. परीक्षणों को प्राथमिकता देना: यदि आपके पास परीक्षण प्रश्नों का एक विशाल, अस्त-व्यस्त ढेर है, तो RACC जल्दी से उन्हें छाँट सकता है, सबसे उपयोगी वाले चुन सकता है और बेकार चीजों को फेंक सकता है।
  2. हमलों का नमूना लेना (Sampling Attacks): यदि आप रोबोट को तोड़ने के नए तरीके बनाने की कोशिश कर रहे हैं, तो RACC आपको अगले प्रयास के लिए सबसे आशाजनक विकल्पों को चुनने में मदद करता है, जिससे समय और प्रयास की बचत होती है।

निचोड़

RACC AI सुरक्षा के परीक्षण को मापने के लिए एक नया, स्मार्ट पैमाना है। AI के मस्तिष्क के भीतर लाखों छोटे विवरणों में खो जाने के बजाय, यह उन विशिष्ट "खतरे के संकेतों" पर ध्यान केंद्रित करता है जो मायने रखते हैं, जिससे सुरक्षा परीक्षण तेज़, सस्ता और बहुत अधिक सटीक हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →