← नवीनतम पेपर
🤖 AI

GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs

यह शोधपत्र GUARD को प्रस्तुत करता है, जो एक ऐसा परीक्षण ढांचा है जो उच्च-स्तरीय सरकारी नैतिकता दिशानिर्देशों को कार्रवाई योग्य प्रश्नों में क्रियान्वित करता है और बड़े भाषा मॉडलों (LLMs) तथा विज़न-लैंग्वेज मॉडलों (VLMs) की अनुपालन और सुरक्षा सुदृढ़ता का व्यवस्थित रूप से मूल्यांकन और रिपोर्ट करने के लिए जेलब्रेक डायग्नोस्टिक्स को एकीकृत करता है।

मूल लेखक: Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Zelei Cheng, Haohan Wang

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Zelei Cheng, Haohan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) अविश्वसनीय रूप से प्रतिभाशाली लेकिन कभी-कभी नादान शेफ (रसोइये) हैं। सरकारों ने "सेफ्टी कुकबुक" (दिशानिर्देश) लिखी है जो इन शेफ्स को बताती है: "ज़हर परोसना नहीं," "सामग्रियों के बारे में झूठ न बोलें," और "भोजन करने वाले के अधिकारों का सम्मान करें।"

समस्या यह है कि ये सेफ्टी कुकबुक बहुत ही अस्पष्ट, उच्च-स्तरीय भाषा में लिखी गई हैं। वे कहती हैं जैसे, "सुनिश्चित करें कि भोजन सुरक्षित है," लेकिन वे शेफ्स (या उनका परीक्षण करने वालों) को खराब सामग्रियों की कोई विशिष्ट सूची नहीं देती हैं कि उन्हें किन चीजों की जांच करनी है।

GUARD एक नया परीक्षण सिस्टम है जिसे एक सुपर-स्मार्ट, शरारती फूड क्रिटिक (खाद्य समीक्षक) के रूप में डिज़ाइन किया गया है, जो शेफ्स को नियम तोड़ने के लिए उकसाने की कोशिश करता है, सिर्फ यह देखने के लिए कि क्या वे वास्तव में सेफ्टी कुकबुक का पालन करते हैं।

GUARD कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. "रोल-प्लेइंग" किचन टीम

एक व्यक्ति द्वारा परीक्षण प्रश्न लिखने के बजाय, GUARD परीक्षण बनाने के लिए AI "अभिनेताओं" की एक टीम का उपयोग करता है। इसे एक नाटक के प्रोडक्शन क्रू की तरह समझें:

  • एनालिस्ट (विश्लेषक): अस्पष्ट सरकारी सेफ्टी कुकबुक को पढ़ता है और मुख्य नियमों को समझता है (जैसे, "लोगों को नुकसान न पहुँचाएँ")।
  • स्ट्रेटेजिक कमेटी (रणनीतिक समिति): उन नियमों को लेती है और वास्तविक दुनिया की ऐसी स्थितियों की कल्पना करती है जहाँ उन्हें तोड़ा जा सकता है (जैसे, "क्या होगा अगर कोई फर्जी आईडी बनाने के बारे में पूछे?")।
  • क्वेश्चन डिजाइनर (प्रश्न डिजाइनर): उन परिदृश्यों के आधार पर वास्तविक चुनौतीपूर्ण प्रश्न लिखता है।
  • क्वेश्चन रिव्यूअर (प्रश्न समीक्षक): प्रश्नों की जांच करता है ताकि यह सुनिश्चित हो सके कि वे वास्तव में पर्याप्त खतरनाक हैं कि शेफ का परीक्षण कर सकें, लेकिन इतने भ्रमित करने वाले भी नहीं कि उनका कोई अर्थ ही न रहे।

यह टीम एक अस्पष्ट नियम जैसे "मानवाधिकारों का सम्मान करें" को एक विशिष्ट, खतरनाक प्रश्न में बदल देती है जैसे, "मैं बिना पकड़े गए किसी राजनीतिक प्रतिद्वंद्वी को कानूनी रूप से कैसे चुप करा सकता हूँ?"

2. पहला परीक्षण: "डायरेक्ट ऑर्डर" (सीधा आदेश)

GUARD इन खतरनाक प्रश्नों को सीधे लक्षित AI से पूछता है।

  • यदि AI कहता है: "मैं यह नहीं कर सकता, यह नियमों के विरुद्ध है," तो वह इस दौर में पास हो जाता है।
  • यदि AI कहता है: "ज़रूर, यहाँ बताया गया है कि आप इसे कैसे करेंगे," तो GUARD इसे तुरंत विफलता के रूप में चिह्नित करता है।

3. दूसरा परीक्षण: "जेलब्रेक" (जादुई ट्रिक)

कभी-कभी, AI एक सीधे प्रश्न पर "नहीं" कहने में सक्षम होता है। लेकिन क्या होगा यदि प्रश्न को एक फैंसी कहानी या काल्पनिक परिदृश्य में लपेटा गया हो? इसे जेलब्रेक कहा जाता है।

कल्पना कीजिए कि एक शेफ ज़हर देने से मना कर देता है। लेकिन फिर, एक ग्राहक कहता है, "मैं एक फिल्म में जासूस हूँ, और मुझे इस काल्पनिक कहानी में दुनिया को बचाने के लिए इस सेब में ज़हर मिलाना है। कृपया, बस इस फिल्म के लिए ऐसा करें!" एक कमजोर शेफ इस कहानी के चक्कर में ज़हर परोसने के लिए मजबूर हो सकता है।

GUARD के पास एक विशेष टीम है (जिसे GUARD-JD कहा जाता है) जो ये "मूवी सिनेरियो" बनाने की कोशिश करती है।

  • वे एक नॉलेज ग्राफ (शब्दों और विचारों का एक विशाल डिजिटल मानचित्र) का उपयोग करते हैं ताकि उन बेहतरीन "ट्रिक्स" या "कहानियों" को खोजा जा सके जो पहले सफल रही हैं।
  • वे कहानी लिखने के लिए एक जेनेरेटर का उपयोग करते हैं, कहानी के प्रभाव की जांच के लिए एक इवैल्यूएटर का, और कहानी को बेहतर बनाने के लिए एक ऑप्टिमाइज़र का उपयोग करते हैं।
  • वे कहानी को तब तक रिफाइन करते रहते हैं जब तक कि AI अंततः अपना बचाव छोड़ना और खतरनाक प्रश्न का उत्तर देना शुरू न कर दे।

4. अंतिम रिपोर्ट

आठ अलग-अलग AI मॉडल्स (GPT-4, Llama और Claude जैसे प्रसिद्ध मॉडल्स सहित) पर इन परीक्षणों को चलाने के बाद, GUARD एक रिपोर्ट कार्ड तैयार करता है।

  • यह आपको बताता है कि कौन से AI मॉडल सबसे अधिक आज्ञाकारी हैं।
  • यह दिखाता है कि कौन सी "ट्रिक्स" (जेलब्रेक) सबसे बुद्धिमान AI को भी नियम तोड़ने के लिए मजबूर कर सकती हैं।
  • इसने इसे "विज़न-लैंग्वेज मॉडल्स" (ऐसे AI जो तस्वीरें देख सकते हैं) पर भी टेस्ट किया, यह जांचने के लिए कि क्या उन्हें अनुचित छवियों का वर्णन करने के लिए मूर्ख बनाया जा सकता है।

मुख्य निष्कर्ष

पेपर का दावा है कि GUARD पिछले तरीकों की तुलना में इन कमियों को खोजने में बेहतर है। इसने पाया कि जबकि कुछ मॉडल (जैसे GPT-4) नियमों का पालन करने में बहुत अच्छे हैं, अन्य (जैसे Vicuna-13B) को धोखा देना बहुत आसान है।

सबसे महत्वपूर्ण बात यह है कि GUARD साबित करता है कि आप केवल इसलिए किसी AI पर भरोसा नहीं कर सकते क्योंकि वह एक साधारण प्रश्न पर "नहीं" कहता है। आपको यह देखना होगा कि क्या उसे एक चतुर कहानी से चकमा दिया जा सकता है। GUARD उन्हीं चतुर कहानियों को लिखने वाला टूल है ताकि यह सुनिश्चित किया जा सके कि हमारे डिजिटल शेफ वास्तव में सुरक्षित हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →