Gate AI: LLM Security Benchmark Evaluation Methodology and Results
यह शोध पत्र एलएलएम (LLM) सुरक्षा डिटेक्टरों के लिए एक कठोर मूल्यांकन हारनेस पेश करता है जो एक एकल वैश्विक थ्रेशोल्ड के साथ 5-गुना क्रॉस-वैलिडेशन का उपयोग करके प्रति-डेटासेट थ्रेशोल्ड ट्यूनिंग और अज्ञात ऑपरेटिंग पॉइंट्स जैसी व्यवस्थित कमजोरियों को समाप्त करता है, और मजबूत सामान्यीकरण और निष्पक्ष तुलना सुनिश्चित करने के लिए नैदानिकों की एक व्यापक बैटरी का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक हवाई अड्डे पर बैगों की जाँच करने के लिए एक सुरक्षा गार्ड को काम पर रख रहे हैं। लक्ष्य बुरे लोगों (AI को धोखा देने की कोशिश करने वाले हैकर्स) को रोकना है बिना निर्दोष यात्रियों (सामान्य उपयोगकर्ताओं) को रोके।
यह शोध पत्र एक नए सुरक्षा गार्ड सिस्टम जिसे Gate कहा जाता है, की रिपोर्ट कार्ड है। लेखक यह साबित करने की कोशिश कर रहे हैं कि Gate अन्य गार्डों से बेहतर है, लेकिन वे इस बात को लेकर भी बहुत चिंतित हैं कि अन्य गार्डों की रिपोर्ट कैसे लिखी गई है। उनका मानना है कि पिछले कई रिपोर्ट "रिंग" (manipulated) या अनुचित थे।
यहाँ उनके कार्य का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. समस्या: "रिंग" किया गया टेस्ट (The "Rigged" Test)
लेखकों का तर्क है कि अतीत में अधिकांश सुरक्षा गार्डों का परीक्षण दो तरीकों से अनुचित रूप से किया गया था:
- "टेलरमेड सूट" की समस्या: अन्य गार्डों का परीक्षण विशिष्ट समूहों पर किया गया था, और परीक्षकों ने उस समूह के लिए विशेष रूप से गार्ड के नियमों को समायोजित किया था। यह एक ऐसे गार्ड की तरह है जो केवल लाल टोपी पहनने वाले लोगों को रोकने के लिए जानता है। यदि आप उनका परीक्षण नीली टोपी पहनने वाले लोगों पर करते हैं, तो वे विफल हो सकते हैं, लेकिन रिपोर्ट ने केवल उन्हें लाल टोपी वाले टेस्ट में पास दिखाया।
- "छिपी हुई सेटिंग्स" की समस्या: कुछ रिपोर्टों में यह नहीं बताया गया कि गार्ड का संवेदनशीलता स्तर (sensitivity level) क्या था। एक गार्ड को "सभी को रोकने" के लिए सेट किया जा सकता है (सभी बुरे लोगों को पकड़ता है लेकिन 50% निर्दोष लोगों को रोकता है), जबकि दूसरा "सभी को जाने देने" के लिए सेट हो सकता है (बुरे लोगों को छोड़ देता है लेकिन किसी को नहीं रोकता)। सेटिंग्स जाने बिना उनकी तुलना करना एक स्प्रिंटर की तुलना मैराथन धावक से करने जैसा है बिना यह बताए कि उन्होंने कौन सी दौड़ दौड़ी।
2. समाधान: "एक ही आकार के सभी के लिए" नियम (The "One-Size-Fits-All" Rule)
Gate की टीम ने एक सख्त, निष्पक्ष नियम पुस्तिका का उपयोग करके अपने गार्ड का परीक्षण करने का निर्णय लिया:
- एक वैश्विक सेटिंग: उन्होंने गार्ड की संवेदनशीलता को एक एकल, सख्त स्तर पर सेट किया (वे चाहते हैं कि 99% बुरे लोगों को रोका जाए जबकि केवल 1% निर्दोष लोगों को गलती से रोका जाए)। उन्होंने इस ठीक समान सेटिंग को प्रत्येक परीक्षण समूह पर लागू किया। समूहों के लिए नियमों को बदला नहीं गया।
- "धोखा न देने वाला" टेस्ट: उन्होंने 5-Fold Cross-Validation नामक एक विधि का उपयोग किया। कल्पना करें कि उनके पास 100 टेस्ट बैग हैं। वे उन्हें 5 ढेरों में विभाजित करते हैं। वे 4 ढेरों पर गार्ड को प्रशिक्षित करते हैं और 5वें पर उसका परीक्षण करते हैं। फिर वे ढेरों को मिलाते हैं और ऐसा 5 बार करते हैं। यह सुनिश्चित करता है कि गार्ड केवल प्रशिक्षण ढेर से उत्तर "रट" नहीं रहा है।
- "जुड़वां" चेक: उन्होंने एक दूसरा, अधिक सख्त परीक्षण चलाया ताकि यह सुनिश्चित हो सके कि गार्ड "जुड़वा" (बहुत समान प्रॉम्प्ट्स) को पहचानकर धोखाधड़ी नहीं कर रहा है। यदि दो प्रॉम्प्ट 90% समान हैं, तो उन्हें एक ही ढेर में जाना चाहिए ताकि गार्ड प्रशिक्षण के दौरान एक को और परीक्षण के दौरान दूसरे को न देख सके।
3. स्ट्रेस टेस्ट: "क्या गार्ड स्मार्ट है या भाग्यशाली?"
अंतिम स्कोर दिखाने से पहले, उन्होंने यह सुनिश्चित करने के लिए "लाई डिटेक्टर" (झूठ पकड़ने वाले) टेस्टों का एक सेट चलाया कि गार्ड वास्तव में खतरों को समझता है या केवल अनुमान लगा रहा है:
- "शफल" टेस्ट: उन्होंने लेबल को उलटा-पुलटा (scrambled) दिया (कंप्यूटर को रैंडम तरीके से बताया कि कौन से बैग "बुरे" थे और कौन से "अच्छे")। गार्ड का स्कोर संयोग के स्तर तक गिर गया। यह साबित करता है कि गार्ड केवल बैगों के क्रम को याद नहीं कर रहा था।
- "लंबाई" टेस्ट: उन्होंने यह जांचा कि क्या गार्ड लंबे बैगों को इसलिए फ्लैग कर रहा है क्योंकि वे लंबे हैं। ऐसा नहीं था; गार्ड वास्तव में सामग्री (content) को देख रहा था।
- "नया बच्चा" टेस्ट: उन्होंने 15 प्रकार के हमलों पर गार्ड को प्रशिक्षित किया और फिर एक बिल्कुल नए प्रकार के हमले पर इसका परीक्षण किया जिसे उसने पहले कभी नहीं देखा था। इसने फिर भी अच्छा प्रदर्शन किया, जिससे पता चलता है कि यह सामान्यीकरण (generalize) कर सकता है।
4. परिणाम: Gate ने कैसा प्रदर्शन किया
जब उन्होंने निष्पक्ष नियमों का उपयोग करके अन्य शीर्ष गार्डों (जैसे Lakera Guard) के साथ Gate की तुलना की:
- स्कोर: Gate ने लगभग सभी बुरे लोगों को पकड़ा (97.4% सफलता दर) जबकि केवल 1% समय निर्दोष लोगों को गलती से रोका।
- तुलना: जब उन्होंने सेटिंग्स को इस तरह से मिलाया कि दोनों गार्ड बुरे लोगों की समान संख्या को देख रहे थे, तो Gate ने आमतौर पर प्रतिस्पर्धा से अधिक बुरे लोगों को पकड़ा।
- गति: Gate अविश्वसनीय रूप से तेज़ है। यह एक बैग की जाँच लगभग 53 मिलीसेकंड में करता है (मानव पलक झपकने से भी तेज़)। औसत प्रतिस्पर्धी धीमा है, और कुछ बहुत अधिक धीमे हैं।
5. सीमाएं: जो गार्ड नहीं कर सकता (The Caveats)
लेखक अपनी सीमाओं के बारे में ईमानदार हैं। रिपोर्ट स्वीकार करती है कि Gate अभी भी पूर्ण नहीं है:
- यह केवल टेक्स्ट पढ़ता है: यह अभी चित्र नहीं देख सकता या वॉयस कमांड नहीं सुन सकता।
- इसे याद नहीं रहता: यदि कोई बुरा व्यक्ति एक लंबे दस्तावेज़ में कोई ट्रिक छिपा देता है जो टुकड़ों में बंट जाता है, या यदि वह ट्रिक बाद के लिए मेमोरी बैंक में स्टोर की जाती है, तो Gate उसे मिस कर सकता है।
- "ट्रेनिंग डेटा" का मुद्दा: चूंकि गार्ड को सार्वजनिक डेटा पर प्रशिक्षित किया गया था, इसलिए संभव है कि उसने प्रशिक्षण के दौरान "टेस्ट प्रश्नों" को पहले ही देख लिया हो। लेखक स्वीकार करते हैं कि यह जोखिम केवल Gate के लिए नहीं, बल्कि इस क्षेत्र के सभी के लिए है।
सारांश
इस शोध पत्र को एक कठोर, निष्पक्ष रेफरी के रूप में देखें। प्रत्येक सुरक्षा गार्ड को अपने स्वयं के टेस्ट प्रश्न और सेटिंग्स चुनने देने के बजाय, रेफरी ने सभी को समान नियमों के साथ एक ही बाधा दौड़ (obstacle course) में दौड़ने के लिए मजबूर किया। इन सख्त शर्तों के तहत, Gate ने अपने मुख्य प्रतिस्पर्धियों की तुलना में AI ट्रिक्स को पहचानने में अधिक तेज़ और सटीक साबित हुआ, बिना बहुत अधिक निर्दोष उपयोगकर्ताओं को गलती से रोके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।