← नवीनतम पेपर
💬 NLP

AI Security Leaderboard: Methodology, Results and Minimal Standard

यह शोध पत्र FAR.AI मिनिमल स्टैंडर्ड फॉर सेफगार्ड्स पेश करता है, जो CBRNE और साइबर खतरों के विरुद्ध 67 स्टैटिक जेलब्रेक तकनीकों के माध्यम से फ्रंटियर AI मॉडल्स का मूल्यांकन करने वाला एक बेंचमार्क है, जो यह प्रकट करता है कि जहाँ क्लाउड फेबल 5 और GPT-5.6 सोल जैसे कुछ मॉडल सुदृढ़ बने हुए हैं, वहीं ग्रोक 4.5 और जेमिनी 3.1 प्रो जैसे अन्य मॉडल अत्यधिक असमान और शोषण योग्य कमजोरियां प्रदर्शित करते हैं जिन्हें मौजूदा डिफेंस-इन-डेप्थ रणनीतियों का उपयोग करके संबोधित किया जा सकता है।

मूल लेखक: Jasper Timm, Lukas Struppek, Ziwei Xu, Grace Cheong, Oscar Mata, Dan Zhao, Mick Yang, Isadora De Andrade, Xiaojun Jia, Yiming Li, Samuel Bauer, Heather McIntyre, Adam Gleave, Edward Yee, Kellin Pelrin
प्रकाशित 2026-08-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jasper Timm, Lukas Struppek, Ziwei Xu, Grace Cheong, Oscar Mata, Dan Zhao, Mick Yang, Isadora De Andrade, Xiaojun Jia, Yiming Li, Samuel Bauer, Heather McIntyre, Adam Gleave, Edward Yee, Kellin Pelrine

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

इंटरनेट की कल्पना एक विशाल, हलचल भरी लाइब्रेरी के रूप में करें जहाँ किताबें एआई (AI) नामक सुपर-स्मार्ट रोबोटों द्वारा लिखी जाती हैं। ये रोबोट अविश्वसनीय रूप से प्रतिभाशाली हैं; वे कहानियाँ लिख सकते हैं, गणित की समस्याओं को हल कर सकते हैं, और यहाँ तक कि नई दवाइयों को डिजाइन करने में भी मदद कर सकते हैं। लेकिन किसी भी शक्तिशाली उपकरण की तरह, इनका गलत इस्तेमाल भी किया जा सकता है। यदि कोई रोबत खुश करने के लिए बहुत अधिक उत्सुक है, तो वह अनजाने में किसी बुरे व्यक्ति को खतरनाक हथियार बनाने या किसी सुरक्षित बैंक को हैक करने में मदद कर सकता है। इसे रोकने के लिए, इन रोबोटों को बनाने वाले लोग "सुरक्षा गार्ड" (safety guards) लगाते हैं—जैसे कि किसी क्लब में एक बाउंसर जो आईडी चेक करता है और किसी भी ऐसे व्यक्ति को प्रवेश देने से मना कर देता है जो मुसीबत लेकर आ रहा हो। हालाँकि, ठीक वैसे ही जैसे एक चतुर किशोर भेष बदलकर या कोई मज़ेदार कहानी सुनाकर बाउंसर को चकमा दे सकता है, हैकर्स कभी-कभी इन एआई रोबोटों को उनके सुरक्षा नियमों को अनदेखा करने के लिए धोखा दे सकते हैं। इस ट्रिक को "जेलब्रेक" (jailbreak) कहा जाता है। बड़ा सवाल यह है कि ये सुरक्षा गार्ड कितने मजबूत हैं, और क्या वे सबसे खतरनाक चालों को रोक सकते हैं?

यह रिपोर्ट, जिसका शीर्षक "एआई सुरक्षा लीडरबोर्ड" (AI Security Leaderboard) है, दुनिया के सबसे उन्नत एआई रोबोटों के लिए एक विशाल रिपोर्ट कार्ड की तरह काम करती है। सुरक्षा विशेषज्ञों की एक टीम ने वर्तमान में उपलब्ध चार सबसे बड़े, स्मार्ट एआई मॉडल्स के सुरक्षा गार्डों का परीक्षण यह देखने के लिए किया कि ज्ञात ट्रिक्स की एक विशाल लाइब्रेरी के खिलाफ वे कितनी अच्छी तरह टिक पाते हैं। उन्होंने दो बहुत ही डरावने क्षेत्रों पर ध्यान केंद्रित किया: विनाश के सामूहिक हथियार बनाना (जैसे रासायनिक या जैविक खतरे) और साइबर हमले करना। शोधकर्ताओं ने केवल रोबोटों से सरल प्रश्न नहीं पूछे; उन्होंने उन्हें तोड़ने के लिए दो अलग-अलग रणनीतियों का उपयोग किया। पहले, उन्होंने रोबोटों पर हजारों यादृच्छिक (random), अराजक प्रयास किए, जैसे कि आँखों पर पट्टी बांधकर डार्ट्स फेंकना। दूसरा, उन्होंने विशेषज्ञ "रेड टीमर्स" (red teamers) की एक टीम का उपयोग किया—मानव हैकर्स जिन्होंने विशिष्ट, चतुर और जटिल ट्रिक्स तैयार कीं ताकि कमजोर कड़ियों को खोजा जा सके।

परिणाम बताते हैं कि यह एक बहुत ही असमान खेल का मैदान है। यह एक ऐसी दौड़ की तरह है जहाँ कुछ धावक बुलेटप्रूफ जैकेट पहने हुए हैं और अन्य कागज की शर्ट पहने हुए हैं। दो मॉडल, क्लॉड फेबल 5 (Claude Fable 5) और जीपीटी-5.6 सोल (GPT-5.6 Sol), अविश्वसनीय रूप से कठिन थे। शोधकर्ताओं ने उन्हें तोड़ने के लिए हजारों अलग-अलग तरीकों का परीक्षण किया, जिसमें विशेषज्ञ-निर्मित ट्रिक्स भी शामिल थीं, और उन्हें शून्य सफल जेलब्रेक मिले। एक हमलावर के लिए उनके सुरक्षा नियमों को तोड़ने का एक तरीका खोजने के लिए $14,200 से अधिक खर्च करना होगा, जो यह सुझाव देता है कि ये मॉडल वर्तमान में परीक्षण किए गए विशिष्ट हमलों के विरुद्ध बहुत सुरक्षित हैं।

दूसरी ओर, दो अन्य मॉडल, ग्रोक 4.5 (Grok 4.5) और जेमिनी 3.1 प्रो (Gemini 3.1 Pro) के ढाल बहुत कमजोर थे। यादृच्छिक डार्ट्स फेंकने वाली रणनीति ने उन्हें तोड़ने के दर्जनों तरीके खोजे, और जब विशेषज्ञ हैकर्स ने कदम रखा, तो उन्होंने सैकड़ों और तरीके खोज निकाले। ग्रोक 4.5 के लिए, एक हमलावर लगभग 58मेंसुरक्षानियमोंकोतोड़नेकातरीकाढूंढसकताथा।जेमिनी3.1प्रोकेलिए,लागतलगभग58 में सुरक्षा नियमों को तोड़ने का तरीका ढूंढ सकता था। जेमिनी 3.1 प्रो के लिए, लागत लगभग 278 थी। ये मॉडल विशेष रूप से तब असुरक्षित थे जब रासायनिक हथियारों, जैविक खतरों या कंप्यूटर नेटवर्क को हैक करने के बारे में पूछा गया था। रिपोर्ट में पाया गया कि इन कमजोर मॉडल्स के लिए, एक बुरा व्यक्ति आसानी से एक ऐसे रोबोट की तलाश कर सकता था जो खुशी-खुशी उन्हें खतरनाक कार्यों में मदद करे।

लेखक सुरक्षा के लिए एक "न्यूनतम मानक" (Minimal Standard) को परिभाषित करते हैं। इसे एक बुनियादी आचार संहिता के रूप में समझें जिसे हर एआई को सार्वजनिक रूप से सुरक्षित माने जाने के लिए पालन करना चाहिए। इसका मतलब यह नहीं है कि एआई पूर्ण या अटूट है, लेकिन इसका मतलब यह है कि इसे उन सामान्य, कम लागत वाले ट्रिक्स से आसानी से धोखा नहीं दिया जाना चाहिए जो पहले से ही हैकर्स के पास मौजूद हैं। रिपोर्ट का तर्क है कि इस मानक को पूरा करने में विफल होना यह गारंटी देता है कि एआई सुरक्षा में अत्याधुनिक (state-of-the-art) नहीं है। अच्छी खबर यह है कि कमजोर मॉडल्स में पाई गई कमजोरियों को उन रक्षा रणनीतियों का उपयोग करके ठीक किया जा सकता है जो पहले से ही सार्वजनिक रूप से ज्ञात हैं और अन्य डेवलपर्स द्वारा उपयोग की जा रही हैं। रिपोर्ट "डिफेंस-इन-डेप्थ" (defense-in-depth) बनाने की सिफारिश करती है, जो एक ऐसे विमान को डिजाइन करने जैसा है जो तब भी सुरक्षित रूप से लैंड कर सके जब उसका एक इंजन फेल हो जाए। सुरक्षा की कई परतें रखकर—उपयोगकर्ता जो टाइप करता है उसे चेक करना, रोबोट कैसे सोचता है उस पर नज़र रखना, और वह जो कहता है उसे स्कैन करना—एक सिस्टम उन गलतियों को पकड़ सकता है जिन्हें एक एकल परत मिस कर सकती है।

संक्षेप में, पेपर सुझाव देता है कि जबकि हम प्रगति कर रहे हैं, सुरक्षा स्वचालित नहीं है। कुछ एआई मॉडल वर्तमान में बहुत मजबूत हैं, जबकि अन्य में बड़े छेद हैं जिनका फायदा आतंकवादी या अपराधी उठा सकते हैं। लेखकों को उम्मीद है कि इन परिणामों और एक स्पष्ट "लीडरबोर्ड" को प्रकाशित करके, वे कंपनियों को इन छेदों को ठीक करने और यह सुनिश्चित करने के लिए प्रेरित कर पाएंगे कि जैसे-जैसे एआई स्मार्ट होता जाता है, वह सुरक्षित भी होता जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →