← नवीनतम पेपर
🤖 AI

Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks

यह शोध पत्र यह तर्क देता है कि वर्तमान एजेंट-सुरक्षा बेंचमार्क दोषपूर्ण मेट्रिक्स, असंगत रैंकिंग और छोटे-नमूना आर्टिफैक्ट्स के कारण वैधता का अभाव रखते हैं, जो अंततः यह प्रदर्शित करता है कि उच्च मॉडल क्षमता अक्सर सुरक्षा के बजाय बढ़े हुए मिसअलाइनमेंट जोखिमों के साथ सह-संबंधित होती है, जिससे किसी भी विश्वसनीय सुरक्षा दावे के लिए बेंचमार्क, मेट्रिक्स और लक्षित व्यवहारों की सटीक परिभाषाएँ आवश्यक हो जाती हैं।

मूल लेखक: Youting Wang, Xiao Han, Dingyan Shang, Yuan Tang, Bowen Liu

प्रकाशित 2026-08-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Youting Wang, Xiao Han, Dingyan Shang, Yuan Tang, Bowen Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप सुपर-इंटेलिजेंट रोबोट्स की एक क्लास को ग्रेड करने की कोशिश कर रहे हैं जो बात कर सकते हैं, सोच सकते हैं और यहाँ तक कि इंसानों की तरह औजारों का उपयोग भी कर सकते हैं। आप दो चीजें जानना चाहते हैं: वे पहेलियाँ सुलझाने में कितने स्मार्ट हैं? और इससे भी महत्वपूर्ण बात यह है कि क्या वे सुरक्षित हैं? क्या वे बुरे कामों को करने से मना कर देते हैं, या वे अनजाने में किसी खलनायक की मदद कर देते हैं? आर्टिफिशियल इंटेलिजेंस की दुनिया में, वैज्ञानिकों ने इन चीजों को मापने के लिए "बेंचमार्क" बनाए हैं—जो कि मूल रूप से मानकीकृत परीक्षण (standardized tests) हैं। ठीक वैसे ही जैसे ड्राइवर का लाइसेंस टेस्ट यह जाँचता है कि क्या आप कार पार्क कर सकते हैं, ये बेंचमार्क यह जाँचते हैं कि क्या एक रोबोट खतरनाक अनुरोध को पहचान सकता है और "ना" कह सकता है।

लेकिन पेचीदा हिस्सा यह है: "स्मार्टनेस" को मापने की तुलना में "सुरक्षा" को मापना कठिन है। यदि आप एक रोबोट को गणित का सवाल हल करने के लिए कहते हैं, तो आमतौर पर एक सही उत्तर होता है। लेकिन यदि आप उससे "सुरक्षित" रहने के लिए कहते हैं, तो वह कैसा दिखता है? क्या इसका मतलब हर बुरे अनुरोध को अस्वीकार करना है? या इसका मतलब यह है कि वह बहुत अधिक शर्मीला हुए बिना ठीक से यह जान सके कि कब "ना" कहना है? हाल ही में, सुरक्षा को मापने के लिए दर्जनों नए परीक्षण सामने आए हैं। बड़ा सवाल यह है: क्या ये अलग-अलग परीक्षण वास्तव में एक ही चीज़ को माप रहे हैं? यदि एक रोबोट एक सुरक्षा परीक्षण में "A" ग्रेड प्राप्त करता है, तो क्या इसका मतलब है कि वह हर जगह सुरक्षित है? या यह संभव है कि परीक्षण केवल अलग-अलग कौशल की जाँच कर रहे हैं, या वे रोबोट को सुरक्षित दिखने के लिए धोखा दे रहे हैं जबकि वे वास्तव में सुरक्षित नहीं हैं?

यह पेपर एक जासूसी कहानी की तरह है जहाँ लेखक चार लोकप्रिय सुरक्षा परीक्षणों का ऑडिट करने के लिए अंडरकवर जाते हैं। उन्होंने केवल स्कोर को सतह पर नहीं लिया; उन्होंने वास्तव में क्या हो रहा है यह देखने के लिए विभिन्न टेक कंपनियों के 22 अलग-अलग AI मॉडल्स पर खुद ये परीक्षण चलाए।

सबसे पहले, उन्होंने एक सबसे प्रसिद्ध परीक्षण में एक चालाकी भरा लूपहोल (loopholes) खोजा, जिसे R-Judge कहा जाता है। यह परीक्षण यह मापने के लिए "F1" नामक स्कोरिंग सिस्टम का उपयोग करता है कि एक मॉडल खतरनाक अनुरोधों को कितनी अच्छी तरह पहचानता है। लेखकों ने एक अजीब ट्रिक पाई: यदि कोई रोबोट हर सवाल के लिए बस "खतरा!" (DANGER!) का अनुमान लगाता है, तो वह वास्तव में एक काफी उच्च स्कोर प्राप्त करता है—0.690। वास्तव में, यह सुसंगत, "हमेशा-असुरक्षित" वाला रोबोट उन पाँच वास्तविक, स्मार्ट मॉडल्स से भी बेहतर स्कोर करता था जो वास्तव में अच्छे और बुरे अनुरोधों के बीच अंतर करने की कोशिश कर रहे थे! यह बिल्कुल वैसा ही है जैसे एक शिक्षक किसी छात्र को केवल इसलिए उच्च ग्रेड दे दे क्योंकि वह हर बार हाथ उठाकर "आग!" चिल्ला देता है, भले ही वहाँ कोई आग न हो। यह पेपर साबित करता है कि यह विशिष्ट स्कोरिंग पद्धति टूटी हुई है क्योंकि यह सुरक्षित चीजों को सही ढंग से पहचानने के लिए श्रेय नहीं देती है।

इसके बाद, टीम ने यह देखा कि क्या रोबोट्स की सामान्य बुद्धिमत्ता (उनकी "क्षमता") उनके सुरक्षा स्कोर के पीछे छिपी हुई थी। उन्होंने पाया कि स्मार्ट होना एक रोबोट को कुछ सुरक्षा परीक्षणों को पास करने में मदद करता है, लेकिन यह एक जटिल संबंध है। कभी-कभी, रोबोट जितना स्मार्ट होता है, वह उतना ही सुरक्षित प्रतीत होता है। अन्य समय में, अत्यधिक स्मार्ट होना रोबोट को विशिष्ट परिदृश्यों में कम सुरक्षित बना देता है, जैसे कि जब उसे किसी कहानी में खलनायक बनने का नाटक करने के लिए कहा जाता है। लेखकों ने दिखाया कि आप केवल यह मानकर नहीं चल सकते कि एक स्मार्ट रोबोट एक सुरक्षित रोबोट है; यह संबंध इस बात पर निर्भर करता है कि आप कौन सा परीक्षण उपयोग कर रहे हैं और आप किन रोबोट्स के समूह को देख रहे हैं।

सबसे आश्चर्यजनक खोज यह थी कि ये सुरक्षा परीक्षण एक दूसरे से सहमत नहीं होते हैं। लेखकों ने 18 रोबोट्स को लिया और उन्हें तीन अलग-अलग प्रमुख सुरक्षा परीक्षणों से गुजारा। परिणाम अराजक थे: एक रोबोट जिसे एक परीक्षण में "सबसे सुरक्षित" रैंक किया गया था, उसे दूसरे में "सबसे कम सुरक्षित" के करीब रैंक किया जा सकता था। यह ऐसा ही है जैसे एक छात्र को गणित में शीर्ष स्कोर मिलता है, लेकिन विज्ञान में सबसे कम स्कोर मिलता है, और फिर टेस्ट आयोजक इस बात पर बहस करते हैं कि वास्तव में "सबसे अच्छा छात्र" कौन है। पेपर ने पाया कि यदि आप केवल रोबोट्स के एक छोटे समूह (जैसे केवल सात) को देखते हैं, तो आप एक नकली पैटर्न देख सकते हैं जो एक 'ट्रेड-ऑफ' (जहाँ एक तरीके से सुरक्षित होने का अर्थ दूसरे तरीके से असुरक्षित होना है) जैसा दिखता है। लेकिन जब उन्होंने समूह को 18 या अधिक रोबोट्स तक बढ़ाया, तो वह पैटर्न गायब हो गया। वह "ट्रेड-ऑफ" केवल बहुत कम उदाहरणों को देखने के कारण हुआ एक संयोग था।

अंत में, लेखों ने जाँच की कि क्या ये सुरक्षा स्कोर एक रोबोट के उस व्यवहार की भविष्यवाणी कर सकते हैं जो एक पूरी तरह से नई स्थिति में होता है जिसे उसने पहले नहीं देखा है। उन्होंने पाया कि रोबोट की सामान्य बुद्धिमत्ता यह भविष्यवाणी करने में बेहतरीन थी कि क्या वे एक कार्य पूरा कर सकते हैं (जैसे ऑनलाइन टिकट खरीदना), लेकिन सुरक्षा स्कोर यह भविष्यवाणी करने में बहुत खराब थे कि क्या रोबोट एक नए परिदृश्य में कुछ खतरनाक करेगा। केवल एक परीक्षण जिसने खतरे के एक विशिष्ट प्रकार के साथ मजबूत संबंध दिखाया, वह था AgentHarm, जिसने भविष्यवाणी की कि रोबोट "जेलब्रेक्स" (नियम तोड़ने के लिए किए गए धोखे) का कितना विरोध करता है। हालाँकि, यह भी सामान्य सुरक्षा का पूर्ण पैमाना नहीं था; इसका मतलब केवल यह था कि रोब बात करने में उस विशिष्ट प्रकार के धोखे का विरोध करने में अच्छा था।

संक्षेप में, पेपर निष्कर्ष निकालता है कि AI के लिए कोई एकल "सुरक्षा स्कोर" नहीं है। आप केवल एक नंबर देखकर यह नहीं कह सकते कि, "यह रोबोट सुरक्षित है।" आपको जो स्कोर मिलता है वह पूरी तरह से इस बात पर निर्भर करता है कि आप कौन सा परीक्षण उपयोग करते हैं, आप स्कोर की गणना कैसे करते हैं, और आप किन रोबोट्स का परीक्षण कर रहे हैं। यदि आप किसी रोबोट की सुरक्षा के बारे में दावा करना चाहते हैं, तो आपको बहुत विशिष्ट होना होगा: सटीक परीक्षण, सटीक मीट्रिक, वह व्यवहार जिसे आप माप रहे हैं, और उन रोबोट्स का समूह जिनका आपने परीक्षण किया है, उसका नाम लें। अन्यथा, आप शायद केवल एक ऐसे रोबोट को देख रहे होंगे जो "खतरा!" बताने में बहुत अच्छा है या एक ऐसा रोबोट जिसे अपने छोटे से समूह के साथ केवल किस्मत ने साथ दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →