Evaluating Frontier AI Agents as Autonomous Clinical Security Auditors
यह शोध पत्र METR टास्क स्टैंडर्ड पर आधारित एक ओपन इवैल्यूएशन टास्क पेश करता है जो यह परीक्षण करता है कि क्या फ्रंटियर एआई एजेंट्स हमलों को लागू करके, सुरक्षा स्कोर की गणना करके और रिपोर्ट तैयार करके स्वायत्त रूप से संरचित क्लिनिकल एआई सुरक्षा ऑडिट कर सकते हैं, जो यह प्रदर्शित करता है कि क्लाउड सोनेट 4.6 और GPT-4.1 जैसे मॉडल्स कई डेटासेट्स और आर्किटेक्चर में पूर्ण स्कोर प्राप्त कर सकते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर डॉक्टर बनना सीख रहे हैं, बीमारियों का निदान करने और उपचार के निर्णय लेने में मदद कर रहे हैं। ये "AI डॉक्टर" अविश्वसनीय रूप से स्मार्ट हैं, लेकिन उनकी एक गुप्त कमजोरी है: उन्हें चकमा दिया जा सकता है। ठीक वैसे ही जैसे किसी इंसान को एक चतुर ऑप्टिकल इल्यूजन (दृष्टि भ्रम) द्वारा मूर्ख बनाया जा सकता है, एक AI को प्राप्त डेटा में सूक्ष्म, लगभग अदृश्य बदलावों से भ्रमित किया जा सकता है। यदि किसी हैकर को पता चल जाए कि ऐसे सूक्ष्म बदलाव कैसे किए जाते हैं, तो वे AI को यह कहने के लिए धोखा दे सकते हैं कि एक मरीज स्वस्थ है जबकि वह वास्तव में बीमार है, या इसके विपरीत। इसे "एडवर्सरियल अटैक" (adversarial attack) कहा जाता है, और यह एक बहुत बड़ी समस्या है क्योंकि यदि हम वास्तविक मरीजों की मदद करने के लिए AI को छोड़ने से पहले इन तरकीबों को नहीं खोज लेते, तो लोगों को चोट पहुँच सकती है।
इसे रोकने के लिए, हमें "सुरक्षा ऑडिटरों" (security auditors) की आवश्यकता है—ऐसे विशेषज्ञ जो AI को जानबूझकर तोड़ने की कोशिश करते हैं ताकि यह देखा जा सके कि वह कितना मजबूत है। लेकिन समस्या यह है कि सुरक्षा ऑडिटर बनना कठिन है। इसके लिए गहरे गणितीय कौशल, विशेष कंप्यूटर प्रोग्राम और बहुत अधिक समय की आवश्यकता होती है। अधिकांश अस्पताल टीमों के पास ऐसे विशेषज्ञ नहीं होते जो यह कर सकें, और इसे करने के उपकरण या तो गायब हैं या बहुत जटिल हैं। तो, बड़ा सवाल यह है: क्या एक नए प्रकार का सुपर-स्मार्ट कंप्यूटर प्रोग्राम, जिसे "AI एजेंट" कहा जाता है, क्या यह कठिन काम अपने आप कर सकता है? ये एजेंट डिजिटल इंटर्न की तरह हैं जो निर्देश पढ़ सकते हैं, अपना खुद का कंप्यूटर कोड लिख सकते हैं, परीक्षण चला सकते हैं और बिना किसी इंसान के हर कदम पर मार्गदर्शन के एक रिपोर्ट लिख सकते हैं।
यह शोध इस विचार का परीक्षण करता है। शोधकर्ताओं ने दुनिया के तीन सबसे उन्नत AI एजेंटों के लिए एक चुनौतीपूर्ण "परीक्षा" बनाई। परीक्षा में उनसे एक क्लिनिकल AI मॉडल के लिए स्वायत्त सुरक्षा ऑडिटर के रूप में कार्य करने को कहा गया। एजेंटों को एक मेडिकल प्रेडिक्शन मॉडल (जैसे कि स्तन कैंसर या आईसीयू मृत्यु दर की भविष्यवाणी करने वाला मॉडल), रोगी रिकॉर्ड का एक डेटासेट, और चार अलग-अलग प्रकार के सुरक्षा हमलों को करने के निर्देश दिए गए। एजेंटों को इन हमलों को निष्पादित करने के लिए शुरू से अपना स्वयं का कोड लिखना था, गणना करनी थी, और एक विशिष्ट प्रारूप में अंतिम सुरक्षा रिपोर्ट लिखनी थी, यह सब एक सुरक्षित डिजिटल कंटेनर के भीतर 40 "टर्न" (या चरणों) की सख्त समय सीमा के भीतर करना था।
परिणाम अद्भुत सफलता और दिलचस्प विफलताओं का मिश्रण थे। तीन में से दो AI एजेंटों, क्लाउड सोनेट 4.6 (Claude Sonnet 4.6) और GPT-4.1 ने परीक्षा में महारत हासिल की। उन्होंने परीक्षा के हर संस्करण को पूरी तरह से सफलतापूर्वक पूरा किया, सही कोड लिखा और हर बार सटीक सुरक्षा रिपोर्ट तैयार की। उन्होंने यह कुशलतापूर्वक किया, अपेक्षाकृत कम "टोकन" (टेक्स्ट की इकाइयाँ जिन्हें AI प्रोसेस करता है) का उपयोग करके। हालाँकि, तीसरे एजेंट, GPT-4o को संघर्ष करना पड़ा। वह अपने प्रयासों में से केवल लगभग 61% में सफल रहा। जब वह विफल हुआ, तो वह इसलिए विफल नहीं हुआ क्योंकि वह गणित नहीं समझ सका; बल्कि वह इसलिए विफल हुआ क्योंकि वह प्रक्रिया में भटक गया। कभी-कभी वह अंतिम रिपोर्ट सहेजने से पहले ही काम करना बंद कर देता था, कभी-कभी उसने अंतिम स्कोर जोड़ते समय एक साधारण गणितीय त्रुटि की, और कभी-कभी उसने एक खाली फ़ाइल जमा कर दी। अध्ययन बताता है कि हालांकि शीर्ष स्तर के AI एजेंट अब अपने आप जटिल, बहु-चरणीय सुरक्षा ऑडिट करने में सक्षम हैं, लेकिन वे सभी समान रूप से विश्वसनीय नहीं हैं। सफलता और विफलता के बीच का अंतर अक्सर "अनुशासन" पर निर्भर था—ध्यान केंद्रित रखने, प्रगति को ट्रैक करने और विचलित हुए बिना या लापरवाही भरी गलतियाँ किए बिना काम पूरा करने की क्षमता। इसका अर्थ यह है कि जो अस्पताल अपने स्वयं के मेडिकल AI की जाँच करने के लिए AI का उपयोग करना चाहते हैं, उनके लिए सही "डिजिटल ऑडिटर" चुनना मेडिकल मॉडल जितना ही महत्वपूर्ण है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।