ISVEX: A method for the assessment of the risk exposure of intelligent systems
यह शोध पत्र ISVEX को प्रस्तुत करता है, जो एक व्यापक भेद्यता स्कोरिंग पद्धति है जिसमें "स्ट्रॉन्ग" और "लाइट" दोनों संस्करण शामिल हैं, जिन्हें एक अनुकूलित बहु-मीट्रिक ढांचे के माध्यम से मॉडल हेरफेर, डेटा पॉइजनिंग और एजेंटिक कमजोरियों जैसे विशिष्ट AI जोखिमों को परिमाणित करके मौजूदा मानकों की विशिष्ट सीमाओं को संबोधित करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक नए प्रकार की कार कितनी खतरनाक है, इसकी रेटिंग करने की कोशिश कर रहे हैं। दशकों से, हम नियमित कारों को रेट करने के लिए एक मानक चेकलिस्ट (जिसे CVSS कहा जाता है) का उपयोग करते आए हैं। यह चेकलिस्ट पूछती है: "क्या कोई चोर खिड़की तोड़ सकता है? क्या वे इंजन को हॉटवायर कर सकते हैं? यदि वे कार चुरा लेते हैं, तो कितना नुकसान होगा?"
लेकिन आज, हमारे पास सेल्फ-ड्राइविंग कारें (इंटेलिजेंट सिस्टम) हैं। ये केवल धातु के डिब्बे नहीं हैं; ये अन्य कारों से बात कर सकती हैं, अपना सॉफ्टवेयर खुद बदल सकती हैं, अपने आप निर्णय ले सकती हैं, और स्टॉप साइन पर स्टिकर लगाकर अपने सेंसर को धोखा दे सकती हैं। पुराना चेकलिस्ट यहाँ काम नहीं करता क्योंकि इसे यह नहीं पता कि उस कार को कैसे मापा जाए जो "हैलुसिनेट" (भ्रमित) कर सकती है कि हरा सिग्नल है, या एक ऐसे रोबोट को कैसे मापा जाए जो खुद के ब्रेक को हैक कर सकता है।
यह पेपर ISVEX पेश करता है, एक नया, विशेष रूप से डिज़ाइन किया गया "खतरे का मीटर" जो इन स्मार्ट, ऑटोनॉमस सिस्टम के लिए बनाया गया है।
समस्या: पुराना पैमाना फिट नहीं बैठता
लेखकों का तर्क है कि जोखिम को मापने के वर्तमान उपकरण ऐसे हैं जैसे किसी बादल को स्केल (रूलर) से मापने की कोशिश करना।
- CVSS (पुराना मानक): नियमित सॉफ्टवेयर के लिए बेहतरीन है, लेकिन यह एक चैटबॉट और एक सेल्फ-ड्राइविंग कार के साथ एक जैसा व्यवहार करता है। यह उन चीजों को मिस कर देता है जैसे "प्रॉम्प्ट इंजेक्शन" (शब्दों से AI को बेवकूफ बनाना) या "डेटा पॉइजनिंग" (AI को गलत सबक सीखने के लिए गलत जानकारी खिलाना)।
- AIVSS (एक नया प्रयास): यह AI के लिए CVSS को ठीक करने की दिशा में एक पहला कदम था, लेकिन लेखक कहते हैं कि यह एक "आधे-अधूरे उपाय" की तरह है। यह स्कोर को औसत (एवरेज) निकाल देता है, जो अक्सर खतरे को कम करके दिखाता है। यदि किसी सिस्टम में एक छोटी सी खामी है लेकिन उसमें विनाशकारी क्षमता बहुत अधिक है, तो औसत स्कोर उसे "मध्यम जोखिम" दिखाता है जबकि उसे "क्रिटिकल" होना चाहिए।
समाधान: ISVEX (AI खतरा मीटर)
ISVEX एक स्कोरिंग सिस्टम है जो यह दर्शाने के लिए 0 से 10 तक का नंबर देता है कि एक AI सिस्टम कितना जोखिम भरा है। यह दो रूपों में आता है:
1. "स्ट्रॉन्ग" वर्शन (पूर्ण परीक्षा)
यह एक गहरी जांच है, जैसे कि एक पूर्ण मेडिकल चेकअप। इसमें 38 अलग-अलग प्रश्न हैं जिन्हें 7 श्रेणियों में बांटा गया है।
- बुनियादी बातें: यह अभी भी पुराने चीजों की जांच करता है (क्या कोई नेटवर्क को हैक कर सकता है?)।
- AI कोर: यह पूछता है, "क्या कोई AI के दिमाग को धोखा दे सकता है?" (प्रॉम्प्ट इंजेक्शन) या "क्या वे AI के रहस्य चुरा सकते हैं?"
- एजेंट लेयर: यह नया हिस्सा है। यह पूछता है, "क्या यह AI अन्य AI से बात कर सकता है और उन्हें गलत आदेश दे सकता है?" या "क्या यह अपने स्वयं के कोड को बदल सकता है?" यह रोबोट के बीच के कनेक्शन (प्रोटोकॉल जैसे MCP और A2A) को एक महत्वपूर्ण सुरक्षा क्षेत्र के रूप में देखता है।
- संदर्भ (Context): यह पूछता है, "कितने लोग प्रभावित हैं?" और "क्या हम नुकसान को उलट सकते हैं?" (यदि एक AI किसी CEO का फर्जी वीडियो फैलाता है, तो वह नुकसान स्थायी है। यदि एक सामान्य वेबसाइट डाउन होती है, तो आप बस उसे फिर से शुरू कर सकते हैं)।
"एंटी-डाइल्यूशन" (पतला करने के विरुद्ध) ट्रिक:
पेपर एक चतुर गणितीय ट्रिक को उजागर करता है। पुराने सिस्टम में, यदि आपके पास एक "क्रिटिकल" खामी और नौ "लो" खामियां थीं, तो औसत उन्हें "मीडियम" बना देता था। ISVX कहता है: "नहीं।" यदि एक हिस्सा क्रिटिकल है, तो पूरा सिस्टम उच्च चेतावनी प्राप्त करेगा, भले ही बाकी सब सुरक्षित हो। इसमें "फ्लोर्स" (न्यूनतम सीमा) भी हैं ताकि यदि कोई सिस्टम किसी खतरनाक चीज़ (जैसे अस्पताल का रोबोट) को नियंत्रित करता है, तो वह केवल इसलिए कम स्कोर नहीं पा सकता क्योंकि उसे हैक करना कठिन है।
2. "लाइट" वर्शन (ट्राइएज/त्वरित जांच)
कल्पना कीजिए कि एक व्यस्त हवाई अड्डे पर एक सुरक्षा गार्ड है। उनके पास हर यात्री का पूर्ण मेडिकल चेकअप करने का समय नहीं है। उन्हें एक त्वरित स्कैन की आवश्यकता है।
- ISVEX Lite केवल 12 प्रमुख प्रश्नों का उपयोग करता है।
- इसे चलाने में लगभग 3 मिनट लगते हैं।
- इसे आपातकालीन टीमों (SOC) के लिए डिज़ाइन किया गया है ताकि वे जल्दी से तय कर सकें: "क्या यह एक मामूली गड़बड़ी है, या हमें पूरी टीम को बुलाने की ज़रूरत है?"
- यदि लाइट स्कोर अधिक है, तो वे पूर्ण जांच के लिए "स्ट्रॉन्ग" वर्शन पर स्विच करते हैं।
यह वास्तविक जीवन में कैसे काम करता है (परिदृश्य)
लेखकों ने यह साबित करने के लिए कि यह पुराने तरीकों से बेहतर काम करता है, अपने नए मीटर का परीक्षण 10 अलग-अलग "क्या होगा अगर" वाले परिदृश्यों के विरुद्ध किया। यहाँ कुछ उदाहरण दिए गए हैं:
- "धोखा देने वाला साइन" (एडवर्सरियल अटैक): कोई स्टॉप साइन पर एक स्टिकर लगा देता है जो इंसानों के लिए सामान्य दिखता है लेकिन एक सेल्फ-ड्राइविंग कार को बताता है कि यह स्पीड लिमिट साइन है।
- पुराना मीटर: "मीडियम रिस्क" कहता है।
- ISVEX: "क्रिटिकल (10/10)" कहता है क्योंकि इसमें जान दांव पर है और नुकसान अपूरणीय है।
- "फर्जी CEO" (डीपफेक): अपराधी बैंक ट्रांसफर का आदेश देने के लिए एक CEO का फर्जी वीडियो बनाने के लिए AI का उपयोग करते हैं।
- पुराना मीटर: "मीडियम रिस्क" कहता है (केवल एक डेटा लीक)।
- ISVEX: "हाई रिस्क" कहता है क्योंकि प्रतिष्ठा को होने वाला नुकसान स्थायी है और यह पूरी कंपनी को प्रभावित करता है।
- "बोरिंग ग्लिच" (इंटरनल DoS): एक असंतुष्ट कर्मचारी 50 लोगों द्वारा उपयोग किए जाने वाले एक छोटे आंतरिक चैटबॉट को 2 घंटे के लिए क्रैश कर देता है।
- पुराना मीटर: "मीडियम रिस्क" कहता है (यह एक मानक आउटेज है)।
- ISVEX: "लो रिस्क (1.3/10)" कहता है क्योंकि इसने केवल 50 लोगों को प्रभावित किया और इसे आसानी से ठीक किया जा सकता था। पुराना मीटर यहाँ बहुत डरावना था; ISVEX इसे शांत करता है।
"रेड टीमिंग" से संबंध
पेपर यह भी बताता है कि इन जोखिमों को वास्तव में कैसे खोजा जाए। यह AI रेड टीमिंग का उपयोग करने का सुझाव देता है।
- रेड टीमिंग को ऐसे समझें जैसे कि अपने AI को तोड़ने की कोशिश करने के लिए "नैतिक हैकर्स" के एक समूह को काम पर रखना।
- ISVEX इन हैकर्स के लिए स्कोरकार्ड के रूप में कार्य करता है। केवल "हमने इसे तोड़ दिया" कहने के बजाय, रेड टीम ISVEX का उपयोग यह कहने के लिए करती है कि, "हमने इसे 8.5 के स्कोर के साथ तोड़ा क्योंकि हमने AI को रहस्य प्रकट करने के लिए मजबूर किया।"
- यह अस्पष्ट शिकायतों को ठोस नंबरों में बदल देता है जिनका उपयोग सुरक्षा टीमें सुधारों को प्राथमिकता देने के लिए कर सकती हैं।
निष्कर्ष
पेपर का दावा है कि ISVEX एक आवश्यक अपग्रेड है। इसका तर्क है कि हम अब उसी सुरक्षा पैमाने (रूलर) का उपयोग नहीं कर सकते जो हम एक टोस्टर के लिए उपयोग करते हैं जिसका उपयोग हम एक सेल्फ-ड्राइविंग रोबोट के लिए करते हैं। AI व्यवहार, एजेंट संचार और विफलता के वास्तविक दुनिया के परिणामों के बारे में विशिष्ट प्रश्न जोड़कर, ISVEX बुद्धिमान मशीनों के युग में जोखिम को मापने का एक अधिक सटीक, निष्पक्ष और कार्रवाई योग्य तरीका प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।