← नवीनतम पेपर
🤖 AI

Design Principles for the Construction of a Benchmark Evaluating Security Operation Capabilities of Multi-agent AI Systems

यह शोध पत्र "SOC-bench" के लिए डिज़ाइन सिद्धांतों और एक वैचारिक ढांचे का प्रस्ताव करता है, जो कि रैनसमवेयर (ransomware) घटना प्रतिक्रिया परिदृश्य के भीतर पांच समन्वित ब्लू टीम कार्यों से बना एक नवीन बेंचमार्क है, जिसका उद्देश्य मल्टी-एजेंट एआई प्रणालियों की स्वायत्त सुरक्षा संचालन क्षमताओं का व्यवस्थित रूप से मूल्यांकन करना है।

मूल लेखक: Yicheng Cai, Mitchell John DeStefano, Guodong Dong, Pulkit Handa, Peng Liu, Tejas Singhal, Peiyu Tseng, Winston Jen White

प्रकाशित 2026-04-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yicheng Cai, Mitchell John DeStefano, Guodong Dong, Pulkit Handa, Peng Liu, Tejas Singhal, Peiyu Tseng, Winston Jen White

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, हाई-टेक किला (एक कंपनी का कंप्यूटर नेटवर्क) अदृश्य डिजिटल चोरों के निरंतर हमले के घेरे में है। इस किले के भीतर रक्षकों की एक टीम रहती है जिन्हें ब्लू टीम (Blue Team) कहा जाता है। उनका काम चोरों को पहचानना, यह पता लगाना कि वे क्या चुरा रहे हैं, और नुकसान होने से पहले दरवाजे बंद करना है।

लंबे समय से, ये रक्षक इंसान रहे हैं। लेकिन अब, हमारे पास AI रोबोट्स (मल्टी-एजेंट AI सिस्टम) हैं जो मदद कर सकते हैं। बड़ा सवाल यह है: क्या ये AI रोबोट वास्तव में किले की रक्षा करने में अच्छे हैं, या वे सिर्फ दिखावटी खिलौने हैं?

यह पेपर एक नया "प्रशिक्षण मैदान" और "परीक्षण" पेश करता है जिसे SOC-bench कहा जाता है, ताकि इस सवाल का जवाब दिया जा सके। यहाँ इसका सरल विवरण दिया गया है।

1. समस्या: हम गलत चीज़ का परीक्षण कर रहे हैं

अभी, AI के लिए अधिकांश परीक्षण वीडियो गेम प्रतियोगिताओं की तरह हैं। वे AI से पूछते हैं: "क्या आप एक बंद दरवाजे को तोड़ सकते हैं?" या "क्या आप एक छिपे हुए जाल को ढूंढ सकते हैं?" (इसे "रेड टीमिंग" या बुरा आदमी बनना कहा जाता है)।

लेकिन वास्तविक दुनिया में, सुरक्षा टीमें अपना 90% समय समस्याओं को ठीक करने में बिताती हैं, न कि चीजें तोड़ने में। वे अग्निशमन कर्मी (firefighters) हैं, आग लगाने वाले (arsonists) नहीं। लेखकों ने महसूस किया कि हमारे पास यह परीक्षण करने का कोई अच्छा तरीका नहीं है कि क्या एक AI वास्तव में आग बुझा सकता है। हमें एक ऐसा परीक्षण चाहिए जो एक वास्तविक, अस्त-व्यस्त और अराजक आपात स्थिति का अनुकरण करे, न कि एक साफ-सुथरे वीडियो गेम लेवल का।

2. समाधान: "SOC-bench" (अंतिम फायर ड्रिल)

लेखकों ने एक वास्तविक ऐतिहासिक घटना (कोलोनियल पाइपलाइन हैक) पर आधारित एक विशाल, यथार्थवादी सिमुलेशन डिज़ाइन किया है। वे इसे SOC-bench कहते हैं।

SOC-bench को एक अराजक इमरजेंसी रूम के सिम्युलेटर के रूप में सोचें, लेकिन डॉक्टरों के बजाय, यहाँ AI एजेंट हैं। AI को भ्रमित करने वाले डेटा (लॉग्स, अलार्म, उपयोगकर्ता की शिकायतें) के सैलाब को देखना पड़ता है और सही निर्णय लेने होते हैं।

3. परीक्षण के 5 स्वर्णिम नियम (डिज़ाइन सिद्धांत)

परीक्षण को निष्पक्ष और यथार्थवादी बनाने के लिए, लेखकों ने पांच सख्त नियम निर्धारित किए हैं:

  • नियम 1: "वास्तविक दुनिया" ही बॉस है। परीक्षण किसी "परफेक्ट" भविष्य के सुरक्षा संस्करण का उपयोग नहीं करता है। यह एक अस्त-व्यस्त, अपूर्ण संस्करण का उपयोग करता है जिसमें टूटे हुए सेंसर और झूठे अलार्म शामिल हैं, बिल्कुल वास्तविक जीवन की तरह। यदि AI एक झूठे अलार्म से भ्रमित हो जाता है, तो वह भी परीक्षण का हिस्सा है!
  • नियम 2: नकल करने के लिए कोई संकेत नहीं। वास्तविक आग में, आपको कोई नक्शा नहीं मिलता जो ठीक से बताता हो कि आग कहाँ से शुरू हुई थी। AI को खुद संकेतों के बीच संबंध समझना होगा। परीक्षण AI को यह नहीं बताएगा कि, "हे, कार्य A, कार्य B में मदद करता है।"
  • नियम 3: केवल मनुष्यों की नकल न करें। यदि एक इंसान किसी पहेली को सुलझाने में 3 घंटे लेता है, लेकिन AI एक चतुर शॉर्टकट ढूंढ लेता है जिससे वह 10 मिनट में सुलझ जाती है, तो यह एक अच्छी बात है। परीक्षण परिणाम की परवाह करता है, इस बात की नहीं कि क्या AI ने बिल्कुल इंसानों की तरह काम किया।
  • नियम 4: अव्यवस्था को स्वीकार करें। वास्तविक सुरक्षा प्रणालियाँ त्रुटियों से भरी होती हैं। परीक्षण में नकली अलार्म और गायब डेटा शामिल है ताकि यह देखा जा सके कि क्या AI अनिश्चितता को संभाल सकता है।
  • नियम 5: भविष्य के अनुकूल (Future-Proof)। परीक्षण को आज मौजूद विशिष्ट AI ट्रिक्स पर निर्भर नहीं होना चाहिए। यह 5 साल बाद के AI रोबोट्स का भी परीक्षण करने में सक्षम होना चाहिए।

4. परीक्षण के पाँच "अध्याय"

परीक्षण को पाँच विशिष्ट मिशनों में विभाजित किया गया है, जिनके नाम जानवरों के नाम पर रखे गए हैं (याद रखने का एक मजेदार तरीका)। कल्पना कीजिए कि एक रैनसमवेयर हमला (जहाँ हैकर्स आपकी फाइलें लॉक कर देते हैं और पैसे मांगते हैं) हो रहा है। AI को ये पाँच चीजें करनी होंगी:

  • 🦊 टास्क फॉक्स (Task Fox - शुरुआती पक्ष):

    • काम: हमले के बड़े होने से पहले उसे पहचानना।
    • उपमा: एक स्मोक डिटेक्टर की तरह जो केवल टोस्ट जलने पर बीप नहीं करता, बल्कि यह महसूस करता है कि, "रुको, यह गंध तीन अलग-अलग कमरों से एक साथ आ रही है। यह घर में लगी आग है, न कि जला हुआ टोस्ट!" AI को यह तय करना होगा कि यह एक छोटी सी गड़बड़ी है या एक बड़ा समन्वित हमला।
  • 🐐 टास्क गोट (Task Goat - फॉरेंसिक जासूस):

    • काम: यह देखने के लिए फाइलों की जांच करना कि क्या एन्क्रिप्ट (encrypt) किया गया है।
    • उपमा: कल्पना कीजिए कि आप एक कमरे में जाते हैं जहाँ किसी ने सभी कागजात फाड़ दिए हैं। AI को उन फटे हुए टुकड़ों को देखना होगा और कहना होगा, "ठीक है, CEO की मेज पर रखी फाइलें गायब हैं, लेकिन बेसमेंट की फाइलें सुरक्षित हैं।" उसे यह समझना होगा कि वास्तव में कितना नुकसान हुआ है।
  • 🐭 टास्क माउस (Task Mouse - डेटा ट्रैकर):

    • काम: क्या चोरों ने कुछ चुराया?
    • उपमा: यदि कोई चोर घुस आया है, तो क्या उसने सिर्फ खिड़कियां तोड़ीं, या उसने गहने भी चुरा लिए? AI को नेटवर्क ट्रैफिक को देखना होगा और कहना होगा, "हाँ, 500 गीगाबाइट डेटा पिछले दरवाजे से इमारत से बाहर गया।"
  • 🐯 टास्क टाइगर (Task Tiger - प्रोफाइलर):

    • काम: इसने यह कैसे किया और कौन था?
    • उपमा: एक जासूस की तरह जो "वांटेड" पोस्टर बना रहा है। AI को सुरागों को जोड़कर यह बताने के लिए बनाना होगा कि, "यह कोई रैंडम हैकर नहीं था; यह एक विशिष्ट समूह था जिसने सामने के दरवाजे से घुसने के लिए एक विशिष्ट टूल का उपयोग किया।" उसे पूरे अपराध स्थल का नक्शा बनाना होगा।
  • 🐼 टास्क पांडा (Task Panda - निर्णय निर्माता):

    • काम: अभी हमें क्या करना चाहिए?
    • उपमा: यह सबसे कठिन हिस्सा है। AI को तय करना होगा: "क्या हमें आग रोकने के लिए पूरा इंटरनेट बंद कर देना चाहिए, या सिर्फ एक कंप्यूटर का प्लग निकालना चाहिए?" उसे हमले को रोकने के नुकसान और व्यवसाय को चलाने के नुकसान के बीच संतुलन बनाना होगा। उसे रिपोर्ट लिखनी होगी कि, "हम ईस्ट विंग की बिजली काट रहे हैं क्योंकि वहां आग फैल रही है, लेकिन हम वेस्ट विंग को चालू रख रहे हैं ताकि अस्पताल का काम चलता रहे।"

यह क्यों महत्वपूर्ण है

इस पेपर से पहले, हम AI का परीक्षण इस आधार पर कर रहे थे कि वह बुरा आदमी बनने में कितना अच्छा है। यह पेपर कहता है, "आइए परीक्षण करें कि क्या यह वास्तव में दिन बचा सकता है।"

इस यथार्थवादी, अस्त-व्यस्त, पांच-भागों वाले परीक्षण को बनाकर, लेखक इस उम्मीद में हैं कि वे कंपनियों को यह जानने में मदद कर सकें कि कौन से AI सिस्टम सुरक्षा गार्ड के रूप में काम करने के लिए तैयार हैं और कौन से केवल अधिक परेशानी पैदा करने वाले हैं। यह "क्या आप हैक कर सकते हैं?" से "क्या आप रक्षा कर सकते हैं?" की ओर बढ़ने के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →