ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation
यह शोध पत्र ExCyTIn-Bench प्रस्तुत करता है, जो माइक्रोसॉफ्ट सेंटिनलल (Microsoft Sentinel) लॉग्स और इन्वेस्टिगेशन ग्राफ से 7,542 प्रश्न उत्पन्न करके साइबर खतरे की जांच पर LLM एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान शीर्ष मॉडल केवल 0.606 रिवॉर्ड स्कोर प्राप्त करते हैं और भविष्य में सुधार की महत्वपूर्ण गुंजाइश को उजागर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ ExCyTIn-Bench पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।
बड़ी तस्वीर: AI जासूसों के लिए एक नया "ड्राइविंग टेस्ट"
कल्पना कीजिए कि आपके पास बहुत ही स्मार्ट, नए AI रोबोटों का एक बेड़ा (fleet) है। आप जानना चाहते हैं कि क्या वे साइबर सुरक्षा जासूस (cybersecurity detectives) बनने के लायक हैं। क्या वे बिखरे हुए डेटा के पहाड़ में से बुरे लोगों को ढूंढ सकते हैं, और यह पता लगा सकते हैं कि हैकिंग के दौरान वास्तव में क्या हुआ था?
इस पेपर के लेखक कहते हैं, "हम उनसे केवल सामान्य सवाल नहीं पूछ सकते जैसे 'वायरस क्या है?' क्योंकि यह केवल उनकी याददाश्त का परीक्षण करता है। हमें यह देखना होगा कि क्या वे वास्तव में काम कर सकते हैं।"
इसलिए, उन्होंने ExCyTIn-Bench बनाया है। इसे AI एजेंटों के लिए एक उच्च-दांव वाले ड्राइविंग टेस्ट (high-stakes driving test) के रूप में समझें। कार के बजाय, AI एक डिजिटल अपराध स्थल (crime scene) के माध्यम से गाड़ी चला रहा है। टेस्ट ट्रैक के बजाय, यह एक सिम्युलेटेड कंपनी का कंप्यूटर नेटवर्क है जो नकली (लेकिन वास्तविक) सुरक्षा लॉग्स से भरा हुआ है।
उन्होंने टेस्ट कैसे बनाया (द "क्राइम सीन")
टेस्ट को निष्पक्ष और वास्तविक बनाने के लिए, शोधकर्ताओं ने केवल रैंडम सवाल नहीं बनाए। उन्होंने तीन चरणों में टेस्ट बनाया:
- अपराध स्थल (डेटा): उन्होंने "Alpine Ski House" नामक एक नकली Microsoft Azure कंपनी बनाई। उन्होंने 8 अलग-अलग साइबर हमलों का अनुकरण किया जो वास्तव में वास्तविक दुनिया में हुए थे (जैसे रैनसमवेयर या ईमेल स्कैम)। उन्होंने 57 अलग-अलग टेबल के लॉग्स एकत्र किए (जैसे पुलिस रिपोर्ट, फोन रिकॉर्ड और सुरक्षा कैमरा फुटेज) जिनमें हजारों प्रविष्टियाँ (entries) थीं।
- नक्शा (ग्राफ): जब एक मानव जासूस जांच करता है, तो वह सब कुछ एक साथ नहीं देखता। वह एक सुराग का पीछा करता है: अलर्ट A ले जाता है यूजर B की ओर, जो ले जाता है संदिग्ध फ़ाइल C की ओर। शोधकर्ताओं ने इन रास्तों को एक नक्शे (ग्राफ) में बदल दिया।
- नोड्स (Nodes): नक्शे में डॉट्स हैं जो "अलर्ट्स" (पुलिस के सायरन) और "एंटिटीज" (शामिल लोग या कंप्यूटर) का प्रतिनिधित्व करते हैं।
- एजेस (Edges): उन्हें जोड़ने वाली रेखाएं दिखाती हैं कि वे एक-दूसरे से कैसे संबंधित हैं।
- सवाल (परीक्षा): इंसानों द्वारा सवाल लिखने के बजाय, उन्होंने इस नक्शे को देखने और 7,542 सवाल तैयार करने के लिए एक AI का उपयोग किया।
- उदाहरण: "हमने IP एड्रेस X से एक संदिग्ध लॉगिन देखा। नक्शे के आधार पर, हैकर ने पासवर्ड चुराने के लिए किस फ़ाइल का उपयोग किया?"
- AI एजेंट को नक्शे की रेखाओं के साथ "ड्राइव" करके, डेटाबेस को क्वेरी करके और कड़ियों को जोड़कर उत्तर खोजना होगा।
AI टेस्ट कैसे देता है
AI एजेंट को एक MySQL डेटाबेस वातावरण (एक विशाल फाइलिंग कैबिनेट) में रखा जाता है। उसे नहीं पता कि कैबिनेट का लेआउट क्या है। उसे करना होगा:
- नक्शे के बारे में पूछना: "आपके पास कौन सी टेबल्स हैं?"
- सुराग पढ़ना: "मुझे इस IP एड्रेस के लॉग्स दिखाओ।"
- कड़ियों को जोड़ना: "ठीक है, वह IP एड्रेस इस यूजर से जुड़ा है। मुझे देखना चाहिए कि उस यूजर ने क्या किया।"
- उत्तर जमा करना: "हैकर ने
ntdsutil.exeफ़ाइल का उपयोग किया।"
यदि AI सही उत्तर देता है, तो उसे एक अंक मिलता है। यदि वह अटक जाता है या गलत सवाल पूछता है, तो उसे कम स्कोर मिलता है। यह टेस्ट आंशिक क्रेडिट (partial credit) भी देता है यदि AI कुछ सुराग ढूंढ लेता है लेकिन अंतिम उत्तर नहीं, ठीक वैसे ही जैसे कोई शिक्षक काम दिखाने के लिए अंक देता है।
उन्होंने क्या पाया (परिणाम)
शोधकर्ताओं ने कई अलग-अलग AI मॉडल (OpenAI, Google और Anthropic जैसी बड़ी कंपनियों के साथ-साथ ओपन-सोर्स मॉडल) का इस टेस्ट पर परीक्षण किया।
- यह कठिन है: यहाँ तक कि सबसे स्मार्ट AI मॉडल भी संघर्ष करते देखे गए। सबसे अच्छा मॉडल (Claude-Opus-4.5) केवल 0.606 (1.0 में से) का स्कोर प्राप्त कर सका। इसका मतलब है कि अभी भी सुधार की बहुत गुंजाइश है।
- "अहा!" क्षण (The "Aha!" Moment): वे AI मॉडल जो सबसे अच्छा प्रदर्शन करते थे, वे थे जो चरण-दर-चरण तर्क (reason step-by-step) कर सकते थे। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने डेटाबेस की खोज की, महसूस किया कि उनका पहला अनुमान गलत था, और एक नया रास्ता आज़माया, बिल्कुल एक मानव जासूस की तरह।
- ओपन सोर्स बनाम बिग टेक: आश्चर्यजनक रूप से, कुछ छोटे, ओपन-सोर्स मॉडल लगभग बड़े और महंगे मॉडलों के समान ही प्रदर्शन करते हैं, जो दिखाता है कि अंतर कम हो रहा है।
यह क्यों महत्वपूर्ण है
पेपर का दावा है कि यह अपने प्रकार का पहला बेंचमार्क है। इससे पहले, हम मुख्य रूप से AI का परीक्षण इस आधार पर करते थे कि वे साइबर सुरक्षा तथ्यों को कितनी अच्छी तरह याद रखते हैं। अब, हमारे पास यह परीक्षण करने का एक तरीका है कि क्या AI एजेंट वास्तव में सबूतों को छानकर और घटनाओं की एक जटिल श्रृंखला के माध्यम से तर्क करके किसी अपराध की जांच कर सकते हैं।
संक्षेप में: लेखकों ने एक वास्तविक "अपराध स्थल" और "जासूसी पहेलियों" का एक सेट बनाया है ताकि यह देखा जा सके कि क्या AI एजेंट साइबर सुरक्षा जांचकर्ता बनने के लिए सीख सकते हैं। परिणाम बताते हैं कि हालांकि AI बेहतर हो रहा है, लेकिन मानव सुरक्षा विश्लेषकों की जगह लेने से पहले उसे अभी लंबा रास्ता तय करना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।