← नवीनतम पेपर
💬 NLP

ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation

यह शोध पत्र ExCyTIn-Bench प्रस्तुत करता है, जो माइक्रोसॉफ्ट सेंटिनलल (Microsoft Sentinel) लॉग्स और इन्वेस्टिगेशन ग्राफ से 7,542 प्रश्न उत्पन्न करके साइबर खतरे की जांच पर LLM एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान शीर्ष मॉडल केवल 0.606 रिवॉर्ड स्कोर प्राप्त करते हैं और भविष्य में सुधार की महत्वपूर्ण गुंजाइश को उजागर करता है।

मूल लेखक: Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

प्रकाशित 2026-05-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ExCyTIn-Bench पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी तस्वीर: AI जासूसों के लिए एक नया "ड्राइविंग टेस्ट"

कल्पना कीजिए कि आपके पास बहुत ही स्मार्ट, नए AI रोबोटों का एक बेड़ा (fleet) है। आप जानना चाहते हैं कि क्या वे साइबर सुरक्षा जासूस (cybersecurity detectives) बनने के लायक हैं। क्या वे बिखरे हुए डेटा के पहाड़ में से बुरे लोगों को ढूंढ सकते हैं, और यह पता लगा सकते हैं कि हैकिंग के दौरान वास्तव में क्या हुआ था?

इस पेपर के लेखक कहते हैं, "हम उनसे केवल सामान्य सवाल नहीं पूछ सकते जैसे 'वायरस क्या है?' क्योंकि यह केवल उनकी याददाश्त का परीक्षण करता है। हमें यह देखना होगा कि क्या वे वास्तव में काम कर सकते हैं।"

इसलिए, उन्होंने ExCyTIn-Bench बनाया है। इसे AI एजेंटों के लिए एक उच्च-दांव वाले ड्राइविंग टेस्ट (high-stakes driving test) के रूप में समझें। कार के बजाय, AI एक डिजिटल अपराध स्थल (crime scene) के माध्यम से गाड़ी चला रहा है। टेस्ट ट्रैक के बजाय, यह एक सिम्युलेटेड कंपनी का कंप्यूटर नेटवर्क है जो नकली (लेकिन वास्तविक) सुरक्षा लॉग्स से भरा हुआ है।

उन्होंने टेस्ट कैसे बनाया (द "क्राइम सीन")

टेस्ट को निष्पक्ष और वास्तविक बनाने के लिए, शोधकर्ताओं ने केवल रैंडम सवाल नहीं बनाए। उन्होंने तीन चरणों में टेस्ट बनाया:

  1. अपराध स्थल (डेटा): उन्होंने "Alpine Ski House" नामक एक नकली Microsoft Azure कंपनी बनाई। उन्होंने 8 अलग-अलग साइबर हमलों का अनुकरण किया जो वास्तव में वास्तविक दुनिया में हुए थे (जैसे रैनसमवेयर या ईमेल स्कैम)। उन्होंने 57 अलग-अलग टेबल के लॉग्स एकत्र किए (जैसे पुलिस रिपोर्ट, फोन रिकॉर्ड और सुरक्षा कैमरा फुटेज) जिनमें हजारों प्रविष्टियाँ (entries) थीं।
  2. नक्शा (ग्राफ): जब एक मानव जासूस जांच करता है, तो वह सब कुछ एक साथ नहीं देखता। वह एक सुराग का पीछा करता है: अलर्ट A ले जाता है यूजर B की ओर, जो ले जाता है संदिग्ध फ़ाइल C की ओर। शोधकर्ताओं ने इन रास्तों को एक नक्शे (ग्राफ) में बदल दिया।
    • नोड्स (Nodes): नक्शे में डॉट्स हैं जो "अलर्ट्स" (पुलिस के सायरन) और "एंटिटीज" (शामिल लोग या कंप्यूटर) का प्रतिनिधित्व करते हैं।
    • एजेस (Edges): उन्हें जोड़ने वाली रेखाएं दिखाती हैं कि वे एक-दूसरे से कैसे संबंधित हैं।
  3. सवाल (परीक्षा): इंसानों द्वारा सवाल लिखने के बजाय, उन्होंने इस नक्शे को देखने और 7,542 सवाल तैयार करने के लिए एक AI का उपयोग किया।
    • उदाहरण: "हमने IP एड्रेस X से एक संदिग्ध लॉगिन देखा। नक्शे के आधार पर, हैकर ने पासवर्ड चुराने के लिए किस फ़ाइल का उपयोग किया?"
    • AI एजेंट को नक्शे की रेखाओं के साथ "ड्राइव" करके, डेटाबेस को क्वेरी करके और कड़ियों को जोड़कर उत्तर खोजना होगा।

AI टेस्ट कैसे देता है

AI एजेंट को एक MySQL डेटाबेस वातावरण (एक विशाल फाइलिंग कैबिनेट) में रखा जाता है। उसे नहीं पता कि कैबिनेट का लेआउट क्या है। उसे करना होगा:

  1. नक्शे के बारे में पूछना: "आपके पास कौन सी टेबल्स हैं?"
  2. सुराग पढ़ना: "मुझे इस IP एड्रेस के लॉग्स दिखाओ।"
  3. कड़ियों को जोड़ना: "ठीक है, वह IP एड्रेस इस यूजर से जुड़ा है। मुझे देखना चाहिए कि उस यूजर ने क्या किया।"
  4. उत्तर जमा करना: "हैकर ने ntdsutil.exe फ़ाइल का उपयोग किया।"

यदि AI सही उत्तर देता है, तो उसे एक अंक मिलता है। यदि वह अटक जाता है या गलत सवाल पूछता है, तो उसे कम स्कोर मिलता है। यह टेस्ट आंशिक क्रेडिट (partial credit) भी देता है यदि AI कुछ सुराग ढूंढ लेता है लेकिन अंतिम उत्तर नहीं, ठीक वैसे ही जैसे कोई शिक्षक काम दिखाने के लिए अंक देता है।

उन्होंने क्या पाया (परिणाम)

शोधकर्ताओं ने कई अलग-अलग AI मॉडल (OpenAI, Google और Anthropic जैसी बड़ी कंपनियों के साथ-साथ ओपन-सोर्स मॉडल) का इस टेस्ट पर परीक्षण किया।

  • यह कठिन है: यहाँ तक कि सबसे स्मार्ट AI मॉडल भी संघर्ष करते देखे गए। सबसे अच्छा मॉडल (Claude-Opus-4.5) केवल 0.606 (1.0 में से) का स्कोर प्राप्त कर सका। इसका मतलब है कि अभी भी सुधार की बहुत गुंजाइश है।
  • "अहा!" क्षण (The "Aha!" Moment): वे AI मॉडल जो सबसे अच्छा प्रदर्शन करते थे, वे थे जो चरण-दर-चरण तर्क (reason step-by-step) कर सकते थे। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने डेटाबेस की खोज की, महसूस किया कि उनका पहला अनुमान गलत था, और एक नया रास्ता आज़माया, बिल्कुल एक मानव जासूस की तरह।
  • ओपन सोर्स बनाम बिग टेक: आश्चर्यजनक रूप से, कुछ छोटे, ओपन-सोर्स मॉडल लगभग बड़े और महंगे मॉडलों के समान ही प्रदर्शन करते हैं, जो दिखाता है कि अंतर कम हो रहा है।

यह क्यों महत्वपूर्ण है

पेपर का दावा है कि यह अपने प्रकार का पहला बेंचमार्क है। इससे पहले, हम मुख्य रूप से AI का परीक्षण इस आधार पर करते थे कि वे साइबर सुरक्षा तथ्यों को कितनी अच्छी तरह याद रखते हैं। अब, हमारे पास यह परीक्षण करने का एक तरीका है कि क्या AI एजेंट वास्तव में सबूतों को छानकर और घटनाओं की एक जटिल श्रृंखला के माध्यम से तर्क करके किसी अपराध की जांच कर सकते हैं।

संक्षेप में: लेखकों ने एक वास्तविक "अपराध स्थल" और "जासूसी पहेलियों" का एक सेट बनाया है ताकि यह देखा जा सके कि क्या AI एजेंट साइबर सुरक्षा जांचकर्ता बनने के लिए सीख सकते हैं। परिणाम बताते हैं कि हालांकि AI बेहतर हो रहा है, लेकिन मानव सुरक्षा विश्लेषकों की जगह लेने से पहले उसे अभी लंबा रास्ता तय करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →