← नवीनतम पेपर
🤖 AI

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)

यह शोध पत्र Trident को प्रस्तुत करता है, जो एक एजेंटिक LLM रेड टीमिंग फ्रेमवर्क है जो अनुकूलन योग्य हमले की रणनीतियों को उत्पन्न करने के लिए "कोड-एज़-पॉलिसी" RLVR आर्किटेक्चर का लाभ उठाता है, जिससे यह प्रकट होता है कि मौजूदा डीप रिइन्फोर्समेंट लर्निंग साइबर रक्षाएं मौलिक रूप से भंगुर हैं और स्थिर ह्यूरिस्टिक बेसलाइन की तुलना में गतिशील खतरों द्वारा आसानी से पछाड़ दी जाती हैं।

मूल लेखक: Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi, Sanggeon Yun, Hyunwoo Oh, SungHeon Jeong, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

प्रकाशित 2026-08-06
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi, Sanggeon Yun, Hyunwoo Oh, SungHeon Jeong, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डिजिटल शतरंज के एक उच्च-दांव वाले खेल की कल्पना करें, लेकिन इसमें बोर्ड पर मोहरे चलाने के बजाय, दो टीमें कंप्यूटरों के एक विशाल, अदृश्य नेटवर्क पर नियंत्रण पाने के लिए लड़ रही हैं। एक टीम, "ब्लू टीम," एक ऐसा AI डिफेंडर बनाती है जो घुसपैठियों को पहचानने और खराब कंप्यूटरों को वास्तविक समय में ठीक करने के लिए सीखता है। दूसरी टीम, "रेड टीम," घुसपैठ करने की कोशिश करती है। वर्षों से, वैज्ञानिकों ने इन ब्लू टीम डिफेंडर्स का परीक्षण रेड टीम हमलावरों के खिलाफ किया है जो एक सख्त, अपरिवर्तित स्क्रिप्ट का पालन करने वाले रोबोट की तरह हैं। वे बार-बार एक ही चाल चलते हैं, जैसे कि कोई घड़ी जैसा खिलौना हो। समस्या यह है कि असली हैकर्स घड़ी जैसे खिलौने नहीं होते; वे चतुर, अनुकूलनशील होते हैं और जैसे ही वे किसी बचाव को देखते हैं, वे अपनी रणनीति बदल देते हैं। इस बीच, एक नए प्रकार के सुपर-स्मार्ट AI, जिसे लार्ज लैंग्वेज मॉडल (LLM) के रूप में जाना जाता है, ने पहेलियाँ सुलझाने और कोड लिखने में अविश्वसनीय महारत हासिल कर ली है। बड़ा सवाल जो वैज्ञानिक पूछ रहे हैं वह यह है: यदि हम इन सुपर-स्मार्ट AI को रेड टीम बनना सिखाते हैं, तो क्या वे अंततः ब्लू टीम के बचाव को उस तरह से मात दे पाएंगे जैसे पुराने, स्थिर रोबोट कभी नहीं दे सके?

यह बिल्कुल वही है जो ट्राइडेंट (Trident) नामक प्रोजेक्ट के पीछे के शोधकर्ताओं ने खोजने का प्रयास किया। उन्होंने एक नया, गतिशील परीक्षण मैदान बनाया जहाँ एक स्मार्ट AI हमलावर केवल एक पूर्व-लिखित स्क्रिप्ट का पालन करने के बजाय, करके सीखने (learn by doing) की क्षमता रखता था। उन्होंने हमलावरों और डिफेंडर्स के बीच 13,000 से अधिक सिम्युलेटेड युद्धों का एक विशाल पुस्तकालय बनाया ताकि उनके AI को प्रशिक्षित किया जा सके। AI को एक बार में एक चाल चुनने के बजाय, उन्होंने इसे कंप्यूटर कोड के रूप में अपनी खुद की "हमला रणनीति" लिखने के लिए प्रशिक्षित किया, जिसे वह फिर डिफेंडर के विरुद्ध चलाता है।

परिणाम चौंकाने वाले थे। ट्राइडेंट AI, जिसे केवल एक 7-बिलियन-पैरामीटर वाले मॉडल (आधुनिक AI के आकार के हिसाब से अपेक्षाकृत छोटा) पर प्रशिक्षित किया गया था, उसने न केवल डिफेंडर्स को हराया; बल्कि उनकी प्रभावशीलता में भारी गिरावट भी ला दी। जबकि पुराने, स्थिर हमलावर मुश्किल से कोई असर डाल पाते थे, ट्राइडेंट ने बेसलाइन की तुलना में ब्लू टीम के रक्षात्मक प्रदर्शन को औसतन 522% कम कर दिया। यह सुझाव देता है कि आज के कई "स्मार्ट" साइबर बचाव वास्तव में हमारी सोच से कहीं अधिक नाजुक हैं, क्योंकि उनका परीक्षण केवल मूर्ख, अनुमान लगाने योग्य दुश्मनों के खिलाफ किया गया था। ट्राइडेंट ने केवल नियमों का पालन नहीं किया; इसने अपने आप में चतुराई भरी नई तरकीबें खोजीं, जैसे कि यह पहचानना कि कब एक डिफेंडर उसे एक नकली लक्ष्य (एक "डेकॉय") के साथ धोखा देने की कोशिश कर रहा है और उसे अनदेखा करना सीखना, या यह पता लगाना कि सबसे पहले किन कंप्यूटरों को हैक करना सबसे अधिक मूल्यवान है। पेपर यह सुझाव देता है कि वास्तव में सुरक्षित सिस्टम बनाने के लिए, हमें उनका परीक्षण स्थिर रोबोटों के खिलाफ करना बंद करना होगा और ट्राइडेंट जैसे अनुकूलनशील, सीखने वाले AI के खिलाफ परीक्षण करना शुरू करना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →