The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark
यह शोध पत्र SRE-Bench प्रस्तुत करता है, जो बाइनरी कोड पर एजेंटिक रिवर्स इंजीनियरिंग क्षमताओं के मूल्यांकन के लिए पहला यथार्थवादी और संदूषण-मुक्त (contamination-free) बेंचमार्क है, जो यह प्रकट करता है कि अनदेखे, संरक्षित बाइनरी के विश्लेषण की अनूठी चुनौतियों के कारण सबसे शक्तिशाली फ्रंटियर LLMs भी मानव-स्तर के प्रदर्शन के साथ तालमेल बिठाने में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं। आमतौर पर, जब आप किसी अपराध की जांच करते हैं, तो आपको संदिग्ध की डायरी, उनके हाथ से लिखे नोट्स और उनके ईमेल पढ़ने को मिलते हैं। यह सोर्स कोड (source code) को देखने जैसा है: मूल, मानव-पठनीय निर्देश जो कंप्यूटर को बताते हैं कि क्या करना है। लेकिन साइबर सुरक्षा की वास्तविक दुनिया में, अपराधी अपनी डायरियाँ खुले में नहीं छोड़ते। वे आपको एक बंद, सीलबंद बॉक्स थमा देते हैं जिस पर बाहर कोई निर्देश नहीं होता। यह एक बाइनरी (binary) है: कच्चे कंप्यूटर बाइट्स से बनी एक फ़ाइल जो मनुष्यों के लिए निरर्थक (gibberish) दिखती है। यह समझने के लिए कि इसके अंदर क्या है, आपको रिवर्स इंजीनियरिंग (reverse engineering) करनी पड़ती है—यानी उस बॉक्स को टुकड़ा-टुकड़ा करके खोलना, ताकि आप अंदाज़ा लगा सकें कि ताला कैसे काम करता है और उसके अंदर की सामग्री क्या है।
अब, कल्पना कीजिए कि हमने सुपर-स्मार्ट एआई जासूस (जिन्हें एआई एजेंट (AI agents) कहा जाता है) बनाए हैं जो उन डायरियों को पढ़ने में माहिर हैं। वे टेक्स्ट में झूठ पकड़ सकते हैं और सुराग ढूंढ सकते हैं, जो इंसानों से कहीं अधिक तेज़ी से करते हैं। लेकिन क्या ये एआई जासूस उन बंद बक्सों को तोड़ सकते हैं? यही बड़ा सवाल है। यदि एआई केवल डायरी पढ़ सकता है लेकिन बॉक्स नहीं खोल सकता, तो वह सच्चा साइबर सुरक्षा नायक नहीं है। हमें यह जानने की आवश्यकता है कि क्या ये डिजिटल जासूस वास्तव में रिवर्स इंजीनियरिंग का कठिन काम कर सकते हैं, या वे केवल अपने प्रशिक्षण में देखे गए डेटा के पैटर्न पर निर्भर हैं।
यह शोध पत्र एक बिल्कुल नया, अत्यंत कठिन परीक्षण पेश करता है जिसे SRE-Bench कहा जाता है, ताकि यह पता लगाया जा सके। शोधकर्ताओं ने शुरुआत से ही 19 पूरी तरह से नए, गुप्त प्रोग्राम बनाए—जैसे कि 19 अनूठे, जटिल वीडियो गेम और सुरक्षा प्रणालियाँ तैयार करना जिन्हें एआई ने पहले कभी नहीं देखा है। फिर उन्होंने इन प्रोग्रामों को 44 अलग-अलग प्रकार के हाई-टेक सुरक्षा गार्डों (ओबफस्केशन तकनीकों/obfuscation techniques) के साथ लॉक कर दिया ताकि उन्हें तोड़ना अविश्वसनीय रूप से कठिन हो जाए। उन्होंने दुनिया के पांच सबसे स्मार्ट एआई मॉडलों का इन बंद बक्सों के खिलाफ परीक्षण किया, जिसमें 2026 के मूल्यांकन से भविष्य के संस्करण जैसे GPT-5.6-sol और Claude-Opus-5 भी शामिल थे।
परिणाम एक चेतावनी की तरह थे। इस अध्ययन में सबसे मजबूत एआई, GPT-5.6-sol भी, केवल लगभग 31.5% मामलों को पूरी तरह से हल करने में सफल रहा (262 उदाहरणों में से 80 पर पूर्ण स्कोर प्राप्त किया)। अन्य एआई इससे भी बदतर प्रदर्शन कर रहे थे, जिनमें से कुछ एक भी मामला हल करने में विफल रहे। अध्ययन में पाया गया कि ये एआई एजेंट मानव विशेषज्ञों की तुलना में बहुत अलग व्यवहार करते हैं। जबकि मनुष्य कोड ऑप्टिमाइज़ेशन (जो कोड को कुशल लेकिन अव्यवस्थित बनाता है) जैसी चीजों के साथ संघर्ष करते हैं, एआई ने उन बाधाओं पर शायद ही ध्यान दिया। इसके बजाय, एआई कोड में नामों और लेबल को देखने पर बहुत अधिक निर्भर थे; जब शोधकर्ताओं ने उन नामों को हटा दिया, तो एआई का प्रदर्शन गिर गया। सबसे महत्वपूर्ण बात यह है कि यह अध्ययन साबित करता है कि सोर्स कोड पढ़ने में अच्छा होने का मतलब यह नहीं है कि एआई बाइनरी को तोड़ने में भी अच्छा है। "बंद बॉक्स" एक बड़ी, अनसुलझी चुनौती बना हुआ है, और SRE-Bench यह मापने के लिए पहला वास्तविक, निष्पक्ष परीक्षण है कि हम इसे हल करने से वास्तव में कितनी दूर हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।