← नवीनतम पेपर
🤖 AI

The Next Challenge for Agentic Cybersecurity: A Realistic, Contamination-Free Reverse Engineering Benchmark

यह शोध पत्र SRE-Bench प्रस्तुत करता है, जो बाइनरी कोड पर एजेंटिक रिवर्स इंजीनियरिंग क्षमताओं के मूल्यांकन के लिए पहला यथार्थवादी और संदूषण-मुक्त (contamination-free) बेंचमार्क है, जो यह प्रकट करता है कि अनदेखे, संरक्षित बाइनरी के विश्लेषण की अनूठी चुनौतियों के कारण सबसे शक्तिशाली फ्रंटियर LLMs भी मानव-स्तर के प्रदर्शन के साथ तालमेल बिठाने में संघर्ष करते हैं।

मूल लेखक: Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang

प्रकाशित 2026-08-13
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jeremy Spence, Nicholas Assaderaghi, Jinhao Zhu, Nikil Ravi, Raluca Ada Popa, Guannan Wei, Yangruibo Ding, Zhuo Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं। आमतौर पर, जब आप किसी अपराध की जांच करते हैं, तो आपको संदिग्ध की डायरी, उनके हाथ से लिखे नोट्स और उनके ईमेल पढ़ने को मिलते हैं। यह सोर्स कोड (source code) को देखने जैसा है: मूल, मानव-पठनीय निर्देश जो कंप्यूटर को बताते हैं कि क्या करना है। लेकिन साइबर सुरक्षा की वास्तविक दुनिया में, अपराधी अपनी डायरियाँ खुले में नहीं छोड़ते। वे आपको एक बंद, सीलबंद बॉक्स थमा देते हैं जिस पर बाहर कोई निर्देश नहीं होता। यह एक बाइनरी (binary) है: कच्चे कंप्यूटर बाइट्स से बनी एक फ़ाइल जो मनुष्यों के लिए निरर्थक (gibberish) दिखती है। यह समझने के लिए कि इसके अंदर क्या है, आपको रिवर्स इंजीनियरिंग (reverse engineering) करनी पड़ती है—यानी उस बॉक्स को टुकड़ा-टुकड़ा करके खोलना, ताकि आप अंदाज़ा लगा सकें कि ताला कैसे काम करता है और उसके अंदर की सामग्री क्या है।

अब, कल्पना कीजिए कि हमने सुपर-स्मार्ट एआई जासूस (जिन्हें एआई एजेंट (AI agents) कहा जाता है) बनाए हैं जो उन डायरियों को पढ़ने में माहिर हैं। वे टेक्स्ट में झूठ पकड़ सकते हैं और सुराग ढूंढ सकते हैं, जो इंसानों से कहीं अधिक तेज़ी से करते हैं। लेकिन क्या ये एआई जासूस उन बंद बक्सों को तोड़ सकते हैं? यही बड़ा सवाल है। यदि एआई केवल डायरी पढ़ सकता है लेकिन बॉक्स नहीं खोल सकता, तो वह सच्चा साइबर सुरक्षा नायक नहीं है। हमें यह जानने की आवश्यकता है कि क्या ये डिजिटल जासूस वास्तव में रिवर्स इंजीनियरिंग का कठिन काम कर सकते हैं, या वे केवल अपने प्रशिक्षण में देखे गए डेटा के पैटर्न पर निर्भर हैं।

यह शोध पत्र एक बिल्कुल नया, अत्यंत कठिन परीक्षण पेश करता है जिसे SRE-Bench कहा जाता है, ताकि यह पता लगाया जा सके। शोधकर्ताओं ने शुरुआत से ही 19 पूरी तरह से नए, गुप्त प्रोग्राम बनाए—जैसे कि 19 अनूठे, जटिल वीडियो गेम और सुरक्षा प्रणालियाँ तैयार करना जिन्हें एआई ने पहले कभी नहीं देखा है। फिर उन्होंने इन प्रोग्रामों को 44 अलग-अलग प्रकार के हाई-टेक सुरक्षा गार्डों (ओबफस्केशन तकनीकों/obfuscation techniques) के साथ लॉक कर दिया ताकि उन्हें तोड़ना अविश्वसनीय रूप से कठिन हो जाए। उन्होंने दुनिया के पांच सबसे स्मार्ट एआई मॉडलों का इन बंद बक्सों के खिलाफ परीक्षण किया, जिसमें 2026 के मूल्यांकन से भविष्य के संस्करण जैसे GPT-5.6-sol और Claude-Opus-5 भी शामिल थे।

परिणाम एक चेतावनी की तरह थे। इस अध्ययन में सबसे मजबूत एआई, GPT-5.6-sol भी, केवल लगभग 31.5% मामलों को पूरी तरह से हल करने में सफल रहा (262 उदाहरणों में से 80 पर पूर्ण स्कोर प्राप्त किया)। अन्य एआई इससे भी बदतर प्रदर्शन कर रहे थे, जिनमें से कुछ एक भी मामला हल करने में विफल रहे। अध्ययन में पाया गया कि ये एआई एजेंट मानव विशेषज्ञों की तुलना में बहुत अलग व्यवहार करते हैं। जबकि मनुष्य कोड ऑप्टिमाइज़ेशन (जो कोड को कुशल लेकिन अव्यवस्थित बनाता है) जैसी चीजों के साथ संघर्ष करते हैं, एआई ने उन बाधाओं पर शायद ही ध्यान दिया। इसके बजाय, एआई कोड में नामों और लेबल को देखने पर बहुत अधिक निर्भर थे; जब शोधकर्ताओं ने उन नामों को हटा दिया, तो एआई का प्रदर्शन गिर गया। सबसे महत्वपूर्ण बात यह है कि यह अध्ययन साबित करता है कि सोर्स कोड पढ़ने में अच्छा होने का मतलब यह नहीं है कि एआई बाइनरी को तोड़ने में भी अच्छा है। "बंद बॉक्स" एक बड़ी, अनसुलझी चुनौती बना हुआ है, और SRE-Bench यह मापने के लिए पहला वास्तविक, निष्पक्ष परीक्षण है कि हम इसे हल करने से वास्तव में कितनी दूर हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →