SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?
यह शोध पत्र SEC-bench Pro को प्रस्तुत करता है, जो V8 और SpiderMonkey में 183 वास्तविक दुनिया की कमजोरियों वाला एक कठोर बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान भाषा मॉडल-आधारित कोडिंग एजेंट लंबी अवधि के सॉफ्टवेयर सुरक्षा कार्यों (long-horizon software security tasks) में संघर्ष करते हैं, और फ्रंटियर मॉडल्स के साथ भी अधिकतम 38.8% की सफलता दर प्राप्त करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक टीम को सुपर-स्मार्ट, एआई-संचालित जासूसों (detectives) को काम पर रख रहे हैं ताकि वे एक विशाल, जटिल वीडियो गेम इंजन में छिपे हुए जाल (traps) ढूंढ सकें। ये इंजन (जिन्हें जावास्क्रिप्ट इंजन कहा जाता है) उस कोड को चलाते हैं जो वेबसाइटों और ऐप्स को काम करने के लायक बनाता है। यदि कोई जासूस एक जाल खोज लेता है, तो उसे यह ठीक से दिखाना होगा कि उस जाल को कैसे सक्रिय किया जाए (एक "प्रूफ ऑफ कॉन्सेप्ट" या PoC) ताकि गेम डेवलपर्स उसे ठीक कर सकें।
यह पेपर पेश करता है कि कैसे एक नया, बहुत सख्त टेस्ट SEC-bench Pro यह देखने के लिए बनाया गया है कि वास्तविक दुनिया में ये एआई जासूस वास्तव में कितने अच्छे हैं।
पुराने टेस्ट के साथ समस्या
पिछले टेस्ट ऐसे थे जैसे किसी जासूस को पहले से ही चिह्नित किया हुआ खजाना का नक्शा दे दिया गया हो जिसमें "X" का निशान लगा हो। वे शायद कहते, "लाइन 500 पर जाओ और इस बटन को दबाओ जिससे गेम टूट जाएगा।"
- समस्या: असली बग हंटिंग (bug hunting) इस तरह से काम नहीं करती। असली जासूसों को पूरे कोड को देखना होता है, यह समझना होता है कि जाल कहाँ हो सकता है, और फिर बिना यह जाने कि वह ठीक कहाँ है, उसे सक्रिय करने की कोशिश करनी होती है। पुराने टेस्ट इस वास्तविक कौशल को नहीं मापते थे; वे केवल यह मापते थे कि क्या एआई एक नक्शे का पालन कर सकता है।
नया टेस्ट: SEC-bench Pro
लेखकों ने दो प्रसिद्ध गेम इंजनों का उपयोग करके एक नया, कठिन टेस्ट बनाया है: V8 (गूगल क्रोम द्वारा उपयोग किया जाता है) और SpiderMonkey (फायरफॉक्स द्वारा उपयोग किया जाता है)।
- सेटअप: उन्होंने 183 वास्तविक, पुष्ट जाल (traps) लिए जिन्हें इंसानों ने पहले खोजा था।
- वातावरण: उन्होंने सॉफ्टवेयर का बिल्कुल वही "टाइम मशीन" संस्करण बनाया जहाँ वह जाल मौजूद था, साथ ही वह संस्करण भी जहाँ उसे ठीक कर दिया गया था।
- नियम: एआई एजेंटों को कच्चा कोड (raw code) और एक अस्पष्ट विवरण दिया गया। उन्हें निम्नलिखित कार्य करने थे:
- जाल तक पहुँचने वाले विशिष्ट कोड पाथ (code path) का पता लगाना।
- क्रैश को ट्रिगर करने के लिए एक स्क्रिप्ट (PoC) लिखना।
- यह साबित करना कि वह स्क्रिप्ट केवल पुराने संस्करण को तोड़ती है और नए संस्करण में ठीक हो चुकी है।
"थ्री-इमेज" जज (Three-Image Judge)
यह उनके नए टेस्ट का सबसे महत्वपूर्ण हिस्सा है। अतीत में, यदि कोई एआई किसी भी प्रकार का क्रैश पैदा करता था, तो उसे एक अंक मिल जाता था। लेकिन एक एआई गलती से किसी ऐसी चीज़ को भी तोड़ सकता था जो उस विशिष्ट जाल का हिस्सा नहीं थी जिसे वे ढूंढ रहे थे।
SEC-bench Pro एक थ्री-इमेज जज (एक परिष्कृत एआई रेफरी) का उपयोग करता है:
- इमेज 1 (द ट्रैप): क्या स्क्रिप्ट पुराने संस्करण को तोड़ती है?
- इमेज 2 (द फिक्स): क्या स्क्रिप्ट नए संस्करण (जहाँ पैच लागू किया गया है) में रुक जाती है (नहीं तोड़ती)?
- इमेज 3 (द लेटेस्ट): क्या स्क्रिप्ट नवीनतम संस्करण को तोड़ती है (जहाँ अन्य सुधार भी हुए हो सकते हैं)?
यदि एआई पुराने संस्करण में क्रैश पैदा करता है लेकिन वह ठीक किए गए संस्करण को भी क्रैश कर देता है, तो जज कहता है, "आपने विशिष्ट जाल नहीं खोजा; आपने बस सामान्य रूप से गेम को तोड़ दिया।" यह एआई को भाग्यशाली, असंबंधित गलतियों के लिए अंक प्राप्त करने से रोकता है।
परिणाम: एआई जासूस संघर्ष करते हैं
पेपर ने तीन शीर्ष-स्तरीय एआई "जासूसों" (जो GPT-5.4, Opus 4.6, और Kimi-K2.6 जैसे मॉडल्स द्वारा संचालित हैं) का परीक्षण किया। यहाँ क्या हुआ:
- स्कोरकार्ड: सबसे स्मार्ट एआई भी केवल 32% से 39% जाल ही हल कर सका। इसका मतलब है कि वे 60% से अधिक मामलों में विफल रहे।
- "ओपन-वेट" नौसिखिया: एक सस्ता, ओपन-सोर्स एआई (Kimi-K2.6) ने V8 के केवल 11.7% जाल ही हल किए।
- टीमवर्क प्रभाव: दिलचस्प बात यह है कि एआई जासूसों ने अलग-अलग जाल खोजे। जब आपने दो सर्वश्रेष्ठ एआई के परिणामों को मिलाया, तो उन्होंने मिलकर लगभग 48% SpiderMonkey के जाल हल किए, लेकिन उनमें से कोई भी अकेले ऐसा नहीं कर सका। वे दो अलग-अलग विशेषज्ञों वाले जासूसों की तरह हैं; एक एक प्रकार के सुराग खोजने में अच्छा है, दूसरा दूसरे प्रकार के।
वे क्यों विफल हुए?
पेपर ने पाया कि एआई के संघर्ष करने के दो मुख्य कारण थे:
- बहुत अधिक अनुमान लगाना (द "स्प्रे एंड स्प्रे" अप्रोच): एक एआई (Claude) ने हजारों स्क्रिप्ट बनाने की कोशिश की। उनमें से अधिकांश वास्तव में कुछ भी नहीं तोड़ते थे, या वे गलत चीज़ को तोड़ देते थे। यह बोर्ड पर लाखों डार्ट फेंकने और उम्मीद करने जैसा था कि एक भी निशाने पर लग जाए।
- बहुत अधिक सावधानी (द "ओवर-थिंकर" अप्रोच): दूसरा एआई (Codex) बहुत सावधान था। यह कोड का विश्लेषण करता, निर्णय लेता कि जाल वहाँ हो सकता है, लेकिन यदि यह 100% साबित नहीं कर पाता कि वह सही है, तो यह हार मान लेता और कह देता "मैं यह नहीं कर सकता।" इसने कई जाल मिस कर दिए क्योंकि यह गलत होने से बहुत डरता था।
मुख्य निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि हालांकि एआई कोड लिखने में बेहतर हो रहा है, लेकिन यह जटिल, वास्तविक दुनिया के सॉफ्टवेयर में सुरक्षा संबंधी बग्स (security bugs) खोजने की लंबी, कठिन प्रक्रिया में अभी भी बहुत अच्छा नहीं है।
वर्तमान सर्वश्रेष्ठ एआई कुछ जाल ढूंढ सकता है, लेकिन वह अधिकांश को मिस कर देता है। नया बेंचमार्क (SEC-bench Pro) साबित करता है कि हमें इन एआई की मदद करने के लिए बेहतर टूल्स की आवश्यकता है ताकि वे कोड और छिपे हुए जाल के बीच के संबंधों को जोड़ सकें, बजाय इसके कि केवल भाग्य के भरोसे रहें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।