← नवीनतम पेपर
💻 computer science

SWE-ABS: Adversarial Benchmark Strengthening Exposes Inflated Success Rates on Test-based Benchmark

यह शोध पत्र SWE-ABS को पेश करता है, जो एक एडवरसेरियल फ्रेमवर्क है जो कवरेज-संचालित संवर्धन (coverage-driven augmentation) और म्यूटेशन-संचालित परीक्षण के माध्यम से टेस्ट सूट्स को मजबूत करता है ताकि पहले से "हल" किए गए पैच में सिमेंटिक त्रुटियों को उजागर किया जा सके, जिससे यह पता चलता है कि SWE-Bench Verified लीडरबोर्ड पर शीर्ष प्रदर्शन करने वाले एजेंटों की सफलता दर काफी बढ़ी हुई है, जो इन उन्नत बेंचमार्क के विरुद्ध मूल्यांकन किए जाने पर 16 प्रतिशत अंकों से अधिक गिर जाती है।

मूल लेखक: Boxi Yu, Yang Cao, Yuzhong Zhang, Liting Lin, Junjielong Xu, Zhiqing Zhong, Qinghua Xu, Guancheng Wang, Jialun Cao, Shing-Chi Cheung, Pinjia He, Lionel Briand

प्रकाशित 2026-03-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Boxi Yu, Yang Cao, Yuzhong Zhang, Liting Lin, Junjielong Xu, Zhiqing Zhong, Qinghua Xu, Guancheng Wang, Jialun Cao, Shing-Chi Cheung, Pinjia He, Lionel Briand

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: "आसान टेस्ट" का जाल

कल्पना कीजिए कि आप अपने छात्रों को गणित की परीक्षा दे रहे हैं। इस परीक्षा में केवल तीन प्रश्न हैं:

  1. 2+22 + 2 क्या है?
  2. 3+33 + 3 क्या है?
  3. 4+44 + 4 क्या है?

"AI-Bot" नाम का एक छात्र इस परीक्षा में 100% अंक प्राप्त करता है। आप घोषणा करते हैं, "AI-Bot गणित का जीनियस है!"

लेकिन फिर, आप AI-Bot से पूछते हैं: "अगर हम एक अलग बेस (base) में गिनती कर रहे हों, तो 2+22 + 2 क्या होगा?" या "अगर एक संख्या बिल्ली की तस्वीर हो, तो 2+22 + 2 क्या होगा?"

AI-Bot बुरी तरह विफल हो जाता है। पता चलता है कि AI-Bot ने वास्तव में गणित नहीं सीखा था; उसने बस उन तीन विशिष्ट प्रश्नों के उत्तर रट लिए थे। टेस्ट बहुत आसान था और उसने वास्तव में यह नहीं जांचा कि छात्र को अवधारणा (concept) समझ में आई है या नहीं।

AI कोडिंग की दुनिया में ठीक यही हो रहा है।

वर्तमान में, AI कोडिंग एजेंटों के लिए एक प्रसिद्ध "परीक्षा" है जिसे SWE-Bench कहा जाता है। यह AI एजेंटों को वास्तविक सॉफ़्टवेयर में बग्स (bugs) ठीक करने के लिए कहता है। शीर्ष एजेंट लगभग 79% स्कोर कर रहे हैं, जो सुनने में अद्भुत लगता है। यह संकेत देता है कि AI मानव प्रोग्रामर्स की जगह लेने के लिए लगभग तैयार है।

पेपर की बड़ी खोज: यह स्कोर नकली है। यह बढ़ा-चढ़ाकर दिखाया गया है। ठीक उस गणित के छात्र की तरह जिसने केवल उत्तर रट लिए थे, ये AI एजेंट भी "चीटिंग" कर रहे हैं—वे विशिष्ट टेस्ट प्रश्नों के लिए सही उत्तर का अनुमान लगा लेते हैं, भले ही उनका कोड अन्य तरीकों से टूटा हुआ हो।

शोधकर्ताओं ने पाया कि 5 में से 1 "सफल" सुधार वास्तव में अर्थपूर्ण रूप से (semantically) गलत थे। वे टेस्ट में इसलिए पास हो गए क्योंकि टेस्ट इतना कमजोर था कि वह त्रुटि को पकड़ ही नहीं सका।


समाधान: SWE-ABS (द "एडवर्सरियल कोच")

इसे ठीक करने के लिए, शोधकर्ताओं ने एक नया टूल बनाया जिसे SWE-ABS कहा जाता है। SWE-ABS को एक कठोर, रचनात्मक कोच के रूप में सोचें जो केवल टेस्ट को ग्रेड नहीं करता; बल्कि वह टेस्ट को इस तरह से फिर से डिजाइन करता है कि चीटिंग करना असंभव हो जाए।

SWE-ABS दो चरणों में काम करता है, जैसे कि एक दो-चरणीय वर्कआउट रूटीन:

चरण 1: "कवरेज" वर्कआउट (अंधे धब्बे ढूंढना)

एक सुरक्षा गार्ड की कल्पना करें जो एक इमारत की जाँच कर रहा है। मूल टेस्ट केवल सामने के दरवाजे की जाँच करता है।

  • समस्या: एक चोर पीछे की खिड़की से अंदर घुस सकता है, लेकिन गार्ड वहां कभी नहीं देखता।
  • SWE-ABS क्या करता है: यह एक मानचित्र (जिसे "प्रोग्राम स्लाइसिंग" कहा जाता है) का उपयोग करता है ताकि उस इमारत के हर कमरे, गलियारे और खिड़की का पता लगाया जा सके जिसे कोड छूता है। फिर यह AI को मजबूर करता है कि वह साबित करे कि वह केवल सामने के दरवाजे को ही नहीं, बल्कि हर कमरे को संभाल सकता है।
  • परिणाम: यह उन "कवरेज गैप्स" को भर देता है जहाँ AI पहले अपने आलसी कोड के साथ बच निकल रहा था।

चरण 2: "म्यूटेशन" वर्कआउट (दुष्ट जुड़वां)

यह सबसे चतुर हिस्सा है। कल्पना कीजिए कि AI एक समाधान सबमिट करता है। SWE-ABS उस समाधान का एक "म्यूटेंट" (Mutant) संस्करण बनाता है।

  • म्यूटेंट: यह कोड का एक "ज़ोंबी" संस्करण है। यह सही कोड के लगभग समान दिखता है, लेकिन इसमें एक बहुत ही सूक्ष्म दोष होता है (जैसे कि एक टाइपो जो अर्थ बदल देता है)।
  • टेस्ट: SWE-ABS पूछता है: "क्या मूल टेस्ट इस ज़ोंबी को पकड़ पाता है?"
    • यदि टेस्ट ज़ोंबी के लिए भी "पास!" कहता है, तो टेस्ट कमजोर है।
    • इसके बाद, SWE-ABS एक नया, विशिष्ट टेस्ट बनाता है जो उस ज़ोंबी को खत्म करने के लिए डिज़ाइन किया गया है।
  • उपमा: यह एक वायरस शिकारी की तरह है। यदि कोई वायरस (खराब कोड) प्रतिरक्षा प्रणाली (टेस्ट) से छिप सकता है, तो SWE-ABS विशेष रूप से उस वायरस का शिकार करने के लिए एक नया एंटीबॉडी (एक नया टेस्ट) विकसित करता है।

चौंकाने वाले परिणाम

जब शोधकर्ताओं ने SWE-Bench परीक्षा पर SWE-ABS लागू किया, तो परिणाम नाटकीय थे:

  1. स्कोर तेजी से गिरा: शीर्ष AI एजेंट का स्कोर 78.80% से गिरकर 62.20% हो गया।
  2. लीडरबोर्ड बदल गया: नंबर #1 रैंक वाला एजेंट गिरकर #5 पर आ गया। नंबर #2 वाला एजेंट #1 पर पहुँच गया। यह पता चला कि "सबसे अच्छा" AI वास्तव में सबसे अच्छा नहीं था; वह बस कमजोर टेस्ट का फायदा उठाने में सबसे अच्छा था।
  3. "नकली" सुधार: उन्होंने पाया कि 2,184 कोड पैच जिन्हें पहले "ठीक किया गया" (Fixed) के रूप में चिह्नित किया गया था, वास्तव में टूटे हुए थे। वे एक ऐसी कार की तरह थे जो बाहर से चमकदार दिखती है लेकिन जिसमें इंजन ही नहीं है।

विपरीत निष्कर्ष (Counter-Intuitive Discovery)

शोधकर्ताओं ने एक और आश्चर्यजनक बात भी पाई: कठिन टेस्ट का मतलब हमेशा बेहतर टेस्ट नहीं होता।

उन्होंने इसे परीक्षा के एक "कठिन" संस्करण (SWE-Bench Pro) पर आजमाया, जहाँ कोडिंग कार्य बहुत अधिक कठिन थे। आप सोच सकते हैं कि AI वहां अधिक विफल होगा, और टेस्ट बेहतर होंगे।

  • वास्तविकता: AI कठिन कार्यों पर अधिक विफल हुआ, लेकिन टेस्ट अभी भी उतने ही कमजोर थे जितने कि आसान वाले।
  • सबक: केवल इसलिए कि कोई कार्य कठिन है, इसका मतलब यह नहीं है कि सुरक्षा जाल (टेस्ट) मजबूत है। आपके पास एक बहुत ही कठिन पहेली हो सकती है जिसके साथ एक बहुत ही कमजोर सुरक्षा जाल भी हो।

यह क्यों मायने रखता है?

यदि हम इन कमजोर टेस्ट का उपयोग करना जारी रखते हैं, तो हम सुरक्षा का एक झूठा अहसास बना रहे हैं।

  • कंपनियों के लिए: यदि आप इन स्कोर के आधार पर अपने बैंकिंग सॉफ़्टवेयर को ठीक करने के लिए AI को काम पर रखते हैं, तो यह टेस्ट पास कर सकता है लेकिन आपके सुरक्षा तंत्र में एक ऐसा छेद छोड़ सकता है जिससे हैकर्स अंदर आ सकें।
  • शोधकर्ताओं के लिए: हमें AI को "टेस्ट पास करने" के लिए प्रशंसा करना बंद करना चाहिए और उसे "मजबूत टेस्ट पास करने" के लिए प्रशंसा करना शुरू करना चाहिए।

एक वाक्य में सारांश

SWE-ABS एक ऐसे टूल के रूप में कार्य करता है जो AI कोडिंग परीक्षाओं के लिए "तनाव-परीक्षण" (stress-test) करता है, जिससे यह उजागर होता है कि कई AI एजेंट वास्तव में वास्तविक दुनिया में विफल हो रहे हैं क्योंकि वे जिन टेस्ट दे रहे हैं वे बहुत आसान हैं और खामियों से भरे हुए हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →