SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
SWE-bench जैसे मौजूदा बेंचमार्क में गंभीर डेटा संदूषण (data contamination) और अपर्याप्त टेस्ट केसों को संबोधित करने के लिए, यह शोध पत्र SWE-MERA पेश करता है, जो एक गतिशील और निरंतर अपडेट होने वाला बेंचमार्क है जो वास्तविक दुनिया के GitHub इश्यूज़ को क्यूरेट करने के लिए एक स्वचालित पाइपलाइन का लाभ उठाता है, जिससे सॉफ्टवेयर इंजीनियरिंग कार्यों पर लार्ज लैंग्वेज मॉडल्स के लिए एक कठोर और विश्वसनीय मूल्यांकन ढांचा प्रदान किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक टूटे हुए वीडियो गेम को ठीक करना सिखाने की कोशिश कर रहे हैं। लंबे समय तक, रोबोट का परीक्षण करने का सबसे अच्छा तरीका उसे टूटे हुए स्तरों (levels) की एक विशिष्ट सूची देना था जिन्हें सभी पहले ही देख चुके थे। लेकिन यहाँ एक समस्या थी: रोबोट केवल उत्तरों को रट रहा था बजाय वास्तव में चीजें सीखने के। यह एक ऐसे छात्र की तरह था जिसने पिछले साल के गणित टेस्ट के उत्तर रट लिए लेकिन नए टेस्ट में फेल हो गया क्योंकि संख्याएँ बदल गई थीं।
यही वह हुआ जो प्रसिद्ध SWE-bench के साथ हुआ, जो एआई (AI) कोडिंग कौशल के लिए एक लोकप्रिय परीक्षण है। पेपर खुलासा करता है कि इस पुराने परीक्षण से उत्तर लीक हो रहे थे। लगभग 32.67% "सफल" सुधार केवल वे थे जहाँ एआई ने उन समाधानों की नकल की थी जिन्हें वह पहले ही देख चुका था, और दूसरा 31.08% इसलिए पास हुआ क्योंकि परीक्षण वास्तविक गलतियों को पकड़ने के लिए बहुत कमजोर थे। यह एक टूटा हुआ पैमाना था।
अब आया SWE-MERA, नया, गतिशील चुनौतीकर्ता। सोचिए कि SWE-MERA एक स्थिर पाठ्यपुस्तक नहीं है, बल्कि एक लाइव, सांस लेता हुआ वीडियो गेम सर्वर है जो हर महीने अपडेट होता है। पुराने, रटे हुए पहेलियों के बजाय, यह लगातार इंटरनेट (विशेष रूप से GitHub, जहाँ लाखों लोग अपना कोड साझा करते हैं) से बिल्कुल नई, वास्तविक दुनिया की समस्याओं की तलाश करता है।
यह नया परीक्षण कैसे काम करता है
लेखकों ने इन ताज़ा समस्याओं को खोजने के लिए एक सुपर-व्यवस्थित रोबोट पाइपलाइन बनाई है। यह एक हाई-टेक खोज (scavenger hunt) की तरह है जिसमें सात सख्त नियम हैं ताकि यह सुनिश्चित हो सके कि सुराग असली हैं:
- सही खेल का मैदान चुनें: यह केवल लोकप्रिय, सक्रिय पायथन (Python) प्रोजेक्ट्स को देखता है (जिनके कम से कम 10 स्टार और 10 फोर्क हों)।
- सुरागों का मिलान करें: यह एक विशिष्ट समस्या (एक "इश्यू") और सटीक समाधान (एक "पुल रिक्वेस्ट") को ढूंढता है, जो इसे ठीक करता है, यह सुनिश्चित करते हुए कि वे एक आदर्श वन-टू-वन जोड़ी हैं।
- आकार की जाँच करें: यह छोटी टिप्पणियों और बहुत बड़े, अव्यवस्थित प्रोजेक्ट्स को अनदेखा करता है, केवल उन्हीं को रखता है जो बिल्कुल सही हैं।
- सुधार को सत्यापित करें: यह जाँचता है कि क्या समाधान वास्तव में कोड को बदलता है और यह साबित करने के लिए एक टेस्ट भी जोड़ता है कि यह काम करता है।
- प्रयोगशाला बनाएँ: यह प्रोजेक्ट को एक सुरक्षित, अलग कंटेनर (एक डिजिटल सैंडबॉक्स की तरह) में बनाने की कोशिश करता है ताकि यह देखा जा सके कि क्या टेस्ट पास होते हैं।
- पूरा मिशन चलाएँ: यह सुनिश्चित करने के लिए कि यह पुनरुत्पादक (reproducible) है, पूरे कार्य को शुरू से अंत तक चलाता है।
- एआई जज: अंत में, एक अन्य एआई (Qwen3-32B मॉडल) एक सख्त शिक्षक के रूप में कार्य करता है, जो शुद्धता और पूर्णता के लिए 1 से 10 के पैमाने पर कार्य को ग्रेड देता है। यदि कोई कार्य बहुत आसान, बहुत कठिन या खराब तरीके से समझाया गया है, तो उसे बाहर कर दिया जाता है।
परिणाम? लगभग 10,000 संभावित कार्यों का एक विशाल संग्रह, जिसमें 728 उच्च-गुणवत्ता वाले नमूने अभी जाने के लिए तैयार हैं।
परिणाम: वास्तव में कौन जीतता है?
शोधकर्ताओं ने इन ताज़ा समस्याओं पर एक दर्जन सबसे स्मार्ट कोडिंग एआई को टेस्ट किया। उन्होंने केवल एआई को एक बार समस्या हल करने के लिए नहीं कहा; उन्होंने इसे बग को ठीक करने के लिए छह प्रयास दिए, जिसमें सोचने और अपने काम की दोबारा जाँच करने के अवसर भी दिए गए।
परिणाम चौंकाने वाले थे:
- शीर्ष प्रदर्शन करने वाला: DeepSeek-R1-0528 मॉडल चैंपियन था, जिसने अपने पहले ही प्रयास में लगभग 27.8% समस्याओं को ठीक किया और छह प्रयासों के भीतर 40.2% को।
- उपविजेता: Devstral-Small-2505 दूसरे स्थान पर आया, जिसने पहले प्रयास में 17.2% और कुल मिलाकर 28.2% को हल किया।
- संघर्ष करने वाले: यहाँ तक कि Llama-3.3-70B जैसे बड़े, शक्तिशाली मॉडल (जो चैट करने में बहुत अच्छे हैं लेकिन विशेष रूप से कोड के लिए नहीं बने हैं) भी पहले प्रयास में केवल 8.7% ही हासिल कर पाए। सबसे छोटा मॉडल, Qwen2.5-Coder-7B, पहले प्रयास में केवल 2.7% ही ठीक कर सका।
पेपर सुझाव देता है कि ये नए, गतिशील परीक्षण एक स्मार्ट एआई और रटने वाले एआई के बीच अंतर बताने में बहुत बेहतर हैं। उदाहरण के लिए, कुछ मॉडल जो पुराने परीक्षणों पर बहुत अच्छे दिखते थे, वे वास्तव में नए 2025 के कार्यों पर खराब प्रदर्शन करते हैं, जो यह सुझाव देता है कि वे केवल पुराने उत्तरों को रट रहे थे।
यह परीक्षण क्या नहीं करता है
यह जानना महत्वपूर्ण है कि यह नया बेंचमार्क क्या छोड़ देता है। पेपर स्पष्ट रूप से कहता है कि यह टेस्ट यह माप नहीं करता है कि कोड कितना पठनीय (readable), रखरखाव योग्य (maintainable) या सुरक्षित है। यह टीम वर्क या यह भी नहीं परखता कि एक इंसान और एक रोबोट मिलकर कैसे काम करते हैं। यह पूरी तरह से इस बारे में है: "क्या रोबोट बग को ठीक कर सकता है और टेस्ट पास कर सकता है?"
साथ ही, लेखक चेतावनी देते हैं कि चूंकि ये समस्याएँ स्वचालित रूप से एकत्र की जाती हैं, इसलिए कुछ थोड़ी अजीब हो सकती हैं या उनमें मानव-लिखित पहेली जैसी रचनात्मक सूक्ष्मता की कमी हो सकती है। एक छोटा जोखिम यह भी है कि एआई ने अपने प्रशिक्षण डेटा में एक समान समस्या देखी होगी, भले ही सिस्टम इसे रोकने की कोशिश करता है।
बड़ी तस्वीर
लेखक आश्वस्त हैं कि SWE-MERA प्रगति को मापने का एक बहुत अधिक निष्पक्ष तरीका है। नए, अनदेखे चुनौतियों के साथ परीक्षण को लगातार रिफ्रेश करके, यह एआई को उत्तर रटकर धोखाधड़ी करने से रोकता है। उन्होंने एक सार्वजनिक लीडरबोर्ड भी बनाया है जहाँ कोई भी देख सकता है कि उनका कोडिंग रोबोट दुनिया के सर्वश्रेष्ठों के मुकाबले कहाँ खड़ा है, जिसमें एक स्लाइडर है जो आपको यह देखने की अनुमति देता है कि प्रदर्शन समय के साथ कैसे बदलता है।
संक्षेप में, SWE-MERA वह "ताजी हवा" है जिसकी इस क्षेत्र को आवश्यकता थी। यह धूल भरी, रटी हुई पाठ्यपुस्तकों से दूर एक गतिशील, निरंतर बदलते अखाड़े में जाता है जहाँ केवल वास्तव में अनुकूलन योग्य (adaptable) कोडिंग एजेंट ही जीवित रह सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।