← नवीनतम पेपर
💻 computer science

What's in a Benchmark? The Case of SWE-Bench in Automated Program Repair

यह शोध पत्र SWE-Bench Lite और Verified लीडरबोर्ड का पहला व्यापक विश्लेषण प्रस्तुत करता है, जो यह प्रकट करता है कि प्रोप्राइटरी (proprietary) LLMs, विशेष रूप से क्लॉड (Claude) परिवार का उपयोग करने वाले उद्योग के सबमिशन वर्तमान में इस बेंचमार्क पर हावी हैं, जबकि अकादमिक योगदान प्रतिस्पर्धी बने हुए हैं।

मूल लेखक: Matias Martinez, Xavier Franch

प्रकाशित 2026-02-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matias Martinez, Xavier Franch

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि कंप्यूटर कोड को ठीक करने की दुनिया एक सॉफ्टवेयर इंजीनियरों के लिए आयोजित विशाल, उच्च-दांव वाले ओलंपिक खेलों की तरह है। वर्षों से, शोधकर्ता ऐसे रोबोट (AI) बनाने की कोशिश कर रहे हैं जो कोड में बग्स (खामियों) को स्वचालित रूप से ढूंढ सकें और उन्हें ठीक कर सकें। यह देखने के लिए कि कौन जीत रहा है, उन्हें दौड़ने के लिए एक मानक ट्रैक की आवश्यकता है।

यह शोध पत्र वर्तमान में इस दौड़ में उपयोग किए जाने वाले दो मुख्य ट्रैकों का गहरा विश्लेषण करता है: SWE-Bench Lite और SWE-Bench Verified। लेखक, मटियास मार्टिनेज और जेवियर फ्रैंच, खेल विश्लेषकों की तरह, स्कोरबोर्ड, एथलीटों और उनके द्वारा उपयोग किए गए उपकरणों का अवलोकन करते हैं ताकि यह देखा जा सके कि वास्तव में इस क्षेत्र में क्या हो रहा है।

यहाँ उनके निष्कर्ष दिए गए, जिन्हें सरल रूप में समझाया गया है:

1. रेस का ट्रैक (द बेंचमार्क्स)

SWE-Bench को वास्तविक दुनिया के प्रोजेक्ट्स से लिए गए 2,294 टूटे हुए सॉफ्टवेयर टुकड़ों (बग्स) से भरे एक विशाल जिम के रूप में सोचें।

  • SWE-Bench Lite: यह "क्वालीफाइंग राउंड" है। इसमें 300 सबसे सामान्य बग्स शामिल हैं। यह पहले से मौजूद है और इसमें बहुत सारी प्रविष्टियाँ हैं।
  • SWE-Bench Verified: यह "चैंपियनशिप राउंड" है। इसमें 500 बग्स हैं जिन्हें एक प्रमुख AI कंपनी (OpenAI) द्वारा सावधानीपूर्वक जांचा और साफ किया गया है ताकि यह सुनिश्चित किया जा सके कि वे हल करने योग्य हैं। यह नया है, और यहाँ प्रतिस्पर्धा अधिक कठिन है।

2. दौड़ कौन रहा है? (द सबमिटर्स)

लेखकों ने देखा कि समाधान कौन प्रस्तुत कर रहा है। उन्होंने पाया कि उद्योग (इंडस्ट्री) ट्रैक पर हावी है

  • कॉर्पोरेट स्प्रिन्टर (कंपनियों के धावक): अधिकांश शीर्ष प्रदर्शन करने वाले कंपनियाँ हैं। यह केवल गूगल या आईबीएम जैसे दिग्गजों की बात नहीं है; इसमें कई छोटी स्टार्टअप और "मॉम-एंड-पॉप" टेक दुकानें भी शामिल हैं।
  • अकादमिक धावक (यूनिवर्सिटी के रनर्स): विश्वविद्यालय और अनुसंधान प्रयोगशालाएं अभी भी दौड़ रही हैं, लेकिन कॉर्पोरेट टीमों की तुलना में उनकी संख्या कम है।
  • सोलो एथलीट्स (एकल एथलीट): कुछ व्यक्ति अकेले ही दौड़ में भाग ले रहे हैं, जो इस बात को देखते हुए प्रभावशाली है कि उपकरण कितने शक्तिशाली हैं।

उपमा: एक मैराथन की कल्पना करें जहाँ विजेता पहले ज्यादातर विश्वविद्यालय के धावक हुआ करते थे। अब, पोडियम पर ज्यादातर बड़ी कंपनियों और छोटी स्टार्टअप्स की पेशेवर टीमों का कब्जा है, जबकि कुछ विश्वविद्यालय के धावक अभी भी उनके साथ तालमेल बनाए हुए हैं।

3. उपकरण (द एआई मॉडल्स)

यह शायद सबसे आश्चर्यजनक खोज है। तेज दौड़ने के लिए, आपको अच्छे जूतों की आवश्यकता होती है। इस दौड़ में, "जूते" लार्ज लैंग्वेज मॉडल्स (LLMs) हैं—जो मरम्मत करने वाले रोबोट के पीछे के AI दिमाग हैं।

  • "सुपर-शूज": सबसे तेज धावक लगभग विशेष रूप से प्रोप्रायटरी (क्लोज्ड-सोर्स) मॉडल्स का उपयोग कर रहे हैं, विशेष रूप से Claude परिवार (जिसे Anthطिक नामक कंपनी ने बनाया है)। वर्तमान चैंपियन, Claude 4 Sonnet, एक सुपर-लाइटवेट, हाई-टेक रनिंग स्पाइक्स की तरह है जिसे कोई और खरीद या देख नहीं सकता।
  • ओपन-सोर्स स्नीकर्स: कुछ धावक ओपन-सोर्स मॉडल्स (ऐसे मॉडल जिन्हें कोई भी डाउनलोड और अध्ययन कर सकता है) का उपयोग कर रहे हैं, लेकिन वे अभी तक स्वर्ण पदक नहीं जीत पा रहे हैं। वे प्रतिस्पर्धी तो हैं, लेकिन वे विश्व रिकॉर्ड नहीं बना रहे हैं।
  • मिश्रण: कुछ टीमें विभिन्न मॉडल्स को आपस में मिला रही हैं (जैसे दो अलग-अलग जूते पहनना), लेकिन एकल सर्वश्रेष्ठ "जूता" अभी भी प्रोप्रायटरी Claude मॉडल ही है।

4. परिणाम (कौन जीत रहा है?)

  • स्कोरबोर्ड: "Verified" लीडरबोर्ड का स्कोर "Lite" की तुलना में बहुत अधिक है। सर्वश्रेष्ठ समाधान लगभग 76% से 77% बग्स को ठीक कर रहे हैं।
  • रुझान: शुरुआत में, विश्वविद्यालय आगे थे। लेकिन जैसे-जैसे दौड़ आगे बढ़ी, छोटी और बड़ी कंपनियों ने बढ़त बना ली, और अक्सर उच्चतम स्कोर प्राप्त किया।
  • "ब्लैक बॉक्स" की समस्या: कई शीर्ष समाधान "क्लोज्ड सोर्स" हैं। इसका मतलब है कि हम जानते हैं कि वे काम करते हैं, लेकिन हम यह नहीं जानते कि वे इसे कैसे करते हैं क्योंकि कंपनियाँ अपना कोड गुप्त रखती हैं। यह एक धावक को दौड़ जीतनेते हुए देखने जैसा है, लेकिन आपको उनके प्रशिक्षण के तरीके को देखने की अनुमति नहीं है।

5. खामियां (किन बातों पर नज़र रखें)

लेखक चेतावनी देते हैं कि स्कोरबोर्ड थोड़ा भ्रामक हो सकता है, जैसे कि एक ऐसी दौड़ जहाँ फिनिश लाइन बदलती रहती है।

  • "चीट शीट" प्रभाव: कभी-कभी, AI वास्तव में बग को ठीक करना नहीं सीखता; यह बस उत्तर को याद कर लेता है क्योंकि इसने अपने ट्रेनिंग डेटा में उस बग को पहले ही देख लिया था। इसे डेटा कंटैमिनेशन (Data Contamination) कहा जाता है।
  • "फेक फिक्स" प्रभाव: कभी-कभी, AI एक ऐसा फिक्स लिखता है जो ऑटोमेटेड टेस्ट को पास कर देता है (जैसे कि एक छात्र बहुविकल्पीय प्रश्न में सही उत्तर का अनुमान लगा लेता है) लेकिन वास्तव में वास्तविक समस्या को हल नहीं करता है। इसे ओवरफिटिंग (Overfitting) कहा जाता है।
  • लागत: सबसे अच्छे "जूते" (शीर्ष AI मॉडल्स) का उपयोग करने के लिए पैसे की आवश्यकता होती है। इसका मतलब है कि केवल वे टीमें ही सबसे तेज दौड़ सकती हैं जिनके पास बड़ा बजट है, जिससे छोटे शोधकर्ता या ओपन-सोर्स समुदाय पीछे छूट सकते हैं।

निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि ऑटोमेटेड प्रोग्राम रिपेयर का क्षेत्र अविश्वसनीय रूप से तेजी से बढ़ रहा है, लेकिन यह एक कॉर्पोरेट-प्रधान खेल बनता जा रहा है। सर्वश्रेष्ठ परिणाम बड़ी कंपनियों द्वारा संचालित हो रहे हैं जो महंगे, गुप्त AI मॉडल्स का उपयोग करती हैं। हालांकि यह गति के लिए अच्छा है, लेखक सुझाव देते हैं कि हमें सावधान रहने की आवश्यकता है: हमें यह सुनिश्चित करने की आवश्यकता है कि फिक्स वास्तविक फिक्स हों, न कि केवल याद किए गए उत्तर, और हमें दौड़ को इतना खुला रखने की आवश्यकता है कि हर कोई इसमें भाग ले सके, न कि केवल वे टीमें जिनके पास सबसे बड़ा बजट है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →