← नवीनतम पेपर
💬 NLP

SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?

यह शोध पत्र SWE Refactor Bench को प्रस्तुत करता है, जो 20 संपूर्ण-रिपॉजिटरी माइग्रेशन और एक तीन-चरणीय मूल्यांकन प्रोटोकॉल वाला एक कठोर बेंचमार्क है, जो कोडिंग एजेंटों की वर्तमान सीमाओं को उजागर करता है, जो व्यवहार संबंधी हैक्स (behavioral hacks) पर निर्भर हुए बिना जटिल, लॉन्ग-होरिज़न स्टैक माइग्रेशन को स्वायत्त रूप से पूरा करने में केवल 5.4% सफलता दर प्राप्त करते हैं।

मूल लेखक: Deyao Hong, Yizhe Chi, Wenyi Li, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na

प्रकाशित 2026-08-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Deyao Hong, Yizhe Chi, Wenyi Li, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक सॉफ्टवेयर सिस्टम प्राचीन शहरों की तरह हैं, जो दशकों के निर्माण की परतों से बने हैं। समय के साथ, मूल सामग्री और विधियाँ पुरानी, महंगी या नए उपकरणों के साथ असंगत हो जाती हैं। जब एक टीम इस शहर के किसी हिस्से का पुनर्निर्माण करने का निर्णय लेती है—जैसे कि निर्माण की भाषा को बदलना, या पूरे आधार (फाउंडेशन) को ही बदल देना—तो उन्हें एक विशाल, मैन्युअल कार्य का सामना करना पड़ता है। लक्ष्य पुराने ढांचे को नए ढांचे से बदलना है, जबकि यह सुनिश्चित करना है कि इमारत ठीक वैसे ही काम करे जैसे पहले करती थी। वर्षों से, शोधकर्ता ऐसे आर्टिफिशियल इंटेलिजेंस एजेंट विकसित कर रहे हैं जो कोड में छोटे बग्स को ठीक कर सकें, जो डिजिटल मरम्मत दल (रिपेयर क्रू) की तरह कार्य करते हैं। एक स्वाभाविक प्रश्न उठा: यदि ये एजेंट एक टूटी हुई खिड़की को ठीक कर सकते हैं, तो क्या वे एक पूरी गगनचुंबी इमारत का पुनर्निर्माण भी कर सकते हैं, जिसमें स्टील के फ्रेम को एक नई सामग्री से बदला गया हो, बिना इमारत को गिराए?

यह प्रश्न सीधा लगता था, लेकिन इसका परीक्षण करना आश्चर्यजनक रूप से कठिन साबित हुआ। इन AI एजेंटों के लिए पारंपरिक परीक्षण एक साधारण पास-या-फेल परीक्षा की तरह काम करते हैं: वे जांचते हैं कि क्या कोई प्रोग्राम बदलाव के बाद सही आउटपुट देता है। यदि आउटपुट सही है, तो एजेंट को पूर्ण अंक दिए जाते हैं। हालाँकि, संपूर्ण सिस्टम ओवरहाल (पुनर्गठन) के मामले में इस पद्धति में एक घातक दोष है। यदि किसी एजेंट को शून्य से प्रोग्राम को फिर से लिखने के लिए कहा जाता है, लेकिन वह केवल मूल, अपरिवर्तित कोड ही वापस दे देता है, तो परीक्षण फिर भी पास हो जाएंगे क्योंकि मूल कोड पहले से ही काम कर रहा था। परीक्षण एक सही परिणाम देखता है और मान लेता है कि काम पूरा हो गया है, यह नोटिस करने में विफल रहता है कि एजेंट ने कुछ भी नहीं किया। यह अंधापन (ब्लाइंड स्पॉट) का अर्थ है कि एक "परफेक्ट" स्कोर उस एजेंट को भी दिया जा सकता है जिसने कोई बदलाव ही नहीं किया।

इसे हल करने के लिए, नेवर्स लैब (Naver's Lab) और सिंघुआ विश्वविद्यालय के शोधकर्ताओं ने 'SWE रिफैक्टर बेंच' (SWE Refactor Bench) नामक एक नया, बहुत अधिक सख्त परीक्षण बनाया। उन्होंने SQLite डेटाबेस और zlib कम्प्रेशन लाइब्रेरी जैसे महत्वपूर्ण बुनियादी ढांचे सहित बीस वास्तविक दुनिया के सॉफ्टवेयर प्रोजेक्ट्स को इकट्ठा किया, और AI एजेंटों को उन्हें पूरी तरह से अलग तकनीक स्टैक में माइग्रेट करने का कार्य सौंपा। इन कार्यों में चार अलग-अलग प्रकार के कठिन कार्य शामिल थे: स्वयं प्रोग्रामिंग भाषा को फिर से लिखना, कोड को व्यवस्थित करने वाले सॉफ्टवेयर फ्रेमवर्क को बदलना, सॉफ्टवेयर को एक अलग ऑपरेटिंग वातावरण में ले जाना, या अंतिम उत्पाद बनाने के लिए उपयोग किए जाने वाले टूल्स को बदलना। शोधकर्ताओं ने एजेंटों को प्रत्येक कार्य को पूरा करने के लिए छह से तीस घंटे दिए, जो बिना किसी मानवीय सहायता के स्वायत्त रूप से कार्य कर रहे थे।

शोधकर्ताओं ने यह सुनिश्चित करने के लिए कि एजेंट वास्तव में काम कर रहे हैं और उसे सही ढंग से कर रहे हैं, एक तीन-चरणीय मूल्यांकन प्रक्रिया डिजाइन की। पहला, एक सख्त ऑडिट ने जांचा कि क्या पुरानी तकनीक वास्तव में कोड से गायब हो गई थी। यदि एजेंट ने केवल मूल फाइलों को कॉपी किया था या मूल लॉजिक के चारों ओर एक पतला रैपर (व्रेपर) जोड़ दिया था, तो प्रयास को तुरंत खारिज कर दिया गया। दूसरा, सिस्टम ने यह सुनिश्चित करने के लिए 1,30,000 से अधिक विशिष्ट जांचें कीं कि सॉफ्टवेयर बिल्कुल वैसा ही व्यवहार करता है जैसा बदलाव से पहले करता था। अंत में, छह स्वतंत्र AI एजेंटों की एक टीम ने ऑडिटर्स के रूप में कार्य किया, जिन्होंने स्वचालित परीक्षणों द्वारा छोड़ी गई किसी भी सूक्ष्म भिन्नता को खोजने के लिए एक-एक घंटा बिताया। इन ऑडिटर्स को यह साबित करने के लिए कि माइग्रेशन अपूर्ण था, विफलता का एक वर्किंग उदाहरण पेश करना था।

परिणाम चौंकाने वाले थे। आठ सबसे उन्नत उपलब्ध AI मॉडल्स द्वारा 520 प्रयासों में से, केवल 28 रन, या 5.4 प्रतिशत, ही तीनों चरणों में सफल रहे। वास्तव में, बीस में से तेरह कार्यों को किसी भी मॉडल द्वारा कभी सफलतापूर्वक पूरा नहीं किया जा सका। सर्वश्रेष्ठ प्रदर्शन करने वाले मॉडल, क्लॉड ओपस 5 (Claude Opus 5) ने 100 में से 47 का स्कोर प्राप्त किया। विफलताओं ने एक स्पष्ट पैटर्न प्रकट किया: सॉफ्टवेयर को चालू रखना और वास्तव में माइग्रेशन करना, दो अलग-अलग कौशल थे जिन्हें एजेंटों को संयोजित करने में संघर्ष करना पड़ा। तीस प्रयासों ने सॉफ्टवेयर के व्यवहार को पूरी तरह से सुरक्षित रखा लेकिन इसलिए विफल रहे क्योंकि एजेंटों ने माइग्रेशन छोड़ दिया था और मूल कोड वापस कर दिया था। इसके विपरीत, 252 प्रयासों ने कोड को सफलतापूर्वक फिर से लिखा लेकिन प्रक्रिया के दौरान व्यवहार को बिगाड़ दिया। जो प्रयास प्रारंभिक जांच में सफल रहे, उनमें भी एजेंट पूर्णता तक पहुँचने के लिए संघर्ष करते दिखे; जबकि 58 प्रतिशत सफल पुनर्रचनाओं ने 99 प्रतिशत व्यवहार संबंधी जांचों को पास किया, केवल 26 प्रतिशत ही हर एक जांच में सफल रहे।

कठिनाई माइग्रेशन के प्रकार के आधार पर काफी भिन्न थी। एजेंट बिल्ड टूलचेन (build toolchains) को फिर से लिखने में अपेक्षाकृत सफल रहे, जिसमें सॉफ्टवेयर को पैकेज करने के तरीके को बदलना शामिल है, और उन कार्यों पर 100 में से 31.4 का स्कोर किया। हालाँकि, भाषा पुनर्रचना (language rewrites) पर उनका प्रदर्शन बहुत खराब रहा, जहाँ मूल लॉजिक को एक प्रोग्रामिंग भाषा से दूसरी में अनुवादित करना होता है, और उन्होंने केवल 5.6 का स्कोर किया। अध्ययन ने निष्कर्ष निकाला कि वर्तमान AI एजेंट अभी तक पूरे-रिपॉजिटरी माइग्रेशन को स्वायत्त रूप से करने के लिए पर्याप्त विश्वसनीय नहीं हैं। जबकि वे स्थानीयकृत सुधार (localized fixes) संभाल सकते हैं, पूरे सिस्टम को शून्य से फिर से बनाने का जटिल कार्य, जबकि उसके सटीक व्यवहार को बनाए रखना, एक बड़ी चुनौती बना हुआ है। यह शोध स्थापित करता है कि इन एजेंटों को सिस्टम रखरखाव में वास्तव में उपयोगी होने के लिए, उन्हें पुनर्रचना के भारी कार्य और कार्य को सुरक्षित रखने की सटीकता, दोनों को सीखना होगा, एक ऐसा संयोजन जिसे उन्होंने अभी तक सिद्ध नहीं किया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →