A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents
यह शोधपत्र SWE-RPG प्रस्तुत करता है, जो कोडिंग एजेंटों के लिए एक एकीकृत बेंचमार्क है जो न केवल अंतिम पैच सफलता बल्कि आवश्यकता स्पष्टीकरण और कार्यान्वयन योजना जैसे मध्यवर्ती तर्क चरणों का भी मूल्यांकन करता है, जिससे यह पता चलता है कि निहित आवश्यकता रिकवरी (implicit requirement recovery) ही रिपॉजिटरी-स्तरीय कार्यों पर वर्तमान एजेंटों के प्रदर्शन को सीमित करने वाला प्राथमिक बॉटलनेक है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ आपके पास एक सुपर-स्मार्ट रोबोट सहायक हो जो कंप्यूटर कोड लिख सके। आप उसे एक सरल निर्देश देते हैं जैसे, "इस गेम के बग को ठीक करो," या "एक नया लेवल जोड़ो," और वह काम में जुट जाता है। यह AI कोडिंग एजेंट्स का सपना है। लंबे समय से, वैज्ञानिक इन रोबोटों का परीक्षण करने के लिए उन्हें एक कार्य देते हैं और देखते हैं कि क्या अंतिम परिणाम काम करता है। यदि गेम बिना क्रैश हुए चलता है, तो रोबोट को एक गोल्ड स्टार मिलता है। यदि यह क्रैश हो जाता है, तो उसे एक रेड X मिलता है।
लेकिन यहाँ एक समस्या है: एक रेड X आपको यह नहीं बताता कि रोबोट क्यों विफल हुआ। क्या उसने आपके निर्देशों को गलत समझा? क्या उसने एक खराब योजना बनाई? या उसने बस गलत कोड टाइप कर दिया? यह एक छात्र के गणित की परीक्षा में फेल होने जैसा है जिसे केवल "0/10" स्कोर मिलता है, बिना यह देखे कि शिक्षक के नोट्स में कहाँ गलती हुई थी। इन रोबोटों को वास्तव में बेहतर बनाने के लिए, हमें उनके सोचने की प्रक्रिया को देखने की आवश्यकता है, न कि केवल अंतिम उत्तर को। यही वह बड़ा सवाल है जिसे यह पेपर संबोधित करता है: हम केवल अंतिम पैच को ग्रेड देना कैसे बंद करें और रोबोट के मस्तिष्क का निदान करना कैसे शुरू करें?
यहाँ आता है SWE-RPG, एक नया, सुपर-विस्तृत परीक्षण जिसे रोबोट के मन में झाँकने के लिए डिज़ाइन किया गया है। शोधकर्ताओं ने 31 अलग-अलग सॉफ्टवेयर प्रोजेक्ट्स से 163 वास्तविक दुनिया के कोडिंग कार्यों का उपयोग करके एक बेंचमार्क (एक मानकीकृत परीक्षण) बनाया। केवल यह जाँचने के बजाय कि कोड अंत में काम करता है या नहीं, उन्होंने रोबोट की यात्रा के हर एक चरण के लिए "गोल्ड ट्रुथ" संदर्भ बनाए। इसे एक मास्टर शेफ की रेसिपी बुक की तरह समझें जो न केवल अंतिम व्यंजन दिखाती है, बल्कि यह भी सूचीबद्ध करती है कि शेफ को किन छिपे हुए अवयवों का अनुमान लगाना पड़ा, योजना के हर चरण में क्या था, और वह सटीक क्षण कब आया जब रोबोट पटरी से उतर सकता था।
शोधकर्ताओं ने तीन लोकप्रिय कोडिंग एजेंट्स (Claude Code, Codex, और OpenCode नाम से) को टेस्ट किया, उन्हें छह अलग-अलग "ब्रेन" मॉडल्स (LLMs) के साथ जोड़ा। परिणाम एक वास्तविकता की जाँच की तरह थे। सबसे अच्छे रोबोटों ने भी केवल लगभग 31.5% कार्यों को हल किया। इसका मतलब है कि वे लगभग दो-तिहाई बार विफल रहे! लेकिन असली जादू यह था कि SWE-RPG ने यह पता लगाया कि वे कहाँ विफल हुए। अध्ययन में पाया गया कि सबसे बड़ी बाधा वास्तव में कोड लिखना नहीं थी; बल्कि छिपे हुए नियमों को समझना था। लगभग 24.5% से 46.0% विफलताएं इसलिए हुईं क्योंकि रोबोट "इम्प्लिसिट रिक्वायरमेंट्स" (अंतर्निहित आवश्यकताओं)—उन चीजों को नहीं समझ पाए जिन्हें आपने कहा नहीं था लेकिन रोबोट को काम सही ढंग से करने के लिए जानने की आवश्यकता थी—को समझने में असमर्थ थे।
उदाहरण के लिए, यदि आप एक रोबोट को "TSV इम्पोर्ट को ठीक करने" के लिए कहते हैं, तो वह कोड को ठीक कर सकता है लेकिन अनजाने में CSV इम्पोर्ट को खराब कर सकता है क्योंकि उसे यह एहसास नहीं हुआ कि दोनों आपस में संबंधित हैं। अध्ययन सुझाव देता है कि इन एजेंट्स को वास्तव में उपयोगी बनाने के लिए, हमें केवल उन्हें तेज़ कोड लिखना सिखाने पर ध्यान केंद्रित करना बंद करना होगा और उन्हें बेहतर जासूस बनना सिखाना शुरू करना होगा, जो उपयोगकर्ता के अनुरोध के बीच की बातों को पढ़ने में सक्षम हों। पेपर निष्कर्ष निकालता है कि हालांकि ये एजेंट्स प्रभावशाली हैं, फिर भी वे सॉफ्टवेयर विकास के जटिल, मानवीय पक्ष के साथ संघर्ष करते हैं, और SWE-RPG वह नया मानचित्र है जिसकी हमें उन पेचीदा छिपी हुई आवश्यकताओं को नेविगेट करने के लिए आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।