← नवीनतम पेपर
🤖 AI

A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents

यह शोधपत्र SWE-RPG प्रस्तुत करता है, जो कोडिंग एजेंटों के लिए एक एकीकृत बेंचमार्क है जो न केवल अंतिम पैच सफलता बल्कि आवश्यकता स्पष्टीकरण और कार्यान्वयन योजना जैसे मध्यवर्ती तर्क चरणों का भी मूल्यांकन करता है, जिससे यह पता चलता है कि निहित आवश्यकता रिकवरी (implicit requirement recovery) ही रिपॉजिटरी-स्तरीय कार्यों पर वर्तमान एजेंटों के प्रदर्शन को सीमित करने वाला प्राथमिक बॉटलनेक है।

मूल लेखक: Xin Zhou, Chun Yong Chong, Kisub Kim, Yun Peng, Rui Shu, Zihan Wu, Xu Han, Guowen Yuan, Zeyang Zhuang, Jounghoon Kim, Jeongjin Ju, Seongmin Ju, Taein Yoon, David Lo

प्रकाशित 2026-08-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xin Zhou, Chun Yong Chong, Kisub Kim, Yun Peng, Rui Shu, Zihan Wu, Xu Han, Guowen Yuan, Zeyang Zhuang, Jounghoon Kim, Jeongjin Ju, Seongmin Ju, Taein Yoon, David Lo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ आपके पास एक सुपर-स्मार्ट रोबोट सहायक हो जो कंप्यूटर कोड लिख सके। आप उसे एक सरल निर्देश देते हैं जैसे, "इस गेम के बग को ठीक करो," या "एक नया लेवल जोड़ो," और वह काम में जुट जाता है। यह AI कोडिंग एजेंट्स का सपना है। लंबे समय से, वैज्ञानिक इन रोबोटों का परीक्षण करने के लिए उन्हें एक कार्य देते हैं और देखते हैं कि क्या अंतिम परिणाम काम करता है। यदि गेम बिना क्रैश हुए चलता है, तो रोबोट को एक गोल्ड स्टार मिलता है। यदि यह क्रैश हो जाता है, तो उसे एक रेड X मिलता है।

लेकिन यहाँ एक समस्या है: एक रेड X आपको यह नहीं बताता कि रोबोट क्यों विफल हुआ। क्या उसने आपके निर्देशों को गलत समझा? क्या उसने एक खराब योजना बनाई? या उसने बस गलत कोड टाइप कर दिया? यह एक छात्र के गणित की परीक्षा में फेल होने जैसा है जिसे केवल "0/10" स्कोर मिलता है, बिना यह देखे कि शिक्षक के नोट्स में कहाँ गलती हुई थी। इन रोबोटों को वास्तव में बेहतर बनाने के लिए, हमें उनके सोचने की प्रक्रिया को देखने की आवश्यकता है, न कि केवल अंतिम उत्तर को। यही वह बड़ा सवाल है जिसे यह पेपर संबोधित करता है: हम केवल अंतिम पैच को ग्रेड देना कैसे बंद करें और रोबोट के मस्तिष्क का निदान करना कैसे शुरू करें?

यहाँ आता है SWE-RPG, एक नया, सुपर-विस्तृत परीक्षण जिसे रोबोट के मन में झाँकने के लिए डिज़ाइन किया गया है। शोधकर्ताओं ने 31 अलग-अलग सॉफ्टवेयर प्रोजेक्ट्स से 163 वास्तविक दुनिया के कोडिंग कार्यों का उपयोग करके एक बेंचमार्क (एक मानकीकृत परीक्षण) बनाया। केवल यह जाँचने के बजाय कि कोड अंत में काम करता है या नहीं, उन्होंने रोबोट की यात्रा के हर एक चरण के लिए "गोल्ड ट्रुथ" संदर्भ बनाए। इसे एक मास्टर शेफ की रेसिपी बुक की तरह समझें जो न केवल अंतिम व्यंजन दिखाती है, बल्कि यह भी सूचीबद्ध करती है कि शेफ को किन छिपे हुए अवयवों का अनुमान लगाना पड़ा, योजना के हर चरण में क्या था, और वह सटीक क्षण कब आया जब रोबोट पटरी से उतर सकता था।

शोधकर्ताओं ने तीन लोकप्रिय कोडिंग एजेंट्स (Claude Code, Codex, और OpenCode नाम से) को टेस्ट किया, उन्हें छह अलग-अलग "ब्रेन" मॉडल्स (LLMs) के साथ जोड़ा। परिणाम एक वास्तविकता की जाँच की तरह थे। सबसे अच्छे रोबोटों ने भी केवल लगभग 31.5% कार्यों को हल किया। इसका मतलब है कि वे लगभग दो-तिहाई बार विफल रहे! लेकिन असली जादू यह था कि SWE-RPG ने यह पता लगाया कि वे कहाँ विफल हुए। अध्ययन में पाया गया कि सबसे बड़ी बाधा वास्तव में कोड लिखना नहीं थी; बल्कि छिपे हुए नियमों को समझना था। लगभग 24.5% से 46.0% विफलताएं इसलिए हुईं क्योंकि रोबोट "इम्प्लिसिट रिक्वायरमेंट्स" (अंतर्निहित आवश्यकताओं)—उन चीजों को नहीं समझ पाए जिन्हें आपने कहा नहीं था लेकिन रोबोट को काम सही ढंग से करने के लिए जानने की आवश्यकता थी—को समझने में असमर्थ थे।

उदाहरण के लिए, यदि आप एक रोबोट को "TSV इम्पोर्ट को ठीक करने" के लिए कहते हैं, तो वह कोड को ठीक कर सकता है लेकिन अनजाने में CSV इम्पोर्ट को खराब कर सकता है क्योंकि उसे यह एहसास नहीं हुआ कि दोनों आपस में संबंधित हैं। अध्ययन सुझाव देता है कि इन एजेंट्स को वास्तव में उपयोगी बनाने के लिए, हमें केवल उन्हें तेज़ कोड लिखना सिखाने पर ध्यान केंद्रित करना बंद करना होगा और उन्हें बेहतर जासूस बनना सिखाना शुरू करना होगा, जो उपयोगकर्ता के अनुरोध के बीच की बातों को पढ़ने में सक्षम हों। पेपर निष्कर्ष निकालता है कि हालांकि ये एजेंट्स प्रभावशाली हैं, फिर भी वे सॉफ्टवेयर विकास के जटिल, मानवीय पक्ष के साथ संघर्ष करते हैं, और SWE-RPG वह नया मानचित्र है जिसकी हमें उन पेचीदा छिपी हुई आवश्यकताओं को नेविगेट करने के लिए आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →