← नवीनतम पेपर
🤖 AI

RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

RoadmapBench वास्तविक ओपन-सोर्स वर्ज़न अपग्रेड्स पर आधारित 115 जटिल, लॉन्ग-होराइजन कोडिंग कार्यों के एक बेंचमार्क को पेश करता है ताकि यह प्रदर्शित किया जा सके कि वर्तमान फ्रंटियर एआई एजेंट बड़े पैमाने पर, मल्टी-टारगेट सॉफ्टवेयर डेवलपमेंट के साथ काफी संघर्ष करते हैं, जो सबसे उन्नत मॉडल्स के साथ भी 40% से कम कार्यों को हल कर पाते हैं।

मूल लेखक: Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

प्रकाशित 2026-05-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप सुपर-स्मार्ट, AI-संचालित जूनियर डेवलपर्स की एक टीम को काम पर रख रहे हैं। आप यह जानना चाहते हैं कि क्या वे वास्तव में एक असली काम को संभाल सकते हैं: केवल किसी रेसिपी में एक टाइपो (लिखने की गलती) को ठीक करना ही नहीं, बल्कि एक विशाल, 500 पन्नों की कुकबुक को पूरी तरह से फिर से लिखना, जिसमें नए अध्याय जोड़ने हों, सामग्री मापने के तरीके बदलने हों, और खराब ओवन को ठीक करना हो—और यह सब करते हुए भी यह सुनिश्चित करना हो कि पुराने वर्जन का उपयोग करने वाले लोगों के लिए पुरानी रेसिपी चलती रहे।

यह बिल्कुल ROADMAPBENCH पेपर के बारे में है।

यहाँ इस पेपर का सरल शब्दों में विवरण दिया गया है:

1. समस्या: "टाइपो" बनाम "रिनोवेशन"

लंबे समय से, हम AI कोडिंग असिस्टेंट को छोटे, आसान कार्यों पर टेस्ट करते रहे हैं। यह ऐसा है जैसे पूछना, "क्या आप इस पैराग्राफ में इस एक वाक्य को ठीक कर सकते हैं?" AI आमतौर पर कहता है, "हाँ!" और उसे A+ मिलता है।

लेकिन वास्तविक दुनिया में, सॉफ्टवेयर डेवलपमेंट केवल एक वाक्य ठीक करने के बारे में नहीं है। यह एक गगनचुंबी इमारत का नवीनीकरण (Renovation) करने के बारे में है। आपको प्लंबिंग, इलेक्ट्रिकल वायरिंग और लिफ्ट सिस्टम को एक साथ 50 अलग-अलग मंजिलों पर बदलना होगा, बिना इमारत को ढहाए।

लेखकों ने महसूस किया कि मौजूदा टेस्ट बहुत आसान थे। वे एक आर्किटेक्ट से एक टपकते नल को ठीक करने के लिए पूछने जैसे थे, जबकि असली काम एक अस्पताल के लिए नया विंग डिजाइन करना है। इसलिए, उन्होंने एक नया, बहुत कठिन टेस्ट बनाया जिसे ROADMAPBENCH कहा जाता है।

2. नया टेस्ट: "वर्जन अपग्रेड" की चुनौती

बग ठीक करने के लिए कहने के बजाय, ROADMAPBENCH AI को एक रोडमैप (Roadmap) देता है।

  • सेटअप: AI को एक वास्तविक सॉफ्टवेयर प्रोजेक्ट (जैसे कि कोई लोकप्रिय ओपन-सोर्स टूल) के पुराने वर्जन के साथ एक डिजिटल वर्कशॉप में छोड़ दिया जाता है।
  • मिशन: AI को एक "रोडमैप" दस्तावेज़ दिया जाता है। यह दस्तावेज़ कहता है, "इस सॉफ्टवेयर के अगले वर्जन में, हमें ये 5 नए फीचर्स जोड़ने हैं, इन 3 चीजों के काम करने के तरीके को बदलना है, और ये 2 बग्स ठीक करने हैं।"
  • पैमाना (Scale): यह कोई छोटा बदलाव नहीं है। औसतन, AI को 51 अलग-अलग फाइलों में 3,700 लाइनों का कोड फिर से लिखना पड़ता है। यह AI को एक फिल्म की पूरी स्क्रिप्ट को फिर से लिखने, कॉस्ट्यूम बदलने और सभी दृश्यों को फिर से शूट करने के लिए कहने जैसा है, वह भी एक ही बार में।
  • नियम: AI "आंसर की" (सॉफ्टवेयर के नए वर्जन) को नहीं देख सकता। उसे केवल निर्देशों के आधार पर इसे समझना होगा।

3. परिणाम: AI अभी भी एक "जूनियर" है

शोधकर्ताओं ने उपलब्ध 13 सबसे स्मार्ट AI मॉडल्स का परीक्षण किया (Anthropic, OpenAI और Google जैसी कंपनियों के नवीनतम वर्जन्स सहित)। उन्होंने इन मॉडल्स को ROADMAPBENCH टेस्ट के माध्यम से परखा।

परिणाम चौंकाने वाले थे:

  • यहाँ तक कि सबसे स्मार्ट AI (Claude-Opus-4.7) भी केवल 39.1% कार्यों में सफल रहा।
  • सबसे कमजोर AI केवल 5.2% कार्यों में सफल रहा।

रूपक (Metaphor):
यदि आपने किसी मानव जूनियर डेवलपर को एक घर का रिनोवेशन करने के लिए कहा, और उसने केवल 10 में से 4 बार ही काम सही ढंग से पूरा किया, तो आप कहेंगे, "वे अभी सीख रहे हैं।" पेपर दिखाता है कि जटिल, लंबे समय तक चलने वाले सॉफ्टवेयर प्रोजेक्ट्स के मामले में हमारा सबसे उन्नत AI भी अभी "सीखने" के चरण में है।

4. वे कहाँ विफल होते हैं?

पेपर ने केवल विफलताओं को नहीं गिना; इसने यह भी देखा कि वे क्यों विफल हुए। उन्होंने मॉडल की "स्मार्टनेस" के आधार पर एक पैटर्न पाया:

  • मजबूत मॉडल्स (Stronger Models): वे आमतौर पर कोड को कंपाइल (बिल्ड) करने में सफल रहे और अधिकांश फीचर्स लिख सके। लेकिन वे बारीकियों (Details) में विफल रहे। यह ऐसा है जैसे उन्होंने एक शानदार घर बनाया, लेकिन दरवाजे का हैंडल गलत तरफ लगा है, या लाइट स्विच वास्तव में लाइट चालू नहीं करता है। वे बड़े चित्र (Big Picture) को समझ गए लेकिन सूक्ष्म, सटीक लॉजिक को मिस कर गए।
  • कमजोर मॉडल्स (Weaker Models): वे अक्सर घर बनाने में भी सक्षम नहीं थे। वे छत लगाना भूल गए, या उन्होंने किचन को बेसमेंट में रखने की कोशिश की। वे बुनियादी निर्माण स्तर पर ही विफल रहे।

5. यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

लेखकों का तर्क है कि हमें AI को "टाइपो फिक्स" पर टेस्ट करना बंद कर देना चाहिए क्योंकि यह हमें सुरक्षा का एक झूठा अहसास देता है। सिर्फ इसलिए कि एक AI एक बग को ठीक कर सकता है, इसका मतलब यह नहीं है कि वह एक नया फीचर बना सकता है।

ROADMAPBENCH एक नया, ईमानदार पैमाना है। यह हमें बताता है कि हालांकि AI बेहतर हो रहा है, लेकिन लंबे, जटिल, मल्टी-स्टेप सॉफ्टवेयर प्रोजेक्ट्स को संभालने की क्षमता अभी भी एक बड़ी, अनसुलझी चुनौती है। AI वर्तमान में एक बहुत ही प्रतिभाशाली प्रशिक्षु (Apprentice) की तरह है जो कुछ चरणों के लिए निर्देशों का पालन अच्छी तरह से कर सकता है, लेकिन जब प्रोजेक्ट बहुत बड़ा और जटिल हो जाता है, तो वह भ्रमित हो जाता है।

सारांश

  • पुराने टेस्ट: "क्या आप इस एक गलत शब्द को ठीक कर सकते हैं?" (AI: हाँ!)
  • ROADMAPBENCH: "यहाँ एक पूरे सॉफ्टवेयर सिस्टम को अपग्रेड करने की योजना है। क्या आप इसे कर सकते हैं?" (AI: मैं कोशिश कर सकता हूँ, लेकिन मैं बारीकियों में गड़बड़ी कर दूँगा या कोई स्टेप भूल जाऊँगा।)
  • निष्कर्ष: हम अभी वहाँ नहीं पहुँचे हैं। AI स्मार्ट है, लेकिन यह अभी किसी बड़े सॉफ्टवेयर प्रोजेक्ट का लीड इंजीनियर बनने के लिए तैयार नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →