RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades
RoadmapBench वास्तविक ओपन-सोर्स वर्ज़न अपग्रेड्स पर आधारित 115 जटिल, लॉन्ग-होराइजन कोडिंग कार्यों के एक बेंचमार्क को पेश करता है ताकि यह प्रदर्शित किया जा सके कि वर्तमान फ्रंटियर एआई एजेंट बड़े पैमाने पर, मल्टी-टारगेट सॉफ्टवेयर डेवलपमेंट के साथ काफी संघर्ष करते हैं, जो सबसे उन्नत मॉडल्स के साथ भी 40% से कम कार्यों को हल कर पाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप सुपर-स्मार्ट, AI-संचालित जूनियर डेवलपर्स की एक टीम को काम पर रख रहे हैं। आप यह जानना चाहते हैं कि क्या वे वास्तव में एक असली काम को संभाल सकते हैं: केवल किसी रेसिपी में एक टाइपो (लिखने की गलती) को ठीक करना ही नहीं, बल्कि एक विशाल, 500 पन्नों की कुकबुक को पूरी तरह से फिर से लिखना, जिसमें नए अध्याय जोड़ने हों, सामग्री मापने के तरीके बदलने हों, और खराब ओवन को ठीक करना हो—और यह सब करते हुए भी यह सुनिश्चित करना हो कि पुराने वर्जन का उपयोग करने वाले लोगों के लिए पुरानी रेसिपी चलती रहे।
यह बिल्कुल ROADMAPBENCH पेपर के बारे में है।
यहाँ इस पेपर का सरल शब्दों में विवरण दिया गया है:
1. समस्या: "टाइपो" बनाम "रिनोवेशन"
लंबे समय से, हम AI कोडिंग असिस्टेंट को छोटे, आसान कार्यों पर टेस्ट करते रहे हैं। यह ऐसा है जैसे पूछना, "क्या आप इस पैराग्राफ में इस एक वाक्य को ठीक कर सकते हैं?" AI आमतौर पर कहता है, "हाँ!" और उसे A+ मिलता है।
लेकिन वास्तविक दुनिया में, सॉफ्टवेयर डेवलपमेंट केवल एक वाक्य ठीक करने के बारे में नहीं है। यह एक गगनचुंबी इमारत का नवीनीकरण (Renovation) करने के बारे में है। आपको प्लंबिंग, इलेक्ट्रिकल वायरिंग और लिफ्ट सिस्टम को एक साथ 50 अलग-अलग मंजिलों पर बदलना होगा, बिना इमारत को ढहाए।
लेखकों ने महसूस किया कि मौजूदा टेस्ट बहुत आसान थे। वे एक आर्किटेक्ट से एक टपकते नल को ठीक करने के लिए पूछने जैसे थे, जबकि असली काम एक अस्पताल के लिए नया विंग डिजाइन करना है। इसलिए, उन्होंने एक नया, बहुत कठिन टेस्ट बनाया जिसे ROADMAPBENCH कहा जाता है।
2. नया टेस्ट: "वर्जन अपग्रेड" की चुनौती
बग ठीक करने के लिए कहने के बजाय, ROADMAPBENCH AI को एक रोडमैप (Roadmap) देता है।
- सेटअप: AI को एक वास्तविक सॉफ्टवेयर प्रोजेक्ट (जैसे कि कोई लोकप्रिय ओपन-सोर्स टूल) के पुराने वर्जन के साथ एक डिजिटल वर्कशॉप में छोड़ दिया जाता है।
- मिशन: AI को एक "रोडमैप" दस्तावेज़ दिया जाता है। यह दस्तावेज़ कहता है, "इस सॉफ्टवेयर के अगले वर्जन में, हमें ये 5 नए फीचर्स जोड़ने हैं, इन 3 चीजों के काम करने के तरीके को बदलना है, और ये 2 बग्स ठीक करने हैं।"
- पैमाना (Scale): यह कोई छोटा बदलाव नहीं है। औसतन, AI को 51 अलग-अलग फाइलों में 3,700 लाइनों का कोड फिर से लिखना पड़ता है। यह AI को एक फिल्म की पूरी स्क्रिप्ट को फिर से लिखने, कॉस्ट्यूम बदलने और सभी दृश्यों को फिर से शूट करने के लिए कहने जैसा है, वह भी एक ही बार में।
- नियम: AI "आंसर की" (सॉफ्टवेयर के नए वर्जन) को नहीं देख सकता। उसे केवल निर्देशों के आधार पर इसे समझना होगा।
3. परिणाम: AI अभी भी एक "जूनियर" है
शोधकर्ताओं ने उपलब्ध 13 सबसे स्मार्ट AI मॉडल्स का परीक्षण किया (Anthropic, OpenAI और Google जैसी कंपनियों के नवीनतम वर्जन्स सहित)। उन्होंने इन मॉडल्स को ROADMAPBENCH टेस्ट के माध्यम से परखा।
परिणाम चौंकाने वाले थे:
- यहाँ तक कि सबसे स्मार्ट AI (Claude-Opus-4.7) भी केवल 39.1% कार्यों में सफल रहा।
- सबसे कमजोर AI केवल 5.2% कार्यों में सफल रहा।
रूपक (Metaphor):
यदि आपने किसी मानव जूनियर डेवलपर को एक घर का रिनोवेशन करने के लिए कहा, और उसने केवल 10 में से 4 बार ही काम सही ढंग से पूरा किया, तो आप कहेंगे, "वे अभी सीख रहे हैं।" पेपर दिखाता है कि जटिल, लंबे समय तक चलने वाले सॉफ्टवेयर प्रोजेक्ट्स के मामले में हमारा सबसे उन्नत AI भी अभी "सीखने" के चरण में है।
4. वे कहाँ विफल होते हैं?
पेपर ने केवल विफलताओं को नहीं गिना; इसने यह भी देखा कि वे क्यों विफल हुए। उन्होंने मॉडल की "स्मार्टनेस" के आधार पर एक पैटर्न पाया:
- मजबूत मॉडल्स (Stronger Models): वे आमतौर पर कोड को कंपाइल (बिल्ड) करने में सफल रहे और अधिकांश फीचर्स लिख सके। लेकिन वे बारीकियों (Details) में विफल रहे। यह ऐसा है जैसे उन्होंने एक शानदार घर बनाया, लेकिन दरवाजे का हैंडल गलत तरफ लगा है, या लाइट स्विच वास्तव में लाइट चालू नहीं करता है। वे बड़े चित्र (Big Picture) को समझ गए लेकिन सूक्ष्म, सटीक लॉजिक को मिस कर गए।
- कमजोर मॉडल्स (Weaker Models): वे अक्सर घर बनाने में भी सक्षम नहीं थे। वे छत लगाना भूल गए, या उन्होंने किचन को बेसमेंट में रखने की कोशिश की। वे बुनियादी निर्माण स्तर पर ही विफल रहे।
5. यह क्यों महत्वपूर्ण है (पेपर के अनुसार)
लेखकों का तर्क है कि हमें AI को "टाइपो फिक्स" पर टेस्ट करना बंद कर देना चाहिए क्योंकि यह हमें सुरक्षा का एक झूठा अहसास देता है। सिर्फ इसलिए कि एक AI एक बग को ठीक कर सकता है, इसका मतलब यह नहीं है कि वह एक नया फीचर बना सकता है।
ROADMAPBENCH एक नया, ईमानदार पैमाना है। यह हमें बताता है कि हालांकि AI बेहतर हो रहा है, लेकिन लंबे, जटिल, मल्टी-स्टेप सॉफ्टवेयर प्रोजेक्ट्स को संभालने की क्षमता अभी भी एक बड़ी, अनसुलझी चुनौती है। AI वर्तमान में एक बहुत ही प्रतिभाशाली प्रशिक्षु (Apprentice) की तरह है जो कुछ चरणों के लिए निर्देशों का पालन अच्छी तरह से कर सकता है, लेकिन जब प्रोजेक्ट बहुत बड़ा और जटिल हो जाता है, तो वह भ्रमित हो जाता है।
सारांश
- पुराने टेस्ट: "क्या आप इस एक गलत शब्द को ठीक कर सकते हैं?" (AI: हाँ!)
- ROADMAPBENCH: "यहाँ एक पूरे सॉफ्टवेयर सिस्टम को अपग्रेड करने की योजना है। क्या आप इसे कर सकते हैं?" (AI: मैं कोशिश कर सकता हूँ, लेकिन मैं बारीकियों में गड़बड़ी कर दूँगा या कोई स्टेप भूल जाऊँगा।)
- निष्कर्ष: हम अभी वहाँ नहीं पहुँचे हैं। AI स्मार्ट है, लेकिन यह अभी किसी बड़े सॉफ्टवेयर प्रोजेक्ट का लीड इंजीनियर बनने के लिए तैयार नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।