EvoClaw: Evaluating AI Agents on Continuous Software Evolution
यह शोध पत्र EvoClaw को प्रस्तुत करता है, जो निरंतर सॉफ़्टवेयर विकास (continuous software evolution) पर AI एजेंटों का मूल्यांकन करने के लिए DeepCommit पाइपलाइन का उपयोग करने वाला एक नवीन बेंचमार्क है, जो एक महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है जहाँ एजेंटों की सफलता दर अलग-थलग कार्यों से दीर्घकालिक रखरखाव परिदृश्यों में काफी कम हो जाती है क्योंकि वे त्रुटि प्रसार (error propagation) और तकनीकी ऋण (technical debt) के साथ संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ EvoClaw पेपर का विवरण दिया गया है, जिसे रोजमर्रा की भाषा में उपमाओं (analogies) का उपयोग करके अनुवादित किया गया है।
मुख्य विचार: "एक बार के" कार्यों से "लंबे सफर" की ड्राइविंग तक
कल्पना कीजिए कि आप अपने घर को ठीक करने के लिए एक रोबोट को काम पर रख रहे हैं।
- पुराने बेंचमार्क (एक "वन-ऑफ" टेस्ट): आप रोबोट से कहते हैं "नल ठीक कर दो।" वह इसे बखूबी करता है। आप उससे कहते हैं "दरवाजे पर पेंट कर दो।" वह यह भी कर देता है। आप उसे 10/10 का स्कोर देते हैं।
- वास्तविकता (निरंतर विकास/Continuous Evolution): वास्तविक दुनिया में, आप सिर्फ एक चीज़ ठीक करके नहीं छोड़ देते। आप नल ठीक करते हैं, फिर आपको एहसास होता है कि पाइप पुराने हैं और उन्हें बदलने की ज़रूरत है, जिससे दीवार खराब हो जाती है, जिसके लिए दोबारा पेंटिंग की आवश्यकता होती है, जिससे नींव में दरार दिखाई देती है। रोबोट को महीनों तक उसी घर पर काम करना पड़ता है, आज की समस्या को हल करने की कोशिश करते हुए कल के द्वारा किए गए कचरे से जूझना पड़ता है।
EvoClaw एक नया परीक्षण है यह देखने के लिए बनाया गया है कि क्या AI एजेंट अलग-अलग कार्यों में कुशल होने के बजाय इस "लंबे सफर" की वास्तविकता को संभाल सकते हैं।
समस्या: "स्नोबॉल इफेक्ट" (बर्फ के गोले का प्रभाव)
पेपर में एक चौंकाने वाला सच सामने आया है: AI एजेंट शुरुआत करने में तो बहुत अच्छे हैं, लेकिन खत्म करने में बहुत खराब हैं।
जब उन्हें एकल, अलग-थलग कार्यों (जैसे केवल नल ठीक करना) पर टेस्ट किया जाता है, तो शीर्ष AI मॉडल 80% से अधिक स्कोर करते हैं। लेकिन जब उन्हें एक निरंतर प्रोजेक्ट पर काम करने के लिए कहा जाता है जहाँ उन्हें अपने पिछले काम पर आगे बढ़ना होता है, तो उनका स्कोर गिरकर 40% से नीचे आ जाता है।
उपमा:
कल्पना कीजिए कि एक छात्र गणित की परीक्षा दे रहा है।
- अलग-थलग टेस्ट: वह 10 अलग-अलग, आसान सवाल हल करता है। उसे 'A' ग्रेड मिलता है।
- निरंतर टेस्ट: उसे सवाल 1 हल करना है, फिर सवाल 2 को हल करने के लिए सवाल 1 के उत्तर का उपयोग करना है, और इसी तरह।
- परिणाम: AI सवाल 1 पर एक छोटी सी गलती करता है। क्योंकि उसने उसे पकड़ा नहीं, इसलिए सवाल 2 का उत्तर गलत हो जाता है। सवाल 5 तक आते-आते, उत्तर इतना बिगड़ चुका होता है कि पूरी चीज़ ही ध्वस्त हो जाती है। AI नए फीचर्स बनाता रहता है, लेकिन वह पुराने फीचर्स को तोड़ देता है। इसे एरर एक्यूमुलेशन (Error Accumulation) या "स्नोबॉल इफेक्ट" कहा जाता है।
समाधान: DeepCommit (एक "स्मार्ट लाइब्रेरियन")
इसे ठीक से टेस्ट करने के लिए, शोधकर्ताओं को एक तरीके की आवश्यकता थी जिससे बिखरे हुए, वास्तविक दुनिया के कोड इतिहास को स्पष्ट निर्देशों के एक सेट में बदला जा सके। वास्तविक कोड इतिहास एक अराजक डायरी की तरह होता है: "स्पेलिंग ठीक की," "एक फीचर जोड़ा," "एक फाइल डिलीट की," "ओह, इससे कुछ टूट गया, चलो इसे वापस लेते हैं।"
उन्होंने DeepCommit नामक एक टूल बनाया।
उपमा:
एक अराजक निर्माण स्थल (construction site) के बारे में सोचें जहाँ सैकड़ों मजदूर एक-दूसरे पर चिल्ला रहे हों।
- रॉ कमिट्स (Raw Commits): मजदूरों की व्यक्तिगत आवाजें ("वह ईंट हटाओ," "उस दीवार को पेंट करो," "ओह, ईंट गिरा दी")।
- DeepCommit: एक स्मार्ट फोरमैन (सुपरवाइजर) जो सभी शोर को सुनता है, शोर (जैसे स्पेलिंग ठीक करना) को अनदेखा करता है, और काम को तार्किक माइलस्टोन्स (Milestones) में समूहित करता है।
- माइलस्टोन 1: "नींव बनाना।"
- माइलस्टोन 2: "दीवारों का ढांचा खड़ा करना।"
- माइलस्टोन 3: "छत लगाना।"
DeepCommit इन माइलस्टोन्स को एक मैप (DAG) में व्यवस्थित करता है जो दिखाता है कि क्या होने से पहले क्या होना चाहिए। यह एक बिखरे हुए इतिहास को एक स्पष्ट, चरण-दर-चरण रेसिपी में बदल देता है।
परीक्षण: EvoClaw (एक "अनंत निर्माण परियोजना")
DeepCommit का उपयोग करते हुए, उन्होंने EvoClaw बनाया, एक ऐसा बेंचमार्क जहाँ AI एजेंटों को एक सॉफ्टवेयर प्रोजेक्ट के लिए "फोरमैन" के रूप में कार्य करना होता है।
यह कैसे काम करता है:
- AI एक बेस कोड (खाली प्लॉट) के साथ शुरू करता है।
- उसे एक-एक करके कार्यों (माइलस्टोन्स) की एक धारा दी जाती है।
- उसे पिछले कार्यों को तोड़े बिना वर्तमान कार्य को पूरा करना होता है।
- यदि वह माइलस्टोन 5 पर काम करते समय माइलस्टोन 1 की किसी चीज़ को तोड़ देता है, तो पूरा प्रोजेक्ट विफल हो जाता है।
परिणाम:
- "न्यू फीचर" का जाल: AI नई चीजें जोड़ने में बहुत अच्छा है (Recall)। वह एक नया कमरा बना सकता है।
- "रिग्रेशन" की विफलता: AI पुरानी चीजों को चालू रखने में बहुत खराब है (Precision)। नया कमरा बनाते समय, वह अनजाने में किचन को गिरा देता है।
- फैसला: यहाँ तक कि सबसे स्मार्ट AI मॉडल (जैसे Claude Opus या GPT-5) भी समय के साथ एक कोडबेस को बनाए रखने में संघर्ष करते हैं। वे अपनी ही गलतियों को ठीक करने के चक्कर में फंस जाते हैं और अंततः थक जाते हैं।
मुख्य निष्कर्ष (कहानी की सीख)
- हमें AI को शून्य (vacuum) में टेस्ट करना बंद करना होगा। सिर्फ इसलिए कि एक AI एक फंक्शन लिख सकता है, इसका मतलब यह नहीं है कि वह एक साल तक एक सॉफ्टवेयर सिस्टम को मेंटेन कर सकता है।
- "स्नोबॉल" वास्तविक है। शुरुआत में होने वाली छोटी गलतियाँ बाद में जटिल काम करने की क्षमता को नष्ट कर देती हैं।
- एक्सप्लोरेशन (खोज) महत्वपूर्ण है। जो AI एजेंट सबसे अच्छा प्रदर्शन करते थे, वे केवल अंधाधुंध कोड नहीं टाइप करते थे। उन्होंने बदलाव करने से पहले कोडबेस को "पढ़ने" और "ब्लूप्रिंट चेक करने" (एक्सप्लोर करने) पर समय बिताया।
- वेरिफिकेशन (सत्यापन) नायक है। वे एजेंट जिन्होंने अपने काम को जांचने के लिए बार-बार टेस्ट चलाए (भले ही इससे उनकी गति धीमी हो गई), वे बहुत अधिक सफल रहे।
संक्षेप में
EvoClaw AI के लिए एक वास्तविकता की जाँच (reality check) है। यह दिखाता है कि जबकि हमारे AI एजेंट शानदार "वन-हिट वंडर्स" हैं, वे वर्तमान में "लंबे समय तक काम करने वाले कर्मचारी" बनने में अक्षम हैं जो वास्तविक दुनिया के सॉफ्टवेयर विकास की अव्यवस्था को नहीं संभाल सकते। हमें उन्हें अपनी गलतियों को प्रबंधित करना सिखाना होगा, इससे पहले कि हम उन्हें अपने डिजिटल इंफ्रास्ट्रक्चर की जिम्मेदारी सौंप सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।