When Does Restricting a Coding Agent to execute_code Help? A Regime Agent-Design Ablation
यह शोध पत्र प्रदर्शित करता है कि कोडिंग एजेंटों को केवल एक `execute_code` टूल तक सीमित रखना अक्सर टूल-समृद्ध वातावरण का उपयोग करने जितना ही प्रभावी और अक्सर उससे सस्ता होता है, जो यह प्रकट करता है कि इष्टतम टूल सतह (tool surface) अकेले किसी भी कारक के बजाय कार्य व्यवस्था (task regimes) और विशिष्ट एजेंट डिज़ाइनों के बीच परस्पर क्रिया द्वारा संयुक्त रूप से निर्धारित होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट असिस्टेंट है जिसका काम टूटे हुए कोड को ठीक करना या गणित की पहेलियाँ सुलझाना है। अभी, टेक की दुनिया में इस बात पर एक बड़ी बहस चल रही है कि यह रोबोट काम पूरा करने के लिए कंप्यूटर से कैसे बात करना चाहिए।
कुछ लोग कहते हैं, "इसे एक पूरा टूलबॉक्स दें जिसमें हर काम के लिए विशेष बटन हों!" (एक फैंसी IDE की तरह)।
दूसरे कहते हैं, "बस इसे एक कमांड लाइन दे दें और इसे शेल कमांड टाइप करने दें!" (एक फिल्म के हैकर की तरह)।
तीसरा समूह कहता है, "नहीं! बस रोबोट को एक पायथन स्क्रिप्ट लिखने दें और उसे एक साथ चलाने दें!" (execute_code वाला तरीका)।
यह पेपर एक विशाल, निष्पक्ष रेफरी की तरह है जो यह देखने के लिए एक दौड़ आयोजित करता है कि कौन सा तरीका वास्तव में पैसा बचाता है और काम को सफलतापूर्वक पूरा करता है। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने बिल्कुल एक ही रोबोट (दो अलग-अलग मॉडल: क्लॉड और कोडेक्स) को बिल्कुल एक ही कार्यों पर चलाया, लेकिन केवल उन उपकरणों को बदल दिया जिनका उपयोग करने की उन्हें अनुमति थी।
यहाँ उन्हें क्या मिला, जिसे सरल कहानियों में तोड़कर बताया गया है।
मुख्य खोज: यह रोबोट और काम पर निर्भर करता है
सबसे बड़ा आश्चर्य? कोई एक "सर्वश्रेष्ठ" टूल नहीं है। विजेता इस बात पर बदल जाता है कि रोबोट कौन है और वह क्या कर रहा है।
इसे इस तरह सोचें:
"गणित की पहेली" वाला काम (आर्टिफैक्ट टास्क): यदि रोबोट गणना या डेटा क्रंचिंग कर रहा है, तो "एक स्क्रिप्ट लिखें और उसे चलाएं" वाला तरीका स्पष्ट विजेता है। यह एक ऐसे शेफ को काम पर रखने जैसा है जो बस एक आदर्श रेसिपी लिखता है और एक बार में पूरा भोजन तैयार करता है।
- Claude रोबोट के लिए, इस तरीके ने लागत में 24.6% की बचत की।
- Codex रोबोट के लिए, इसने लगभग 6.7% की बचत की (हालांकि पेपर कहता है कि यह थोड़ा संदिग्ध है, जैसे कि एक सिक्के का उछाल)।
- निर्णय: गणित और डेटा के लिए, स्क्रिप्ट वाला तरीका सस्ता है और समस्या को हल करने में उतना ही अच्छा है।
"एक अव्यवस्थित कोडबेस को ठीक करने" वाला काम (SWE-bench टास्क): यह वह जगह है जहाँ चीजें पेचीदा हो जाती हैं। इन कार्यों में एक जटिल प्रोजेक्ट में कई फाइलों को संपादित करना शामिल है।
- यदि आप Codex रोबोट का उपयोग करते हैं: स्क्रिप्ट वाला तरीका अभी भी चैंपियन है! इसने लागत में 19.9% की बचत की। क्यों? क्योंकि स्क्रिप्ट वाला तरीका रोबोट को कई छोटे अनुरोधों को एक बड़े पैकेज में समेटने की अनुमति देता है, जैसे कि 50 बार पैदल चलने के बजाय एक डिलीवरी ट्रक द्वारा 50 पैकेज ले जाना।
- यदि आप Claude रोबोट का उपयोग करते हैं: ओह! स्क्रिप्ट वाला तरीका वास्तव में अधिक महंगा ( 14.4% अधिक) हो गया, हालांकि पेपर नोट करता है कि यह एक सांख्यिकीय रूप से "सिद्ध" अंतर नहीं था, बस एक मजबूत रुझान था। क्यों? क्योंकि Claude के लिए, एक फ़ाइल को संपादित करने के लिए स्क्रिप्ट लिखना एक कार बदलने के लिए पहले नई कार बनाने की कोशिश करने जैसा है। इसमें बदलाव को कोड में समझाने के लिए बहुत अधिक शब्दों (टोकन) की आवश्यकता होती है, जिससे "एडिट फ्रिक्शन" (संपादन घर्षण) पैदा होता है।
यह पेपर किसे खारिज करता है
पेपर स्पष्ट रूप से इस विचार का खंडन करता है कि एक टूल हमेशा सभी के लिए बेहतर होता है।
- यह खारिज करता है: "विशेष IDE बटन हमेशा आवश्यक होते हैं।" (क्योंकि स्क्रिप्ट विधि Codex पर जीती)।
- यह खारिज करता है: "Bash कमांड हमेशा पर्याप्त होते हैं।" (क्योंकि गणित कार्यों के लिए Claude के लिए स्क्रिप्ट विधि सस्ती थी)।
- यह खारिज करता है: "कोड निष्पादन (Code execution) हमेशा सबसे सस्ता होता है।" (क्योंकि जटिल कोड सुधारों के लिए यह Claude के लिए अधिक महंगा था)।
लेखक बहुत स्पष्ट हैं: आप केवल टूल के आधार पर टूल नहीं चुन सकते। आपको रोबोट के दिमाग और काम के प्रकार के संयोजन को देखना होगा।
"पास रेट" का आश्चर्य
यहाँ सबसे महत्वपूर्ण बात है: लागत बदल गई, लेकिन सफलता दर नहीं।
दो धावकों की कल्पना करें। एक भारी जूतों में दौड़ता है (महंगे उपकरण), और दूसरा स्नीकर्स में दौड़ता है (सस्ते उपकरण)। पेपर ने पाया कि दोनों धावक बिल्कुल एक ही गति से दौड़ पूरी करते हैं।
- चाहे रोबोट ने फैंसी टूलबॉक्स का उपयोग किया हो, Bash कमांड का, या स्क्रिप्ट विधि का, उनके द्वारा सही ढंग से हल किए गए कार्यों का प्रतिशत लगभग समान था ( 3 प्रतिशत अंक के भीतर)।
- "स्क्रिप्ट" विधि ने रोबोट को स्मार्ट या मूर्ख नहीं बनाया; इसने बस फिनिश लाइन तक पहुँचने के उसके तरीके को बदल दिया। कभी-कभी वह चलना एक स्प्रिंट (सस्ता) था, और कभी-कभी वह लड़खड़ाहट (महंगा) था।
लागत क्यों बदली?
पेपर इस बात की गहराई में जाता है कि स्क्रिप्ट विधि सस्ती या महंगी क्यों थी।
- "एडिट फ्रिक्शन" टैक्स (Claude के लिए): जब Claude को एक फ़ाइल को ठीक करने के लिए स्क्रिप्ट विधि का उपयोग करना पड़ा, तो उसे केवल "लाइन 5 बदलें" कहने के लिए एक लंबी पायथन स्क्रिप्ट लिखनी पड़ी। इसने बहुत सारे "आउटपुट टोकन" (शब्द जो रोबोट को टाइप करने थे) का उपयोग किया। यह हर बार पेज पलटने के लिए टोल देने जैसा था। यह ज्यादातर उन कार्यों पर हुआ जहाँ रोबोट विफल हुआ या संघर्ष कर रहा था, जिससे वे विशिष्ट रन बहुत महंगे हो गए।
- "बैचिंग" बोनस (Codex के लिए): जब Codex ने स्क्रिप्ट विधि का उपयोग किया, तो वह एक स्क्रिप्ट में कई छोटे कमांड पैक कर सका। कंप्यूटर से "फ़ाइल A पढ़ें," फिर "फ़ाइल B पढ़ें," फिर "फ़ाइल C पढ़ें" (तीन अलग-अलग यात्राएं) पूछने के बजाय, उसने एक बार में "A, B और C पढ़ें" पूछा। इसने बहुत सारे "इनपुट टोकन" (शब्द जो रोबोट को पढ़ने थे) की बचत की।
- "डूम्ड रन" (विफल रन) प्रभाव: कोड-फिक्सिंग कार्यों पर Claude के लिए अतिरिक्त लागत मुख्य रूप से तब हुई जब रोबोट पहले से ही विफल होने वाला था। यह एक कार के चक्कर काटते समय ईंधन खत्म होने जैसा था। स्क्रिप्ट विधि ने विफलता का कारण नहीं बनाया; इसने केवल असफल प्रयास को अधिक महंगा बना दिया।
हम कितने आश्वस्त हैं?
लेखक गणित कार्यों और Codex रोबोट परिणामों के बारे में बहुत आश्वस्त हैं। उन्होंने इन परीक्षणों को 93 गणित कार्यों और 100 कोड-फिक्सिंग कार्यों पर चलाया, प्रत्येक के लिए तीन "सीड्स" (रैंडम शुरुआती बिंदु) का उपयोग किया ताकि यह सुनिश्चित हो सके कि परिणाम केवल भाग्य नहीं थे। कोड-फिक्सिंग कार्यों पर Codex के लिए बचत सांख्यिकीय रूप से महत्वपूर्ण थी (एक 19.9% की गिरावट, p-वैल्यू 2.0 × 10⁻⁹ के साथ, जो मूल रूप से रैंडम होने की शून्य संभावना है)।
हालाँकि, कोड-फिक्सिंग कार्यों पर Claude रोबोट के लिए, परिणाम थोड़ा धुंधला है। लागत 14.4% बढ़ गई, लेकिन सांख्यिकीय परीक्षण ने कहा कि यह एक "स्लैम डंक" प्रमाण नहीं था (p-वैल्यू 0.12)। लेखक इसे "दिशात्मक" कहते हैं, जिसका अर्थ है कि रुझान मौजूद है, लेकिन उन्हें 100% सुनिश्चित होने के लिए इसे और अधिक बार चलाने की आवश्यकता होगी कि यह कोई इत्तेफाक नहीं है।
निचोड़
यदि आप एक कोडिंग एजेंट बना रहे हैं:
- अनुमान न लगाएं। "सर्वश्रेष्ठ" टूल आपके विशिष्ट रोबोट और आपके विशिष्ट कार्य पर निर्भर करता है।
- गणित/डेटा के लिए: "स्क्रिप्ट लिखें" विधि को आजमाएं। यह सस्ता है और उतना ही अच्छा काम करता है।
- कोड सुधार के लिए: यह निर्भर करता है। यदि आप Codex का उपयोग करते हैं, तो स्क्रिप्ट विधि बेहतरीन है। यदि आप Claude का उपयोग करते हैं, तो आप मानक संपादन उपकरणों को बनाए रखना चाह सकते हैं, विशेष रूप से कठिन समस्याओं के लिए, क्योंकि स्क्रिप्ट विधि "एडिट फ्रिक्शन" में फंस सकती है।
- बुद्धिमत्ता की चिंता न करें: टूल्स को बदलने से आपका रोबोट स्मार्ट या मूर्ख नहीं बनेगा; यह केवल यात्रा के मूल्य टैग को बदल देगा।
पेपर निष्कर्ष निकालता है कि एजेंट चलाने का "सबसे सस्ता" तरीका एक सार्वभौमिक नियम नहीं है; यह एक पहेली है जहाँ आपको टूल को रोबोट और कार्य के साथ मिलाना होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।