CODESTRUCT: Code Agents over Structured Action Spaces
यह शोधपत्र CODESTRUCT को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो अनस्ट्रक्चर्ड टेक्स्ट के बजाय स्ट्रक्चर्ड AST एंटिटीज पर कार्य करके LLM-आधारित कोड एजेंटों को बेहतर बनाता है, जिसके परिणामस्वरूप कई बेंचमार्क में सटीकता में सुधार और टोकन की खपत में कमी आती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जटिल मशीन के लिए 500 पन्नों वाले एक विशाल निर्देश मैनुअल (instruction manual) में एक विशिष्ट टाइपो (typo) को ठीक करने की कोशिश कर रहे हैं।
पुराना तरीका (Text-Based Agents):
वर्तमान में, AI कोड एजेंट एक बहुत तेज़ लेकिन थोड़े अनाड़ी लाइब्रेरियन की तरह काम करते हैं जो मैनुअल को केवल टेक्स्ट के एक विशाल ब्लॉक के रूप में देखते हैं। उस टाइपो को खोजने के लिए, लाइब्रेरियन को:
- सही अध्याय खोजने के लिए पेज 1 से 500 तक पूरा मैनुअल पढ़ना होगा।
- सटीक वाक्य खोजने के लिए हर एक लाइन की गिनती करनी होगी।
- पूरे 50 पन्नों के अध्याय को कॉपी करना होगा, टाइपो को हटाना होगा, और फिर से वह पूरा अध्याय पेस्ट करना होगा।
समस्या: यदि मैनुअल का फॉन्ट थोड़ा अलग है, या कोई अतिरिक्त स्पेस है, या लाइब्रेरियन ने एक लाइन भी गलत गिन ली, तो पूरी प्रक्रिया विफल हो जाएगी। मशीन खराब हो जाएगी, और लाइब्रेरियन को फिर से शुरुआत करनी होगी। यह धीमा है, महंगा है (500 पन्ने पढ़ने में समय लगता है), और गलतियों की संभावना अधिक है।
नया तरीका (CODESTRUCT):
यह शोध पत्र CODESTRUCT पेश करता है, जो खेल बदल देता है। कोड को टेक्स्ट के एक ब्लॉक के रूप में देखने के बजाय, यह कोड को एक लेगो सेट (Lego set) या नामित शाखाओं वाले पेड़ (tree with named branches) की तरह मानता है।
इस नए सिस्टम में, AI "टेक्स्ट की लाइनों" को नहीं देखता। यह नामित हिस्सों (named parts) को देखता है।
- यह कहने के बजाय कि "लाइन 45 से 89 को डिलीट करें," AI कहता है, "
authenticateनामक फंक्शन को डिलीट करें।" - पूरे फ़ाइल को पढ़ने के बजाय, यह सिस्टम से पूछता है, "मुझे
authenticateफंक्शन दिखाएं।"
दो जादुई उपकरण (Two Magic Tools)
लेखकों ने इसे संभव बनाने के लिए दो विशेष उपकरण बनाए हैं:
readCode(लक्षित खोज - The Targeted Search):- उपमा: कल्पना कीजिए कि आपके पास लाइब्रेरी के लिए एक स्मार्ट इंडेक्स कार्ड है। गलियारे में चलकर हर किताब का कवर पढ़ने के बजाय, आप बस "लेखक X की किताब" मांगते हैं। लाइब्रेरियन आपको केवल वही किताब थमा देता है।
- यह कैसे मदद करता है: AI को ठीक वही कोड मिलता है जिसकी उसे आवश्यकता है (जैसे कि एक विशिष्ट फंक्शन या क्लास), बिना अप्रासंगिक टेक्स्ट के बीच भटके। यह "पढ़ने" के समय और पैसे दोनों को बचाता है।
editCode(सर्जिकल रिप्लेसमेंट - The Surgical Swap):- उपमा: कल्पना कीजिए कि आप एक रेसिपी (नुस्खा) को एडिट कर रहे हैं। क्योंकि आप "1 कप चीनी" को "1 कप शहद" से बदलना चाहते हैं, इसलिए पूरी कुकबुक का पन्ना दोबारा लिखने के बजाय, आप बस उस एक सामग्री को बदल देते हैं। सिस्टम जानता है कि वह सामग्री कहाँ है और यह सुनिश्चित करता है कि बाकी रेसिपी एकदम सही रहे।
- यह कैसे मदद करता है: AI सीधे "संरचना" (structure) में बदलाव करता है। यह गलती से कोड के सिंटैक्स (व्याकरण) को नहीं तोड़ सकता क्योंकि यह बदलाव को लागू करने से पहले गणित की जांच करता है।
यह क्यों महत्वपूर्ण है (परिणाम)
शोधकर्ताओं ने वास्तविक दुनिया की कोडिंग समस्याओं (जैसे बड़े सॉफ्टवेयर प्रोजेक्ट्स में बग फिक्स करना) पर इसका परीक्षण किया। यहाँ क्या हुआ:
- कम "पढ़ना", अधिक "काम करना": AI एजेंटों ने अप्रासंगिक फ़ाइलों को पढ़ने में समय बर्बाद करना बंद कर दिया। उन्होंने समस्याओं को हल करने के लिए आवश्यक कंप्यूटिंग पावर (टोकन) में 12% से 38% तक की बचत की।
- कम गलतियाँ: क्योंकि AI लाइनों की गिनती नहीं कर रहा था या टेक्स्ट पैटर्न से मिलान करने की कोशिश नहीं कर रहा था, इसलिए इसने बहुत कम "खाली पैच" (empty patch) त्रुटियां कीं (जहाँ वह कुछ ठीक करने की कोशिश करता है लेकिन उसे ढूंढने में विफल रहता है)।
- "छोटे दिमाग" को बढ़ावा (The "Small Brain" Boost): दिलचस्प बात यह है कि छोटे, सस्ते AI मॉडल को सबसे अधिक लाभ हुआ। एक छोटे मॉडल की सफलता दर में 20% का सुधार हुआ! वास्तव में, छोटे मॉडल अक्सर इसलिए विफल होते हैं क्योंकि वे अव्यवस्थित टेक्स्ट से भ्रमित हो जाते हैं। जब आप उन्हें एक साफ, संरचित मानचित्र (जैसे कि ट्री डायग्राम) देते हैं, तो वे बहुत बेहतर प्रदर्शन करते हैं।
बड़ी तस्वीर (The Big Picture)
CODESTRUCT को एक रोबोट को नग्न आंखों (केवल कच्चा टेक्स्ट देखना) से एक्स-रे विजन (अंतर्निहित संरचना देखना) में अपग्रेड करने के रूप में देखें।
पहले, कोडिंग एजेंट कार के मालिक के मैनुअल को एक-एक लाइन करके पढ़ने वाले लोगों की तरह थे। CODESTRUCT उन्हें एक डायग्नोस्टिक कंप्यूटर देता है जो उन्हें अनुमति देता है कि वे कहें, "स्पार्क प्लग बदलें," और कंप्यूटर बिना ट्रांसमिशन को अनबोल्ट किए, इसे पूरी तरह से कर देता है।
यह कोडिंग एजेंटों को तेज़, सस्ता और बहुत अधिक विश्वसनीय बनाता है, विशेष रूप से उन छोटे, अधिक किफायती AI मॉडलों के लिए जिन्हें हम रोजमर्रा के कार्यों के लिए उपयोग करना चाहते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।