AgentForge: Execution-Grounded Multi-Agent LLM Framework for Autonomous Software Engineering
यह शोध पत्र AgentForge को प्रस्तुत करता है, जो एक ओपन-सोर्स मल्टी-एजेंट फ्रेमवर्क है जो एक अनिवार्य सैंडबॉक्स्ड वातावरण के माध्यम से निष्पादन-आधारित सत्यापन (execution-grounded verification) को लागू करता है, और मुख्य पर्यवेक्षण संकेत (supervision signal) के रूप में निष्पादन फीडबैक का लाभ उठाकर SWE-Bench Lite पर 40.0% रिज़ॉल्यूशन दर प्राप्त करता है और सिंगल-एजेंट बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, बिखरी हुई वर्कशॉप में एक टूटी हुई मशीन को ठीक करने की कोशिश कर रहे हैं। आपके पास एक बहुत ही बुद्धिमान, लेकिन थोड़ा अति-आत्मविश्वासी प्रशिक्षु (apprentice) है जिसका नाम LLM (लार्ज लैंग्वेज मॉडल) है।
यह प्रशिक्षु यह अनुमान लगाने में माहिर है कि मशीन को कैसा दिखना चाहिए। यदि आप पूछते हैं, "मैं इस गियर को कैसे ठीक करूँ?" तो वह एक आदर्श दिखने वाली योजना और एक नया गियर डिज़ाइन लिख देगा। लेकिन समस्या यह है: प्रशिक्षु ने वास्तव में कभी रिंच (wrench) नहीं घुमाया है। वह केवल किताबों में जो पढ़ा है उसके आधार पर अनुमान लगा रहा है, न कि इस आधार पर कि जब मशीन वास्तव में चलती है तो क्या होता है। कभी-कभी, उनका "आदर्श" गियर कागज पर तो फिट बैठता है, लेकिन जब आप उसे उपयोग करने की कोशिश करते हैं तो वह पूरे इंजन को जाम कर देता है।
वर्तमान के अधिकांश AI सिस्टम इसी तरह के अकेले काम करने वाले प्रशिक्षु की तरह हैं। वे अनुमान लगाते हैं, कोड लिखते हैं, और बस यही उम्मीद करते हैं कि सब ठीक हो जाएगा।
AgentForge काम करने का एक नया तरीका है। एक अति-आत्मविश्वासी प्रशिक्षु के बजाय, AgentForge एक विशेषज्ञ निर्माण दल (specialized construction crew) तैयार करता है जो एक सुरक्षित, अलग परीक्षण कक्ष (एक "सैंडबॉक्स") में मिलकर काम करता है।
यहाँ यह क्रू (crew) कैसे काम करता है, इसका एक सरल उदाहरण दिया गया है:
1. पाँच विशेषज्ञ कार्यकर्ता
एक व्यक्ति द्वारा सब कुछ करने के बजाय, AgentForge काम को पाँच अलग-अलग भूमिकाओं में विभाजित करता है, जैसे कि एक मूवी प्रोडक्शन क्रू:
- द प्लानर (निर्देशक - The Director): इससे पहले कि कोई औज़ार छुए, यह एजेंट टूटी हुई मशीन और ब्लूप्रिंट को देखता है। वे कोड नहीं लिखते; वे एक चरण-दर-चरण स्क्रिप्ट लिखते हैं: "पहले, हमें इंजन ब्लॉक की जाँच करनी होगी। फिर, हमें स्पार्क प्लग बदलना होगा। अंत में, हमें ब्रेक का परीक्षण करना होगा।"
- द कोडर (मैकेनिक - The Mechanic): यह एजेंट निर्देशक की स्क्रिप्ट का पालन करता है। वे पूरी कार को दोबारा नहीं लिखते; वे बस उस विशिष्ट टूटे हुए हिस्से को बदलते हैं (एक "पैच")। वे सावधान रहते हैं कि केवल उतना ही बदलें जितना आवश्यक है।
- द टेस्टर (क्वालिटी इंस्पेक्टर - The Quality Inspector): एक बार जब मैकेनिक हिस्सा बदल देता है, तो इंस्पेक्टर केवल उसे देखता नहीं है। वे इंजन चलाते हैं। वे यह देखने के लिए कार चलाने की कोशिश करते हैं कि क्या यह वास्तव में काम करती है। यदि कार बंद हो जाती है, तो वे चिल्लाते हैं, "यह टूटा हुआ है!" और मैकेनिक को सटीक एरर लॉग (error log) देते हैं।
- द डिबगर (फिक्सर - The Debugger): यदि इंस्पेक्टर कहता है कि यह टूटा हुआ है, तो फिक्सर हस्तक्षेप करता है। वे एरर लॉग को देखते हैं, पता लगाते हैं कि क्या गलत हुआ, और मरम्मत का एक अलग तरीका आज़माते हैं। वे तब तक प्रयास करते रहते हैं जब तक कि कार सुचारू रूप से न चलने लगे।
- द क्रिटिक (अंतिम निर्णायक - The Final Judge): एक बार जब कार चल पड़ती है, तो जज पूरी प्रक्रिया को देखता है। क्या हमने समस्या को ठीक किया? क्या हमने कुछ और तो नहीं तोड़ दिया? यदि हाँ, तो वे काम को मंजूरी देते हैं।
2. "सुरक्षित कमरा" (द सैंडबॉक्स)
AgentForge का सबसे महत्वपूर्ण हिस्सा सैंडबॉक्स है।
एक कांच की दीवारों वाले गैरेज की कल्पना करें जहाँ क्रू काम करता है।
- सुरक्षा: यदि मैकेनिक गलती से इंजन में बम रख देता है, तो वह केवल कांच के गैरेज के अंदर ही फटता है। यह वास्तविक वर्कशॉप या AI चलाने वाले कंप्यूटर को नहीं उड़ाता है।
- सत्य: क्रू यह अनुमान नहीं लगा सकता कि कार काम कर रही है या नहीं। उन्हें इंजन शुरू करना होगा और उसकी आवाज़ सुननी होगी। यदि इंजन अजीब आवाज़ करता है, तो सिस्टम को तुरंत पता चल जाता है। इसे "एग्जीक्यूशन-ग्राउंडेड वेरिफिकेशन" (Execution-Grounded Verification) कहा जाता है। इसका मतलब है कि AI अपनी कल्पना से नहीं, बल्कि वास्तविक परिणामों से सीखता है।
3. मेमोरी बैंक (स्मृति कोष)
क्रू के पास एक साझा नोटबुक (मेमोरी) भी है।
- एपिसोडिक मेमोरी (Episodic Memory): यदि उन्होंने पिछले सप्ताह एक समान टूटे हुए इंजन को ठीक किया था, तो वे यह देखने के लिए उसे ढूँढते हैं कि क्या काम आया था।
- रिपॉजिटरी इंडेक्स (Repository Index): उनके पास पूरी वर्कशॉप का एक लाइव मैप है, ताकि उन्हें पता हो कि हर औज़ार और पुर्जा कहाँ स्थित है, जिससे वे ऐसा रिंच इस्तेमाल करने से बच सकें जो मौजूद ही नहीं है।
यह बेहतर क्यों है?
पुराने तरीके (सिंगल-एजेंट) में, प्रशिक्षु अनुमान लगाता है, एक पूरा नया इंजन लिखता है, और उम्मीद करता है कि यह काम करेगा। वे शायद 14% बार सही होते हैं।
AgentForge के साथ, क्रू एक लूप में काम करता है:
- योजना बनाना।
- एक छोटा सा सुधार (fix) बनाना।
- इसे सुरक्षित कमरे में टेस्ट करना।
- यदि यह विफल रहता है, तो वास्तविक एरर के आधार पर इसे ठीक करना।
- जब तक यह काम न करे, दोहराते रहना।
क्योंकि वे यह जाँचने के लिए कि क्या यह काम करता है, वास्तव में कोड चलाते हैं, वे 40% बार सही होते हैं—जो पुराने तरीके से एक बड़ी छलांग है।
निचोड़ (The Bottom Line)
AgentForge AI को सिखाता है कि आप केवल चीजों को ठीक करने के बारे में बात नहीं कर सकते; आपको वास्तव में इसे करना होगा और देखना होगा कि क्या होता है। विशेषज्ञों की एक टीम में काम को विभाजित करके और उन्हें एक सुरक्षित, वास्तविक वातावरण में अपने काम का परीक्षण करने के लिए मजबूर करके, हमें ऐसा सॉफ़्टवेयर मिलता है जो बहुत अधिक विश्वसनीय है, जिसके क्रैश होने की संभावना बहुत कम है, और जो वास्तव में वास्तविक दुनिया की समस्याओं को हल करता है।
यह उस छात्र के बीच का अंतर है जो उत्तर कुंजी (answer key) रट लेता है और उस छात्र के बीच का अंतर है जो वास्तव में परीक्षा देता है, गलतियाँ करता है, फीडबैक से सीखता है, और तब तक फिर से प्रयास करता है जब तक कि उसे 'A' ग्रेड नहीं मिल जाता।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।