Multi: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments
यह शोधपत्र Multi प्रस्तुत करता है, जो एक पदानुक्रमित मल्टी-एजेंट फ्रेमवर्क है जो ऑब्जेक्टिव ड्रिफ्ट (उद्देश्य विचलन) को कम करने और गतिशील संवादात्मक वातावरणों में सुदृढ़, दीर्घकालिक निर्णय लेने के लिए एक सुपरवाइज्ड फाइन-ट्यून्ड हाई-लेवल प्लानर को रीइन्फोर्समेंट लर्निंग-आधारित लो-लेवल एक्जीक्यूटर के साथ जोड़ता है, जिसके साथ तीन नए बेंचमार्क डेटासेट भी जारी किए गए हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े भुलक्कड़ रोबोट को एक वीडियो गेम में एक जटिल, बहु-चरणीय कार्य पूरा करना सिखाने की कोशिश कर रहे हैं। शायद लक्ष्य है "एक दुर्लभ पौधा खोजना, उसे पानी के साथ मिलाना और एक औषधि (potion) बनाना।"
यदि आप रोबोट को सिर्फ यह कहते हैं, "जाओ इसे करो," और उसे हर एक चाल खुद ही सुलझाने के लिए छोड़ देते हैं, तो वह अक्सर भ्रमित हो जाता है। वह भूल सकता है कि औषधि किस लिए थी, गोल-गोल घूमना शुरू कर सकता है, या मिश्रण करने के बजाय पानी पीने की कोशिश कर सकता है। शोध की दुनिया में, इसे "ऑब्जेक्टिव ड्रिफ्ट" (objective drift) कहा जाता है: रोबट यात्रा शुरू तो एक स्पष्ट लक्ष्य के साथ करता है, लेकिन बीच में ही वह ट्रैक खो देता है कि उसे क्या करना था।
यह पेपर Multi2 नामक एक नया सिस्टम पेश करता है जो इसे ठीक करता है। Multi2 को एक एकल रोबोट के रूप में नहीं, बल्कि दो विशेषज्ञ श्रमिकों की एक टीम के रूप में सोचें जो एक बॉस और एक कुशल शिल्पकार की तरह मिलकर काम करते हैं।
दो कार्यकर्ता: बॉस और बिल्डर
1. बॉस (सिस्टम 1): "बड़ी तस्वीर" वाला योजनाकार (The "Big Picture" Planner)
- वे क्या करते हैं: यह कार्यकर्ता कंट्रोल्स को हाथ नहीं लगाता। इसके बजाय, वे बड़े लक्ष्य को देखते हैं और उसे छोटे, प्रबंधनीय टुकड़ों में तोड़ देते हैं।
- उपमा: कल्पना कीजिए कि आप एक घर बना रहे हैं। बॉस एक वास्तुकार (architect) है। वे ईंटें नहीं रखते; वे ब्लूप्रिंट बनाते हैं और कहते हैं, "पहले, हमें नींव डालनी होगी। एक बार जब यह हो जाए, तो हम दीवारें बनाएंगे।"
- वे कैसे सीखते हैं: बॉस को हजारों अच्छे ब्लूप्रिंट के उदाहरण दिखाकर प्रशिक्षित किया जाता है (एक विधि जिसे सुपरवाइज्ड फाइन-ट्यूनिंग कहा जाता है)। वे स्पष्ट, संदर्भ-जागरूक निर्देश देना सीखते हैं ताकि टीम कभी मुख्य लक्ष्य से न भटके।
2. बिल्डर (सिस्टम 2): "हाथों से काम करने वाला" निष्पादक (The "Hands-On" Executor)
- वे क्या करते हैं: यह कार्यकर्ता वास्तव में औजार उठाता है और काम करता है। वे बॉस के निर्देश ("नींव डालें") को लेते हैं और यह पता लगाते हैं कि इसे करने के लिए वास्तव में कौन से बटन दबाने हैं।
- उपमा: बिल्डर निर्माण दल (construction crew) है। वे वही हैं जो गंदगी में हाथ गंदे करते हैं, काम करते हैं, और यदि कंक्रीट की बाल्टी गिर जाए तो गलतियों को सुधारते हैं।
- वे कैसे सीखते हैं: बिल्डर को दो चरणों में प्रशिक्षित किया जाता है:
- चरण 1 (ऑफलाइन): वे बुनियादी बातें सीखने के लिए पिछले निर्माण वीडियो के पुस्तकालय का अध्ययन करते हैं ताकि वास्तविक गलतियाँ न हों।
- चरण 2 (ऑनलाइन): वे वास्तविक दुनिया (गेम एनवायरनमेंट) में जाते हैं और अभ्यास करते हैं। यदि वे गलती करते हैं, तो वे तुरंत उससे सीखते हैं। महत्वपूर्ण रूप से, उन्हें जो कुछ भी उन्होंने लाइब्रेरी में सीखा है उसके करीब रहने के लिए सिखाया जाता है ताकि वे बहुत ज्यादा अनियंत्रित न हो जाएं और बुनियादी बातों को न भूल जाएं। इसे ऑफलाइन-टू-ऑनलाइन रीइन्फोर्समेंट लर्निंग कहा जाता है।
यह टीम बेहतर क्यों काम करती है
पेपर तर्क देता है कि पिछले तरीकों ने एक ही रोबोट से योजना बनाने और निर्माण करने दोनों को करने की कोशिश की। यह एक वास्तुकार से घर बनाने और साथ ही हर एक ईंट रखने के लिए कहने जैसा है। यह बहुत अधिक काम है, और वास्तुकार अक्सर कील ठोकने के प्रयास में ब्लूप्रिंट भूल जाता है।
Multi2 इसे भूमिकाओं को अलग करके हल करता है:
- स्थिरता (Stability): क्योंकि बॉस (सिस्टम 1) योजना बनाने में विशेषज्ञ है, टीम कभी मुख्य लक्ष्य से नज़र नहीं हटाती, भले ही कार्य लंबा हो।
- दक्षता (Efficiency): बिल्डर (सिस्टम 2) अभ्यास के माध्यम से विशिष्ट कार्यों में बेहतर होता है। इसका मतलब है कि रोबोट को काम करने के लिए उतना "सोचने" की या उतने अधिक कंप्यूटर शब्दों (टोकन) की आवश्यकता नहीं होती है। यह एक अनुभवी बढ़ई की तरह है जो एक ही सहज गति में एक बोर्ड काट सकता है, जबकि एक नौसिखिया को लगातार नापने और फिर से नापने की आवश्यकता होती है।
परिणाम
शोधकर्ताओं ने इस टीम का परीक्षण तीन अलग-अलग "वीडियो गेम" दुनिया (ScienceWorld, ALFWorld, और TextCraft) में किया जहाँ कार्यों के लिए कई चरणों की आवश्यकता होती है।
- बेहतर सफलता: Multi2 ने अन्य तरीकों की तुलना में अधिक कार्यों को हल किया, विशेष रूप से लंबे, कठिन कार्यों में जहाँ अन्य रोबोट आमतौर पर हार मान लेते हैं या भ्रमित हो जाते हैं।
- कम भ्रम: जब अन्य रोबोट लूप में फंसने लगे (बार-बार एक ही बेकार क्रिया करने लगे), तब Multi2 ट्रैक पर रहा।
- ऊर्जा की बचत: Multi2 ने समान परिणाम प्राप्त करने के लिए कम कंप्यूटर संसाधनों (टोकन) का उपयोग किया, जिससे यह तेज़ और अधिक कुशल बन गया।
"सीक्रेट सॉस" (The Secret Sauce)
पेपर ने एक नया प्रशिक्षण डेटा (जैसे कि रोबोटों के लिए एक नई पाठ्यपुस्तक) भी जारी किया है जो विशेष रूप से इस बॉस-और-बिल्डर टीम वर्क को सिखाने के लिए डिज़ाइन किया गया है। उन्होंने पाया कि यदि आप प्रशिक्षण को मिला देते हैं—जैसे कि बॉस को ईंट बिछाना सिखाना या बिल्डर को ब्लूप्रिंट बनाना सिखाना—तो सिस्टम विफल हो जाता है। विशिष्ट भूमिकाओं को अलग रखा जाना चाहिए और उन्हें उनके काम के लिए विशेष रूप से प्रशिक्षित किया जाना चाहिए।
संक्षेप में, Multi2 एक ऐसा AI एजेंट बनाने का तरीका है जो केवल लंबे कार्य के माध्यम से "अंदाजा" नहीं लगाता, बल्कि जिसके पास लक्ष्य को ध्यान में रखने के लिए एक स्पष्ट प्रबंधक और अनुभव से सीखने वाला एक कुशल कार्यकर्ता है ताकि काम को कुशलतापूर्वक पूरा किया जा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।