← नवीनतम पेपर
🤖 machine learning

Multi2^2: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments

यह शोधपत्र Multi2^2 प्रस्तुत करता है, जो एक पदानुक्रमित मल्टी-एजेंट फ्रेमवर्क है जो ऑब्जेक्टिव ड्रिफ्ट (उद्देश्य विचलन) को कम करने और गतिशील संवादात्मक वातावरणों में सुदृढ़, दीर्घकालिक निर्णय लेने के लिए एक सुपरवाइज्ड फाइन-ट्यून्ड हाई-लेवल प्लानर को रीइन्फोर्समेंट लर्निंग-आधारित लो-लेवल एक्जीक्यूटर के साथ जोड़ता है, जिसके साथ तीन नए बेंचमार्क डेटासेट भी जारी किए गए हैं।

मूल लेखक: Sangeun Park, Minhae Kwon

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sangeun Park, Minhae Kwon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े भुलक्कड़ रोबोट को एक वीडियो गेम में एक जटिल, बहु-चरणीय कार्य पूरा करना सिखाने की कोशिश कर रहे हैं। शायद लक्ष्य है "एक दुर्लभ पौधा खोजना, उसे पानी के साथ मिलाना और एक औषधि (potion) बनाना।"

यदि आप रोबोट को सिर्फ यह कहते हैं, "जाओ इसे करो," और उसे हर एक चाल खुद ही सुलझाने के लिए छोड़ देते हैं, तो वह अक्सर भ्रमित हो जाता है। वह भूल सकता है कि औषधि किस लिए थी, गोल-गोल घूमना शुरू कर सकता है, या मिश्रण करने के बजाय पानी पीने की कोशिश कर सकता है। शोध की दुनिया में, इसे "ऑब्जेक्टिव ड्रिफ्ट" (objective drift) कहा जाता है: रोबट यात्रा शुरू तो एक स्पष्ट लक्ष्य के साथ करता है, लेकिन बीच में ही वह ट्रैक खो देता है कि उसे क्या करना था।

यह पेपर Multi2 नामक एक नया सिस्टम पेश करता है जो इसे ठीक करता है। Multi2 को एक एकल रोबोट के रूप में नहीं, बल्कि दो विशेषज्ञ श्रमिकों की एक टीम के रूप में सोचें जो एक बॉस और एक कुशल शिल्पकार की तरह मिलकर काम करते हैं।

दो कार्यकर्ता: बॉस और बिल्डर

1. बॉस (सिस्टम 1): "बड़ी तस्वीर" वाला योजनाकार (The "Big Picture" Planner)

  • वे क्या करते हैं: यह कार्यकर्ता कंट्रोल्स को हाथ नहीं लगाता। इसके बजाय, वे बड़े लक्ष्य को देखते हैं और उसे छोटे, प्रबंधनीय टुकड़ों में तोड़ देते हैं।
  • उपमा: कल्पना कीजिए कि आप एक घर बना रहे हैं। बॉस एक वास्तुकार (architect) है। वे ईंटें नहीं रखते; वे ब्लूप्रिंट बनाते हैं और कहते हैं, "पहले, हमें नींव डालनी होगी। एक बार जब यह हो जाए, तो हम दीवारें बनाएंगे।"
  • वे कैसे सीखते हैं: बॉस को हजारों अच्छे ब्लूप्रिंट के उदाहरण दिखाकर प्रशिक्षित किया जाता है (एक विधि जिसे सुपरवाइज्ड फाइन-ट्यूनिंग कहा जाता है)। वे स्पष्ट, संदर्भ-जागरूक निर्देश देना सीखते हैं ताकि टीम कभी मुख्य लक्ष्य से न भटके।

2. बिल्डर (सिस्टम 2): "हाथों से काम करने वाला" निष्पादक (The "Hands-On" Executor)

  • वे क्या करते हैं: यह कार्यकर्ता वास्तव में औजार उठाता है और काम करता है। वे बॉस के निर्देश ("नींव डालें") को लेते हैं और यह पता लगाते हैं कि इसे करने के लिए वास्तव में कौन से बटन दबाने हैं।
  • उपमा: बिल्डर निर्माण दल (construction crew) है। वे वही हैं जो गंदगी में हाथ गंदे करते हैं, काम करते हैं, और यदि कंक्रीट की बाल्टी गिर जाए तो गलतियों को सुधारते हैं।
  • वे कैसे सीखते हैं: बिल्डर को दो चरणों में प्रशिक्षित किया जाता है:
    • चरण 1 (ऑफलाइन): वे बुनियादी बातें सीखने के लिए पिछले निर्माण वीडियो के पुस्तकालय का अध्ययन करते हैं ताकि वास्तविक गलतियाँ न हों।
    • चरण 2 (ऑनलाइन): वे वास्तविक दुनिया (गेम एनवायरनमेंट) में जाते हैं और अभ्यास करते हैं। यदि वे गलती करते हैं, तो वे तुरंत उससे सीखते हैं। महत्वपूर्ण रूप से, उन्हें जो कुछ भी उन्होंने लाइब्रेरी में सीखा है उसके करीब रहने के लिए सिखाया जाता है ताकि वे बहुत ज्यादा अनियंत्रित न हो जाएं और बुनियादी बातों को न भूल जाएं। इसे ऑफलाइन-टू-ऑनलाइन रीइन्फोर्समेंट लर्निंग कहा जाता है।

यह टीम बेहतर क्यों काम करती है

पेपर तर्क देता है कि पिछले तरीकों ने एक ही रोबोट से योजना बनाने और निर्माण करने दोनों को करने की कोशिश की। यह एक वास्तुकार से घर बनाने और साथ ही हर एक ईंट रखने के लिए कहने जैसा है। यह बहुत अधिक काम है, और वास्तुकार अक्सर कील ठोकने के प्रयास में ब्लूप्रिंट भूल जाता है।

Multi2 इसे भूमिकाओं को अलग करके हल करता है:

  • स्थिरता (Stability): क्योंकि बॉस (सिस्टम 1) योजना बनाने में विशेषज्ञ है, टीम कभी मुख्य लक्ष्य से नज़र नहीं हटाती, भले ही कार्य लंबा हो।
  • दक्षता (Efficiency): बिल्डर (सिस्टम 2) अभ्यास के माध्यम से विशिष्ट कार्यों में बेहतर होता है। इसका मतलब है कि रोबोट को काम करने के लिए उतना "सोचने" की या उतने अधिक कंप्यूटर शब्दों (टोकन) की आवश्यकता नहीं होती है। यह एक अनुभवी बढ़ई की तरह है जो एक ही सहज गति में एक बोर्ड काट सकता है, जबकि एक नौसिखिया को लगातार नापने और फिर से नापने की आवश्यकता होती है।

परिणाम

शोधकर्ताओं ने इस टीम का परीक्षण तीन अलग-अलग "वीडियो गेम" दुनिया (ScienceWorld, ALFWorld, और TextCraft) में किया जहाँ कार्यों के लिए कई चरणों की आवश्यकता होती है।

  • बेहतर सफलता: Multi2 ने अन्य तरीकों की तुलना में अधिक कार्यों को हल किया, विशेष रूप से लंबे, कठिन कार्यों में जहाँ अन्य रोबोट आमतौर पर हार मान लेते हैं या भ्रमित हो जाते हैं।
  • कम भ्रम: जब अन्य रोबोट लूप में फंसने लगे (बार-बार एक ही बेकार क्रिया करने लगे), तब Multi2 ट्रैक पर रहा।
  • ऊर्जा की बचत: Multi2 ने समान परिणाम प्राप्त करने के लिए कम कंप्यूटर संसाधनों (टोकन) का उपयोग किया, जिससे यह तेज़ और अधिक कुशल बन गया।

"सीक्रेट सॉस" (The Secret Sauce)

पेपर ने एक नया प्रशिक्षण डेटा (जैसे कि रोबोटों के लिए एक नई पाठ्यपुस्तक) भी जारी किया है जो विशेष रूप से इस बॉस-और-बिल्डर टीम वर्क को सिखाने के लिए डिज़ाइन किया गया है। उन्होंने पाया कि यदि आप प्रशिक्षण को मिला देते हैं—जैसे कि बॉस को ईंट बिछाना सिखाना या बिल्डर को ब्लूप्रिंट बनाना सिखाना—तो सिस्टम विफल हो जाता है। विशिष्ट भूमिकाओं को अलग रखा जाना चाहिए और उन्हें उनके काम के लिए विशेष रूप से प्रशिक्षित किया जाना चाहिए।

संक्षेप में, Multi2 एक ऐसा AI एजेंट बनाने का तरीका है जो केवल लंबे कार्य के माध्यम से "अंदाजा" नहीं लगाता, बल्कि जिसके पास लक्ष्य को ध्यान में रखने के लिए एक स्पष्ट प्रबंधक और अनुभव से सीखने वाला एक कुशल कार्यकर्ता है ताकि काम को कुशलतापूर्वक पूरा किया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →