← नवीनतम पेपर
🤖 AI

MALLVI: A Multi-Agent Framework for Integrated Generalized Robotics Manipulation

MALLVI एक मल्टी-एजेंट फ्रेमवर्क है जो रोबोटिक मैनिपुलेशन के लिए मजबूत, क्लोज्ड-लूप क्षमता सक्षम करने हेतु लार्ज लैंग्वेज और विजन मॉडल्स का लाभ उठाता है, जो धारणा (perception), तर्क (reasoning) और लक्षित त्रुटि सुधार (targeted error recovery) के लिए विशिष्ट एजेंटों को समन्वित करता है, जिससे ओपन-लूप दृष्टिकोणों की तुलना में ज़ीरो-शॉट कार्यों में सफलता दर में सुधार होता है।

मूल लेखक: Mehrshad Taji, Arad Mahdinezhad Kashani, Iman Ahmadi, AmirHossein Jadidi, Saina Kashani, Babak Khalaj

प्रकाशित 2026-06-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mehrshad Taji, Arad Mahdinezhad Kashani, Iman Ahmadi, AmirHossein Jadidi, Saina Kashani, Babak Khalaj

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल काम करना सिखाने की कोशिश कर रहे हैं, जैसे कि "एक सैंडविच बनाओ और उसे लाल प्लेट पर रखो।" यदि आप केवल एक ही, सुपर-स्मार्ट रोबोट दिमाग (एक लार्ज लैंग्वेज मॉडल) से यह करने के लिए कहते हैं, तो वह कागज पर तो एक सटीक योजना बना सकता है, लेकिन वास्तविकता में बुरी तरह विफल हो सकता है। वह ब्रेड को गलत जगह से अपने "फिंगर्स" (ग्रिपर) से पकड़ने की कोशिश कर सकता है, या उसे यह एहसास नहीं हो सकता कि प्लेट वास्तव में एक कप है। यह एक ऐसे शेफ की तरह है जिसने कभी रसोई नहीं देखी है लेकिन रेसिपी बुक से खाना बनाना सीख रहा है; उसे शब्द तो पता हैं, लेकिन उसे वास्तविक दुनिया का अनुभव नहीं है।

यह पेपर MALLVi पेश करता है, जो इस समस्या को हल करने का एक नया तरीका है। एक विशाल दिमाग पर निर्भर रहने के बजाय, MALLVi विशेषज्ञों की एक टीम (एजेंट्स) का उपयोग करता है जो मिलकर काम करती है, लगातार अपने काम की जांच करती है, और चलते समय अपनी गलतियों को सुधारती है।

यह टीम कैसे काम करती है, इसे एक निर्माण दल द्वारा घर बनाने के सरल उदाहरण से समझा जा सकता है:

1. टीम की संरचना (एजेंट्स)

सब कुछ एक व्यक्ति द्वारा करने के बजाय, MALLVi काम को चार (या पांच) विशिष्ट विशेषज्ञों के बीच बांट देता है:

  • द डिकंपोजर (प्रोजेक्ट मैनेजर): यह एजेंट आपके उलझे हुए मानवीय वाक्य ("सैंडविच बनाओ") को छोटे, करने योग्य चरणों में तोड़ता है: "1. ब्रेड ढूंढो। 2. चीज़ ढूंढो। 3. ब्रेड पर चीज़ रखो।" यह एक चेकलिस्ट बनाता है।
  • द डिस्क्रिप्टर (साइट सर्वेयर): यह एजेंट कमरे को देखता है और एक मानसिक मानचित्र बनाता है। यह कहता है, "ठीक है, मैं एक मेज, एक लाल कप और एक नीला ब्लॉक देख रहा हूँ। लाल कप नीले ब्लॉक के बाईं ओर है।" यह टीम को दुनिया के संदर्भ के बारे में बताता है।
  • द लोकलाइज़र (स्पॉटर): यह आँखें है। यह कैमरा फीड को देखता है और कहता है, "वह ब्रेड है! यह इन सटीक निर्देशांकों (coordinates) पर है।" यह सुनिश्चित करने के लिए कई "डिटेक्टर्स" का उपयोग करता है कि वह असली भोजन को खिलौने के रूप में न समझ ले।
  • द थकर (इंजीनियर): यह एजेंट चेकलिस्ट और मानचित्र लेता है और भौतिकी (physics) को समझता है। "ब्रेड उठाने के लिए, मुझे अपना हाथ इस कोण पर और यहाँ से पकड़ना होगा।" यह योजना को शारीरिक गतिविधियों में बदल देता है।
  • द एक्टर (बिल्डर): यह वह हिस्सा है जो वास्तव में रोबोट के हाथ को हिलाता है। यह बस थकर के निर्देशों का पालन करता है।
  • द रिफ्लेक्टर (क्वालिटी इंस्पेक्टर): यह सबसे महत्वपूर्ण नया फीचर है। एक्टर द्वारा ब्रेड उठाने की कोशिश करने के बाद, रिफ्लेक्टर परिणाम को देखता है। क्या ब्रेड हिली? हाँ? बहुत बढ़िया, अगले चरण पर बढ़ें। नहीं? रिफ्लेक्टर कहता है, "रुको! यह विफल रहा।" फिर यह उस विशिष्ट टीम सदस्य को बताता है जिसने गलती की (शायद लोकलाइज़र ने ब्रेड को सही से नहीं देखा), और उसे फिर से प्रयास करने के लिए कहता है। यह पूरी टीम को फिर से शुरू करने के लिए मजबूर नहीं करता; यह केवल खराब हिस्से को ठीक करता है।

2. "क्लोज्ड-लूप" का गुप्त मंत्र

अधिकांश पुराने रोबोट सिस्टम ओपन-लूप होते हैं। यह एक दोस्त को पत्र भेजने जैसा है जिसमें आप कहते हैं, "जाकर दूध खरीद लाओ," और फिर कभी यह नहीं देखते कि उसने वास्तव में खरीदा या नहीं। यदि वे रास्ता भटक जाते हैं, तो सिस्टम को पता नहीं चलता।

MALLVi क्लोज्ड-लूप है। यह एक वीडियो कॉल की तरह है जहाँ दोस्त कहता है, "मैं स्टोर पर हूँ," और आप कहते हैं, "ठीक है, अब गलियारा 4 की ओर जाओ।" यदि वह कहता है, "मुझे गलियारा 4 नहीं मिल रहा है," तो आप तुरंत कहते हैं, "अपने बाईं ओर देखो।" सिस्टम लगातार वातावरण की जांच करता है (कैमरे के माध्यम से) और वास्तविक समय में योजना को समायोजित करता है।

3. उन्होंने इसका परीक्षण कैसे किया

शोधकर्ताओं ने इस टीम का परीक्षण दो तरीकों से किया:

  1. एक वीडियो गेम में (सिमुलेशन): उन्होंने ब्लॉक रखने, कप को दराज में रखने या आकृतियों को छांटने जैसे कार्यों के साथ मानक रोबोट परीक्षण वातावरण (VIMABench और RLBench) का उपयोग किया।
  2. वास्तविक दुनिया में: उन्होंने भोजन, ब्लॉक और मग जैसी वास्तविक वस्तुओं के साथ एक भौतिक रोबोट पर इसका परीक्षण किया।

परिणाम:

  • MALLVi टीम एकल-मस्तिष्क वाले रोबोट या अन्य हालिया तरीकों की तुलना में बहुत अधिक सफल रही।
  • उदाहरण के लिए, एक "ब्लॉक स्टैक" कार्य में, MALLVi 90% बार सफल हुआ, जबकि एक एकल-एजेंट रोबोट केवल 15% बार सफल हुआ।
  • जब उन्होंने "रिफ्लेक्टर" (क्वालिटी इंस्पेक्टर) को हटा दिया, तो सफलता दर काफी गिर गई, जिससे साबित हुआ कि गलतियों की जांच करना और उन्हें ठीक करना महत्वपूर्ण है।

4. मुख्य निष्कर्ष

पेपर का दावा है कि बड़े, डरावने कार्य को विशेषज्ञों की एक टीम के लिए छोटे कामों में बांटकर, और एक "रिफ्लेक्टर" को लगातार यह जांचने के लिए रखकर कि चीजें सही जा रही हैं या नहीं, रोबोट पहले की तुलना में जटिल, अव्यवस्थित निर्देशों को बहुत बेहतर ढंग से संभाल सकते हैं। वे बिना किसी इंसान के हर बार "रीसेट" बटन दबाए, अपनी गलतियों से उबर सकते हैं।

यह पेपर क्या दावा नहीं करता है:

  • यह दावा नहीं करता कि यह चिकित्सा सर्जरी या क्लिनिकल उपयोग के लिए काम करता है।
  • यह दावा नहीं करता कि रोबोट हमेशा के लिए अपने आप नई चीजें सीख सकता है; यह अभी भी उन विशिष्ट उपकरणों और प्रॉम्प्ट्स पर निर्भर करता है जो शोधकर्ताओं ने दिए हैं।
  • यह यह नहीं कहता कि यह आपके घर के लिए तैयार एक फिनिश्ड प्रोडक्ट है; यह एक रिसर्च फ्रेमवर्क है जिसका लैब और सिमुलेशन में परीक्षण किया गया है।

संक्षेप में, MALLVi एक टीम-आधारित, स्व-सुधार प्रणाली है जो रोबोट को मानवीय निर्देशों को समझने और अपनी गलतियों को खुद ठीक करने में सक्षम बनाती है, जिससे वे केवल अनुमान लगाने और उम्मीद करने वाले रोबोट की तुलना में बहुत अधिक विश्वसनीय बन जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →