← नवीनतम पेपर
💻 computer science

Multi-Agent Robotic Control with Onboard Vision-Language Models

यह शोध पत्र एक पूर्णतः ऑनबोर्ड मल्टी-एजेंट सिस्टम आर्किटेक्चर प्रस्तुत करता है जो विशेष कॉम्पैक्ट विजन-लैंग्वेज मॉडल्स और एक नवीन "मेगामाइंड" ऑर्केस्ट्रेटर का उपयोग करता है ताकि बाहरी क्लाउड कंप्यूट पर निर्भर रहे बिना विविध औद्योगिक कार्यों के लिए लागत-कुशल, व्याख्या योग्य और सामान्यीकरण योग्य रोबोटिक नियंत्रण को सक्षम बनाया जा सके।

मूल लेखक: Kajetan Rachwał, Maciej Majek, Bartłomiej Boczek, Jakub Matejczyk, Dominik Matejkowski, Adam Dąbrowski, Tim Seyde, Alexander Amini, Maria Ganzha

प्रकाशित 2026-07-09
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Kajetan Rachwał, Maciej Majek, Bartłomiej Boczek, Jakub Matejczyk, Dominik Matejkowski, Adam Dąbrowski, Tim Seyde, Alexander Amini, Maria Ganzha

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक व्यस्त गोदाम की कल्पना एक विशाल, जटिल पहेली के रूप में करें। आमतौर पर, इस पहेली को हल करने के लिए, एक रोबोट को समस्या की एक फोटो क्लाउड में स्थित एक सुपर-कंप्यूटर को भेजनी पड़ती है, जवाब का इंतज़ार करना पड़ता है, और फिर कार्य करना पड़ता है। यह शोध एक नया तरीका प्रस्तुत करता है: रोबोट को उसके सिर पर ही अपना एक "दिमाग" देना, ताकि वह इंटरनेट कनेक्शन के बिना तुरंत सोच सके और कार्य कर सके।

शोधकर्ताओं ने इस प्रणाली को कैसे बनाया, इसका सरल विवरण यहाँ दिया गया है:

समस्या: "क्लाउड" की बाधा

पारंपरिक स्मार्ट रोबोट अक्सर जो कुछ भी देखते हैं उसे समझने के लिए दूर स्थित विशाल, शक्तिशाली कंप्यूटरों (क्लाउड) पर निर्भर करते हैं। यह एक ऐसा वीडियो गेम खेलने जैसा है जहाँ आपके द्वारा किया गया हर कदम किसी दूसरे देश में बैठे रेफरी द्वारा अनुमोदित किया जाना आवश्यक है। यह धीमा है, महंगा है, और यदि इंटरनेट कट जाता है, तो रोबति जम जाता है। इसके अलावा, ये बड़े "दिमाग" अक्सर 'ब्लैक बॉक्स' होते हैं—हमें हमेशा पता नहीं होता कि उन्होंने कोई निर्णय क्यों लिया, जो सुरक्षा के लिहाज से डरावना हो सकता है।

समाधान: विशेषज्ञ पेशेवरों की एक टीम

एक विशाल दिमाग जो सब कुछ करने की कोशिश करता है, इसके बजाय, शोधकर्ताओं ने एक मल्टी-एजेंट सिस्टम (Multi-Agent System) बनाया। इसे एक अकेले सुपर-इंटेलिजेंट रोबोट के रूप में नहीं, बल्कि एक ही रोबोट पर काम करने वाले कुशल विशेषज्ञों के एक छोटे दल के रूप में समझें।

  1. "मेगामाइंड" (कप्तान):
    यह टीम का लीडर है। छोटे कंप्यूटर दिमाग कभी-कभी भ्रमित हो जाते हैं यदि उन्हें एक साथ बहुत सारी चीजें याद रखनी पड़ती हैं (जैसे एक छात्र जो पूरी किताब अपने दिमाग में रखने की कोशिश कर रहा हो)। मेगामाइंड बड़े कार्यों को छोटे चरणों में तोड़कर इस समस्या को हल करता है। यह कहता है, "ठीक है, पहले वह बॉक्स उठाओ। एक बार जब यह हो जाए, तो मैं तुम्हें बताऊंगा कि आगे क्या करना है।" यह टीम को केंद्रित रखता है और उन्हें योजना भूलने से रोकता है।

  2. "इंस्पेक्टर" (गुणवत्ता नियंत्रण):
    यह एजेंट पैकेजों को देखता है कि वे क्षतिग्रस्त हैं या नहीं। यह सुनिश्चित करने के लिए कि यह वास्तव में इसमें कुशल था, शोधकर्ताओं ने इसे एक "शिक्षक" (एक बहुत बड़े AI) का उपयोग करके प्रशिक्षित किया था जिसने क्षतिग्रस्त बॉक्सों का विवरण लिखा था। इंस्पेक्टर ने इन नोट्स से सीखा और क्षतिग्रस्त बॉक्सों को पहचानने में बहुत सटीक बन गया, जिससे इसकी सटीकता लगभग 77% से बढ़कर 91% से अधिक हो गई।

  3. "सेफ्टी ऑफिसर" (नियम पुस्तिका का पाठक):
    यह एजेंट रिसाव या अवरुद्ध गलियारों जैसे खतरों पर नज़र रखता है। लेकिन यह केवल अनुमान नहीं लगाता; यह एक वकील की तरह कार्य करता है। जब यह कुछ अजीब देखता है, तो यह तुरंत डिजिटल लाइब्रेरी में आधिकारिक सुरक्षा नियमों (OSHA विनियमों) को देखता है कि क्या वास्तव में कोई उल्लंघन हुआ है। फिर यह मानव ऑपरेटर को बताता है कि कौन सा नियम टूटा है और वह कितना गंभीर है।

  4. "मसल" (मूवर्स):
    ये वे एजेंट हैं जो वास्तव में रोबोट के पहियों और भुजाओं को नियंत्रित करते हैं, उन्हें बताते हैं कि कहाँ जाना है और चीजों को कैसे पकड़ना है।

"ऑनबोर्ड" का लाभ

सबसे प्रभावशाली बात यह है कि ये सभी "दिमाग" एक छोटे कंप्यूटर (एक AMD Ryzen मिनी पीसी) में समा जाते हैं जो सीधे रोबोट पर लगा हुआ है।

  • उपमा: एक ऐसी कार की कल्पना करें जिसमें डैशबोर्ड में ही अपना GPS, मैकेनिक और ट्रैफिक पुलिस मौजूद है, बजाय इसके कि हर मोड़ के लिए उसे सर्विस सेंटर को कॉल करना पड़े।
  • परिणाम: रोबोट तेज़ है, चलाने में सस्ता है (कोई महंगा क्लाउड बिल नहीं), और इंटरनेट बंद होने पर भी काम करता है।

उन्होंने क्या परीक्षण किया

टीम ने एक गोदाम के वास्तविक कंप्यूटर सिमुलेशन में इसका परीक्षण किया। उन्होंने रोबोट को पांच अलग-अलग प्रकार के काम करने के लिए कहा:

  • सुरक्षा जाँच: खतरों को पहचानना और सुरक्षा नियमों की जाँच करना।
  • रखरखाव: बिखरी हुई अलमारियों को ठीक करना।
  • खोज: विशिष्ट वस्तुओं को खोजना।
  • गुणवत्ता नियंत्रण: यह देखना कि पैकेज क्षतिग्रस्त हैं या नहीं।
  • मानवीय अनुरोध: जब कोई व्यक्ति इसे बॉक्स हटाने के लिए कहता है तो उसे ले जाना।

निष्कर्ष

प्रयोग ने दिखाया कि एक ही रोबोट पर काम करने वाला यह "छोटे विशेषज्ञों का दल" विशाल क्लाउड कंप्यूटरों पर निर्भर रहने की तुलना में उतना ही अच्छा, और अक्सर बेहतर काम करता है। यह सिद्ध करता है कि हम बिना किसी विशाल, महंगी बुनियादी संरचना के छोटे और मध्यम आकार के व्यवसायों के लिए लचीले, स्मार्ट रोबोट बना सकते हैं। शोधकर्ताओं ने सिमुलेशन सॉफ्टवेयर को अध्ययन के लिए मुफ्त में उपलब्ध कराया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →