← नवीनतम पेपर
💻 computer science

MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

यह शोध पत्र MLA पेश करता है, जो एक मल्टीसेंसरी लैंग्वेज-एक्शन मॉडल है जो एनकोडर-मुक्त मल्टीमॉडल एलाइनमेंट के लिए लार्ज लैंग्वेज मॉडल्स को पुनरुत्पादित करके और भौतिक दुनिया के मॉडलिंग को बेहतर बनाने के लिए एक फ्यूचर मल्टीसेंसरी जनरेशन रणनीति का उपयोग करके जटिल, कॉन्टैक्ट-रिच वातावरण में रोबोटिक मैनिपुलेशन को बढ़ाता है, जिसके परिणामस्वरूप स्टेट-ऑफ-द-आर्ट विजन-लैंग्वेज-एक्शन विधियों की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होते हैं।

मूल लेखक: Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

प्रकाशित 2026-03-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को खाना बनाना सिखा रहे हैं। अधिकांश वर्तमान रोबोट आंखों पर पट्टी बंधे शेफ की तरह हैं जो केवल एक रेसिपी (भाषा) पढ़ सकते हैं और रसोई की एक एकल, सपाट फोटो (2D विजन) देख सकते हैं। वे अंदाज़ा लगा सकते हैं कि क्या करना है, लेकिन यदि वे एक फिसलन भरे अंडे को पकड़ने की कोशिश करते हैं या पैन की गर्मी महसूस करते हैं, तो वे अक्सर विफल हो जाते हैं क्योंकि उनमें वास्तविक दुनिया के "एहसास" की कमी होती है।

यह पेपर MLA (मल्टीसेंसरी लैंग्वेज-एक्शन मॉडल) को पेश करता है, जो एक नए प्रकार का रोबोटिक मस्तिष्क है जिसे एक सुपर-सेंसरी शेफ के रूप में डिज़ाइन किया गया है। केवल देखने और पढ़ने के बजाय, MLA एक साथ देखना, छूना और महसूस करना सीखता है, और यहाँ तक कि होने से पहले भविष्य की भविष्यवाणी भी करता है।

यहाँ यह कैसे काम करता है, सरल अवधारणाओं में विभाजित है:

1. समस्या: एक "फ्लैट" रोबोट मस्तिष्क

वर्तमान रोबोट "विज़न-लैंग्वेज-एक्शन" (VLA) मॉडल का उपयोग करते हैं। उन्हें एक ऐसे स्मार्ट सहायक के रूप में सोचें जो एक किताब पढ़ सकता है और एक तस्वीर देख सकता है, लेकिन वे उन कार्यों में संघर्ष करते हैं जिनमें शारीरिक संपर्क की आवश्यकता होती है।

  • अंतराल (The Gap): यदि आप रोबोट से "मेज पोंछने" के लिए कहते हैं, तो एक मानक रोबोट मेज को देखता तो है लेकिन कपड़े के प्रतिरोध या कणों (crumbs) के 3D आकार को "महसूस" नहीं करता। यह एक 3D भूलभुलैया में नेविगेट करने के लिए केवल 2D मानचित्र का उपयोग करने वाले वीडियो गेम खेलने जैसा है।

2. समाधान: MLA का "ऑल-इन-वन" मस्तिष्क

MLA इसे तीन इंद्रियों को एक एकीकृत मस्तिष्क में जोड़कर हल करता है:

  • आंखें (2D चित्र): जो कैमरा देखता है।
  • गहराई का बोध (3D पॉइंट क्लाउड्स): वस्तुओं के 3D आकारों का एक डिजिटल मानचित्र।
  • स्पर्श (टैक्टाइल सेंसर): रोबोट की उंगलियों पर लगे सेंसर जो दबाव और बनावट (texture) को महसूस करते हैं।

जादुई ट्रिक: किसी अतिरिक्त चश्मे की आवश्यकता नहीं
आमतौर पर, इन इंद्रियों को जोड़ने के लिए, इंजीनियरों को प्रत्येक इंद्रिय के लिए अलग "चश्मे" (एनकोडर्स) बनाने पड़ते हैं, जो भारी और धीमा होता है।

  • MLA का सादृश्य (Analogy): रोबोट को नए चश्मे देने के बजाय, MLA रोबोट के मौजूदा मस्तिष्क (एक लार्ज लैंग्वेज मॉडल) को आंखों और स्पर्श सेंसर के रूप में पुन: उपयोग करता है। यह एक इंसान को यह सिखाने जैसा है कि वह विशेष उपकरणों के बिना केवल देखकर 3D आकारों और बनावट को कैसे समझ सकता है। यह "स्पर्श" के डेटा को "दृष्टि" के डेटा के साथ संरेखित (align) करता है ताकि रोबोट समझ सके कि उंगली पर वह उभार चित्र में उस स्थान के अनुरूप है।

3. सीक्रेट सॉस: भविष्य का "दिवास्वप्न" (Daydreaming)

यह सबसे रचनात्मक हिस्सा है। MLA केवल वर्तमान पर प्रतिक्रिया नहीं देता; यह भविष्य की भविष्यवाणी करता है।

  • सादृश्य: कल्पना कीजिए कि आप कैच (catch) खेल रहे हैं। एक सामान्य रोबोट गेंद के अपने हाथ से टकराने का इंतज़ार करता है और फिर प्रतिक्रिया देता है। MLA एक पेशेवर एथलीट की तरह है जो गेंद के पथ, हवा और पकड़ के अहसास को होने से पहले ही कल्पना कर लेता है।
  • यह कैसे काम करता है: प्रशिक्षण के दौरान, MLA से यह "दिवास्वप्न" देखने के लिए कहा जाता है कि दृश्य कुछ सेकंड बाद कैसा दिखेगा, कैसा महसूस होगा और कैसा स्पर्श होगा। यह भविष्यवाणी करता है:
    • अगली फोटो कैसी दिखेगी।
    • 3D वस्तुएं कहाँ हिलेंगी।
    • जब रोबोट की उंगलियां वस्तु को छुएंगी तो उसे क्या महसूस होगा।
  • यह क्यों मदद करता है: इन "भविष्य के दिवास्वप्नों" का अभ्यास करके, रोबोट दुनिया के भौतिक विज्ञान (physics) (गुरुत्वाकर्षण, घर्षण, वजन) को सीखता है। जब यह वास्तव में कार्य करता है, तो इसने अपने मन में परिणाम को पहले ही "जी" लिया होता है, जिससे इसकी गतिविधियाँ बहुत सहज और सटीक हो जाती हैं।

4. प्रशिक्षण प्रक्रिया: छात्र से मास्टर तक

लेखकों ने MLA को तीन चरणों में प्रशिक्षित किया, जैसे एक छात्र स्कूल में प्रगति करता है:

  1. प्री-ट्रेनिंग (लाइब्रेरी): रोबोट लाखों किताबें पढ़ता है और रोबोट के हिलने-डुलने के वीडियो देखता है (केवल छवियों और टेक्स्ट का उपयोग करके) ताकि सामान्य भाषा और सामान्य ज्ञान सीख सके।
  2. फाइन-ट्यूनिंग (लैब): रोबोट को नए "संवेदी चश्मे" (3D और स्पर्श डेटा) दिए जाते हैं और इसे सिखाया जाता है कि उन्हें अपने पहले से ज्ञात ज्ञान के साथ कैसे संरेखित किया जाए।
  3. पोस्ट-ट्रेनिंग (सिमुलेशन): रोबोट भविष्य के "दिवास्वप्न" देखने का अभ्यास करता है। यह सीखता है कि भौतिक दुनिया में आगे क्या होगा, जिससे इसकी जटिल, संपर्क-प्रधान कार्यों को संभालने की क्षमता तेज होती है।

5. परिणाम: एक रोबोट जो वास्तव में "समझता है"

वास्तविक दुनिया के कार्यों (जैसे व्हाइटबोर्ड पोंछना, ब्रेड पर अंडा रखना, या बर्तन का ढक्कन खोलना) पर परीक्षण किए जाने पर, MLA ने प्रतियोगिता को पछाड़ दिया:

  • यह मौजूदा सर्वश्रेष्ठ रोबोटों से 12% से 24% बेहतर था।
  • इसने अनदेखी वस्तुओं और अव्यवस्थित बैकग्राउंड को बहुत बेहतर तरीके से संभाला।
  • क्यों? क्योंकि इसने केवल एक तस्वीर के आधार पर अनुमान नहीं लगाया; इसने अपनी संयुक्त इंद्रियों और भविष्य की भविष्यवाणी करने की अपनी क्षमता के माध्यम से स्थिति के भौतिक विज्ञान को समझा।

सारांश

MLA को एक ऐसे रोबोट के रूप में सोचें जो "फ्लैट-स्क्रीन ऑब्जर्वर" से स्नातक होकर एक "फुल-बॉडी पार्टिसिपेंट" बन गया है। रोबोट को दुनिया को महसूस करने और भविष्य को कल्पना करने की शिक्षा देकर, यह उन नाजुक और जटिल कार्यों को करने में सक्षम है जो पहले मशीनों के लिए असंभव थे। यह उन रोबोटों की ओर एक बड़ा कदम है जो वास्तव में हमारी अव्यवस्त, भौतिक दुनिया में हमारी मदद कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →