← नवीनतम पेपर
⚡ electrical engineering

Embedding Morphology into Transformers for Cross-Robot Policy Learning

यह शोध पत्र एक एम्बॉडीमेंट-अवेयर (embodiment-aware) ट्रांसफार्मर पॉलिसी प्रस्तावित करता है जो जॉइंट-विशिष्ट टोकन, टोपोलॉजी-अवेयर अटेंशन बायस और प्रति-जॉइंट एट्रीब्यूट कंडीशनिंग के माध्यम से काइनेमैटिक मॉर्फोलॉजी को एकीकृत करके क्रॉस-रोबोट लर्निंग को बढ़ाता है, जिससे मानक VLA बेसलाइन की तुलना में विविध रोबोट एम्बॉडीमेंट्स में मजबूती और प्रदर्शन में सुधार होता है।

मूल लेखक: Kei Suzuki, Jing Liu, Ye Wang, Chiori Hori, Matthew Brand, Diego Romeres, Toshiaki Koike-Akino

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kei Suzuki, Jing Liu, Ye Wang, Chiori Hori, Matthew Brand, Diego Romeres, Toshiaki Koike-Akino

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रोबोटों के एक समूह को खाना बनाना सिखाने की कोशिश कर रहे हैं जो एक-दूसरे से बहुत अलग हैं: एक छोटा, फुर्तीला रोबोट हाथ (मानव हाथ की तरह), एक भारी-भरकम, मजबूत रोबोट हाथ (निर्माण क्रेन की तरह), और एक ऐसा रोबोट जिसकी उंगलियों की संख्या बिल्कुल अलग है।

वर्तमान में, अधिकांश "AI शेफ" (रोबोट मस्तिष्क) इस तरह से प्रशिक्षित होते हैं: आप उन्हें किसी इंसान के खाना बनाने का वीडियो दिखाते हैं, और AI को सब कुछ खुद ही समझना पड़ता है। उसे यह अंदाजा लगाना पड़ता है कि रोबोट के कितने जोड़ (joints) हैं, वे किस दिशा में मुड़ते हैं, और वे एक साथ कैसे काम करते हैं, यह सब केवल वीडियो देखकर। यह ऐसा है जैसे किसी को कार, मोटरसाइकिल और साइकिल चलाना सिखाने के लिए सिर्फ एक व्यक्ति को गाड़ी चलाते हुए देखने के लिए कहना, बिना कभी यह बताए कि स्टीयरिंग व्हील या हैंडल क्या हैं। यह भ्रमित करने वाला, धीमा है, और यदि आप वाहन बदल देते हैं, तो AI अक्सर विफल हो जाता है।

यह शोध पत्र एक स्मार्ट तरीका प्रस्तावित करता है: सीखना शुरू करने से पहले AI को रोबोट के शरीर का एक ब्लूप्रिंट (खाका) दें।

उन्होंने इसे कैसे किया, इसके लिए तीन सरल तरकीबें दी गई हैं:

1. "बॉडी मैप" (काइनेमैटिक टोकन - Kinematic Tokens)

समस्या: मानक AI रोबोट की गतिविधियों को संख्याओं की एक विशाल, अव्यवस्थित सूची के रूप में देखता है। उसे यह नहीं पता होता कि "जोड़ A" का संबंध "जोड़ B" से है।
समाधान: लेखकों ने रोबोट की गति को व्यक्तिगत "शरीर के अंगों" में विभाजित कर दिया। डेटा के एक बड़े ढेर के बजाय, उन्होंने AI को प्रत्येक जोड़ के लिए एक विशिष्ट टोकन (एक छोटा नोट) दिया।

  • उपमा: कल्पना कीजिए कि एक कंडक्टर एक ऑर्केस्ट्रा का नेतृत्व कर रहा है। शोर की दीवार सुनने के बजाय, कंडक्टर वायलिन सेक्शन, ड्रम सेक्शन और ट्रम्पेट सेक्शन को अलग-अलग संगीत की शीट देता है। अब, AI को पता है कि कौन सा "संगीत का नोट" किस "जोड़" का है।

2. "सोशल नेटवर्क" (टोपोलॉजी-अवेयर अटेंशन - Topology-Aware Attention)

समस्या: एक सामान्य AI मस्तिष्क में, रोबोट का हर हिस्सा दूसरे हिस्से से तुरंत बात कर सकता है। लेकिन वास्तविक जीवन में, रोबोट की कोहनी सीधे अपने कंधे से बात नहीं कर सकती जब तक कि वह ऊपरी बांह के माध्यम से न जाए। AI उन चीजों को जोड़ने में ऊर्जा बर्बाद कर रहा था जो शारीरिक रूप से जुड़ी हुई नहीं थीं।
समाधान: उन्होंने AI के भीतर एक "सोशल नेटवर्क" नियम बनाया। उन्होंने इसे बताया: "आप केवल अपने निकटतम पड़ोसियों (हड्डियों से जुड़े जोड़ों) के साथ चैट कर सकते हैं, जब तक कि आपको वास्तव में पूरे समूह तक पहुँचने की आवश्यकता न हो।"

  • उपमा: "टेलीफोन" के खेल के बारे में सोचें। यदि आप लोगों की एक पंक्ति में हैं, तो आप केवल संदेश उस व्यक्ति को पास करते हैं जो आपके ठीक बगल में खड़ा है। यह शोध पत्र AI को बताता है कि वह ज्यादातर अपने पड़ोसियों को संदेश पास करे (स्थानीय गपशप श्रृंखला की तरह) लेकिन कभी-कभी संदेश को पूरे समूह तक कूदने दे (ग्लोबल समन्वय) ताकि रोबोट एक लूप में न फंस जाए। यह रोबोट को बहुत अधिक स्वाभाविक रूप से हिलने-डुलने में मदद करता है।

3. "ID कार्ड" (जॉइंट-एट्रीब्यूट कंडीशनिंग - Joint-Attribute Conditioning)

समस्या: भले ही दो रोबोटों का "आकार" (टोपोलॉजी) समान हो, उनके हिस्सों का व्यवहार अलग हो सकता है। एक रोबोट का जोड़ एक घूमता हुआ पहिया हो सकता है; दूसरा एक फिसलने वाला पिस्टन हो सकता है। AI को यह जानने की जरूरत है कि वह हिस्सा क्या है, न कि केवल यह कि वह कहाँ है।
समाधान: उन्होंने प्रत्येक जोड़ को एक "ID कार्ड" दिया जिसमें विवरण थे जैसे "मैं एक घूमने वाला जोड़ हूँ," "मैं केवल 90 डिग्री तक घूम सकता हूँ," या "मैं बहुत फिसलन भरा हूँ।"

  • उपमा: एक स्पोर्ट्स टीम की कल्पना करें। यह जानना कि कौन किसके बगल में खड़ा है (टोपोलॉजी) अच्छा है। लेकिन यह जानना कि खिलाड़ी A एक "गोलकीपर" है और खिलाड़ी B एक "स्ट्राइकर" है (विशेषताएं/attributes), टीम को जिताने में वास्तव में मदद करता है। यह अतिरिक्त जानकारी AI को प्रत्येक रोबोट के शरीर के विशिष्ट नियमों को समझने में मदद करती है।

परिणाम: एक सुपर-अनुकूलन योग्य रोबोट

जब उन्होंने इस नए "बॉडी-अवेयर" AI का परीक्षण किया:

  • इसने तेजी से सीखा: इसे यह अनुमान लगाने की आवश्यकता नहीं पड़ी कि रोबोट कैसे काम करता है।
  • यह अधिक मजबूत (Robust) था: यदि आपने रोबोट को एक अलग मॉडल (जैसे, एक छोटे हाथ से एक बड़े हाथ में) से बदल दिया, तो AI क्रैश नहीं हुआ। इसने बस नए "ब्लूप्रिंट" को देखा और खुद को ढाल लिया।
  • यह एक एकल रोबोट पर भी बेहतर काम करता था: भले ही आपने केवल एक ही प्रकार के रोबोट का उपयोग किया हो, इस पद्धति ने इसे मानक AI की तुलना में बेहतर प्रदर्शन करने में मदद की।

संक्षेप में:
वर्तमान रोबोट AI एक ऐसे छात्र की तरह है जो एक धुंधली फोटो को देखकर शरीर रचना विज्ञान (anatomy) सीखने की कोशिश कर रहा है। यह शोध पत्र उस छात्र को एक स्पष्ट 3D मॉडल, यह मानचित्र कि हड्डियाँ कैसे जुड़ती हैं, और एक पाठ्यपुस्तक देता है कि प्रत्येक हड्डी क्या करती है। परिणाम? रोबोट बहुत तेज़ी से, सुरक्षित रूप से सीखता है और बिना दोबारा शुरू किए विभिन्न रोबोट शरीरों के बीच आसानी से स्विच कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →