← नवीनतम पेपर
💻 computer science

Transformer Transformer: A Unified Model for Motion-Conditioned Robot Co-design

यह शोध पत्र "ट्रांसफॉर्मर ट्रांसफॉर्मर" (Transformer Transformer) पेश करता है, जो रोबोटो टोकन्स (RoboTokens) पर प्रशिक्षित एक एकीकृत डिफ्यूजन ट्रांसफॉर्मर मॉडल है जो एक नवीन डायनेमिक्स सेल्फ-गाइडेंस (Dynamics Self-Guidance) तंत्र के माध्यम से अनदेखे कार्यों और पुरस्कारों के लिए अनुकूलित रोबोटिक स्वरूपों (embodiments) और नियंत्रकों को उत्पन्न करके मोशन-कंडीशन्ड रोबोट को-डिज़ाइन को सक्षम बनाता है, जो इवोल्यूशनरी बेसलाइन्स की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्राप्त करता है।

मूल लेखक: Huy Ha, C. Karen Liu, Shuran Song

प्रकाशित 2026-07-29
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Huy Ha, C. Karen Liu, Shuran Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को करतब दिखाने (जगलिंग करने) के लिए सिखाने की कोशिश कर रहे हैं, लेकिन आप केवल अपने हाथों द्वारा लिए जाने वाले पथ (पाथ) को दिखाते हैं, रोबोट के शरीर को नहीं। यदि आप यह पथ एक छोटे, डगमगाते खिलौना रोबोट को देते हैं, तो वह बुरी तरह विफल हो जाएगा। यदि आप यह पथ एक विशाल, भारी क्रेन को देते हैं, तो वह तेज़ी से चलने के लिए अपने मोटरों को तोड़ने की कोशिश कर सकती है। यह रोबोटिक्स की एक समस्या के केंद्र में है जिसे "एम्बॉडमेंट" (Embodiment) कहा जाता है। यह इस विचार के बारे में है कि एक रोबोट का भौतिक आकार, आकार और वजन यह निर्धारित करता है कि वह वास्तव में क्या कर सकता है। लंबे समय तक, वैज्ञानिकों ने रोबोट के शरीर को एक निश्चित, अपरिवर्तनीय बॉक्स के रूप में माना, और केवल मस्तिष्क को हिलने-डुलने का तरीका सिखाने पर ध्यान केंद्रित किया। लेकिन क्या होगा यदि हम उस काम के लिए विशेष रूप से एक आदर्श शरीर डिजाइन कर सकें? यह शोध पत्र इसी प्रश्न की गहराई में जाता है, पूछते हुए: "एक विशिष्ट कार्य को करने के लिए सबसे अच्छा रोबोट आकार क्या है?" यह रोबोट के शरीर को डिजाइन करने की कला को उन्हें चलाने के विज्ञान के साथ जोड़ता है, जिससे एक ऐसी प्रणाली बनती है जो न केवल एक कार्य सीखती है, बल्कि उस काम को करने के लिए एक आदर्श मशीन का आविष्कार भी करती है।

यहाँ ट्रांसफॉर्मर ट्रांसफॉर्मर (Transformer Transformer) आता है, एक नया AI मॉडल जो एक सुपर-स्मार्ट रोबोट आर्किटेक्ट और कोच दोनों की भूमिका निभाता है। इसका नाम थोड़ा बोलने में कठिन है: पहला "ट्रांसफॉर्मर" उन रोबोट्स के विचार को संदर्भित करता है जो अपना आकार बदल सकते हैं (जैसे ट्रांसफॉर्मर खिलौना), और दूसरा उस विशिष्ट प्रकार के AI आर्किटेक्चर को संदर्भित करता है जिसका यह उपयोग करता है, जो जटिल पैटर्न को समझने के लिए प्रसिद्ध है। शोधकर्ताओं ने इस मॉडल को एक कठिन पहेली को हल करने के लिए बनाया है: एक वांछित गति (जैसे हवा में पथ का अनुसरण करता हुआ एक मानव हाथ) और लक्ष्यों का एक सेट (जैसे "तेज़ होना" या "हल्का होना") दिए जाने पर, क्या AI एक बिल्कुल नया रोबमान डिज़ाइन आविष्कार कर सकता है जो उस काम को पूरी तरह से करे?

ऐसा करने के लिए, टीम ने एक विशेष भाषा बनाई जिसे रोबोटोकन्स (RoboTokens) कहा जाता है। इसे एक सार्वभौमिक वर्णमाला के रूप में समझें जो रोबोट्स के लिए है। गियर्स और मोटरों के लंबे, उलझे हुए विवरण लिखने के बजाय, AI रोबोट के हर हिस्से को—उसके पैरों, जोड़ों, मोटरों और यहाँ तक कि उसके चलने के तरीके को—टोकन्स के एक व्यवस्थित क्रम में अनुवादित करता है, जैसे वाक्य में शब्द होते हैं। यह AI को एक रोबोट के शरीर और उसकी क्रियाओं को एक साथ "पढ़ने" की अनुमति देता है। मॉडल को रोबोट सिमुलेशन के एक विशाल पुस्तकालय पर प्रशिक्षित किया गया है, जिससे यह सीखता है कि विभिन्न आकार विभिन्न बलों (forces) के प्रति कैसे प्रतिक्रिया करते हैं। यह सीखता है कि एक लंबे हाथ को एक मजबूत मोटर की आवश्यकता होती है, या एक भारी रोबोट को संतुलित रहने के लिए एक चौड़े आधार की आवश्यकता होती है।

जादू तब होता है जब AI को एक नए रोबोट को डिजाइन करने के लिए कहा जाता है। यह केवल अनुमान नहीं लगाता; यह डिफ्यूजन (diffusion) नामक एक प्रक्रिया का उपयोग करता है, जो स्थिर शोर (static noise) के बादल से शुरू होकर धीरे-धीरे एक स्पष्ट चित्र में बदलने जैसा है। इस मामले में, "चित्र" एक रोबोट का डिज़ाइन है। AI रोबोट के हिस्सों के एक धुंधले, यादृच्छिक संग्रह से शुरू होता है और धीरे-धीरे उन्हें एक सुसंगत मशीन में तराशता है। लेकिन सबसे महत्वपूर्ण बात यह है कि AI को एक "रिवॉर्ड फंक्शन" (reward function) द्वारा निर्देशित किया जा सकता है, जो केवल एक स्कोरकार्ड है जो उसे बताता है कि उसे क्या लक्ष्य प्राप्त करना है। यदि आप उससे कहते हैं, "मुझे एक ऐसा रोबोट चाहिए जो इस पथ का अनुसरण करे लेकिन कम से कम ऊर्जा का उपयोग करे," तो AI ऊर्जा के उपयोग को कम करने के लिए निर्माण प्रक्रिया के दौरान डिज़ाइन में बदलाव करता है। यह बिना हर नए लक्ष्य के लिए पुन: प्रशिक्षित हुए ऐसा करता है, जिसे लेखक जीरो-शॉट ऑप्टिमाइज़ेशन (zero-shot optimization) कहते हैं। यह एक ऐसे शेफ की तरह है जो बिना कभी उस विशिष्ट केक को देखे, केवल "इसे हल्का बनाओ" कहे जाने पर कम कैलोरी वाले केक के लिए एक नई रेसिपी का आविष्कार कर सकता है।

शोध पत्र दिखाता है कि यह दृष्टिकोण बहुत अलग प्रकार के रोबोटों पर आश्चर्यजनक रूप से अच्छा काम करता है। उन्होंने तीन अलग-अलग "प्लेग्राउंड्स" पर इसका परीक्षण किया: एक स्थिर रोबोटिक आर्म (जैसे कारखानों में होते हैं), एक चार पैरों वाला रोबोट (जैसे कुत्ता), और दो भुजाओं वाला एक मोबाइल रोबोट (जैसे एक कार्ट के साथ मानव)। हर मामले में, AI ने ऐसे रोबोट डिज़ाइन तैयार किए जो पारंपरिक, धीमे तरीकों से पाए गए डिज़ाइनों की तुलना में कार्य करने में बेहतर थे। उदाहरण के लिए, जब एक कपड़े को फेंकने (एक कार्य जिसे "फ्लिंगिंग" कहा जाता है) के लिए रोबोट को अनुकूलित किया गया, तो AI ने लंबे हाथों और एक अलग माउंटिंग स्थिति वाले संस्करण को डिज़ाइन किया। जब उन्होंने वास्तव में वास्तविक दुनिया में इस नए डिज़ाइन को बनाया, तो इसने मूल डिज़ाइन की तुलना में वांछित गति का अनुसरण करने में 73% कम त्रुटि दिखाई और अपने जोड़ों को 30% धीमी गति से चलाया (जो कि अच्छा है, क्योंकि इसका मतलब है मोटरों पर कम तनाव)।

हालाँकि, शोध पत्र सावधानीपूर्वक नोट करता है कि यह एक सिमुलेशन-प्रधान सफलता है। जबकि कपड़े फेंकने वाले रोबोट के साथ वास्तविक दुनिया का परीक्षण सफल रहा, अधिकांश परिणाम कंप्यूटर सिमुलेशन से आते हैं। AI एक "डायनामिक्स मॉडल" है, जिसका अर्थ है कि यह भविष्यवाणी करता है कि एक रोबोट कैसे चलेगा, लेकिन इसका अपना कोई भौतिक शरीर नहीं है। शोधकर्ता यह भी बताते हैं कि AI एक ऐसा रोबोट आविष्कार नहीं कर सकता जो उसके द्वारा देखे गए दायरे से पूरी तरह बाहर हो; यह केवल उन प्रकार के हिस्सों और कनेक्शनों को मिला और सुधार सकता है जो उसने अपने प्रशिक्षण डेटा से सीखे हैं। यह ताश के पत्तों को फिर से व्यवस्थित करने में माहिर है, न कि पूरी तरह से नए भौतिक विज्ञान का निर्माता।

सबसे रोमांचक विशेषताओं में से एक यह है कि जो मॉडल रोबोट को डिजाइन करता है, वही इसे नियंत्रित भी कर सकता है। एक बार जब AI एक नया रोबोट आकार आविष्कार कर लेता है, तो यह तुरंत रोबोट के मस्तिष्क के रूप में कार्य कर सकता है, इसे लक्ष्य पथ का अनुसरण करने के लिए निर्देश देता है। इसका मतलब है कि डिज़ाइन और कंट्रोलर पूरी तरह से मेल खाते हैं, जिससे वह सामान्य समस्या टल जाती है जहाँ एक रोबोट बनाया जाता है लेकिन सॉफ़्टवेयर यह नहीं समझ पाता कि उसे कैसे चलाना है। लेखक इसे "क्रॉस-एम्बॉडमेंट कंट्रोल" (cross-embodiment control) कहते हैं, और यह एक ऐसे भविष्य का सुझाव देता है जहाँ हम केवल विशिष्ट कार्यों के लिए रोबोट को प्रोग्राम नहीं करते, बल्कि उनसे उनके काम के लिए एक आदर्श शरीर विकसित करने को कहते हैं।

संक्षेप में, ट्रांसफॉर्मर ट्रांसफॉर्मर यह सुझाव देता है कि रोबोटिक्स का भविष्य केवल बेहतर मस्तिष्क या बेहतर शरीर के बारे में नहीं है, बल्कि उन्हें एक साथ डिजाइन करने के बारे में है। रोबोट के शरीरों को लचीले, सीखने योग्य डेटा के रूप में मानकर, यह मॉडल मशीनों को उनके कार्यों के लिए पूरी तरह से अनुकूलित करने के लिए एक "वन-स्टॉप शॉप" प्रदान करता है। हालाँकि यह अभी भी काफी हद तक सिमुलेशन में है, कपड़े फेंकने वाले रोबोट के साथ वास्तविक दुनिया का परीक्षण साबित करता है कि इसके द्वारा बनाए गए डिज़ाइन वास्तव में वास्तविक दुनिया में काम कर सकते हैं, ट्रैकिंग त्रुटियों को कम कर सकते हैं और रोबोट को अधिक कुशल बना सकते हैं। यह एक ऐसी दुनिया की ओर एक कदम है जहाँ रोबोट केवल वे उपकरण नहीं हैं जिन्हें हम बनाते हैं, बल्कि वे हमारे साथी हैं जिन्हें हम उस विशिष्ट नृत्य के लिए डिजाइन करते हैं जिसे हमें करने की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →