← नवीनतम पेपर
💻 computer science

T-Rex: Tactile-Reactive Dexterous Manipulation

यह शोध पत्र T-Rex को प्रस्तुत करता है, जो एक स्पर्श-प्रतिक्रियात्मक (tactile-reactive) हेरफेर ढांचा है जो एक नवीन 100-घंटे के स्पर्श-समृद्ध डेटासेट, एक टेम्पोरल टैक्टाइल VQ-VAE एनकोडर और एक वेरिएबल-रेट मिक्स्चर-ऑफ-ट्रांसफॉर्मर आर्किटेक्चर को जोड़ता है, जो नाजुक बल नियंत्रण और विरूपणीय वस्तु हेरफेर कार्यों में मौजूदा विजन-लैंग्वेज-एक्शन मॉडलों की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Dantong Niu (Linxi), Zhuoyang Liu (Linxi), Zekai Wang (Linxi), Boning Shao (Linxi), Zhao-Heng Yin (Linxi), Anirudh Pai (Linxi), Yuvan Sharma (Linxi), Stefano Saravalle (Linxi), Ruijie Zheng (Linxi), J
प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dantong Niu (Linxi), Zhuoyang Liu (Linxi), Zekai Wang (Linxi), Boning Shao (Linxi), Zhao-Heng Yin (Linxi), Anirudh Pai (Linxi), Yuvan Sharma (Linxi), Stefano Saravalle (Linxi), Ruijie Zheng (Linxi), Jing Wang (Linxi), Ryan Punamiya (Linxi), Mengda Xu (Linxi), Yuqi Xie (Linxi), Yunfan Jiang (Linxi), Letian Fu (Linxi), Konstantinos Kallidromitis (Linxi), Matteo Gioia (Linxi), Junyi Zhang (Linxi), Jiaxin Ge (Linxi), Haiwen Feng (Linxi), Fabio Galasso (Linxi), Wei Zhan (Linxi), David M. Chan (Linxi), Yutong Bai (Linxi), Roei Herzig (Linxi), Jiahui Lei (Linxi), Fei-Fei Li (Linxi), Ken Goldberg (Linxi), Jitendra Malik (Linxi), Pieter Abbeel (Linxi), Yuke Zhu (Linxi), Danfei Xu (Linxi), Jim (Linxi), Fan, Trevor Darrell

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को नाजुक काम करना सिखा रहे हैं, जैसे ब्रश पर टूथपेस्ट लगाना, बिना फटे स्टिकर छीलना, या एक नाजुक अंडे को उठाना। एक इंसान के लिए, ये काम स्वाभाविक लगते हैं क्योंकि हम केवल अपनी आँखों पर निर्भर नहीं होते; हम अपनी स्पर्श की इंद्रिय (sense of touch) पर भी भरोसा करते हैं। यदि टूथपेस्ट की ट्यूब फिसलने वाली महसूस होती है, तो हमारी उंगलियां तुरंत दबाव को समायोजित कर लेती हैं। यदि कोई कार्ड अटका हुआ है, तो हमारा अंगूठा घर्षण (friction) को महसूस करता है और अधिक जोर लगाता है।

वर्तमान रोबोट ऐसे लोगों की तरह हैं जो इन कार्यों को मोटे, भारी ओवन मिट्स (oven mitts) पहनकर और आंखों पर पट्टी बांधकर करने की कोशिश कर रहे हैं। वे देख सकते हैं, लेकिन वे वास्तविक समय में दुनिया को "महसूस" नहीं कर सकते।

यह पेपर T-Rex (टैक्टाइल-रिएक्टिव डेक्सट्रस मैनिपुलेशन) पेश करता है, जो एक नया सिस्टम है जो रोबोट को "सुपर-टच" की क्षमता देता है, जिससे वे बिल्कुल इंसानों की तरह महसूस होने वाली चीजों पर तुरंत प्रतिक्रिया दे पाते हैं।

यहाँ बताया गया है कि T-Rex कैसे काम करता है, जिसे तीन सरल भागों में बांटा गया है:

1. "दिमाग" बनाम "रिफ्लेक्स" (आर्किटेक्चर)

अधिकांश रोबोट के दिमाग धीमे होते हैं। वे एक तस्वीर देखते हैं, सोचते हैं कि क्या करना है, और फिर हिलते हैं। नाजुक स्पर्श के लिए यह बहुत धीमा है। T-Rex अपने दिमाग को दो विशिष्ट भागों में विभाजित करता है, जो एक कंडक्टर और एक सोलोइस्ट (soloist) की तरह मिलकर काम करते हैं:

  • कंडक्टर (एक्शन एक्सपर्ट): यह हिस्सा धीरे काम करता है (लगभग 5 बार प्रति सेकंड)। यह कैमरे और भाषा के निर्देशों (जैसे, "टूथपेस्ट लगाएं") को देखता है ताकि बड़ी तस्वीर की योजना बनाई जा सके। यह एक ऑर्केस्ट्रा के कंडक्टर की तरह है, जो सामान्य लय और दिशा निर्धारित करता है।
  • सोलोइस्ट (टैक्टाइल एक्सपर्ट): यह हिस्सा बहुत तेज़ काम करता है (लगभग 20 बार प्रति सेकंड)। यह कैमरे को नहीं देखता; यह केवल रोबोट की "उंगलियों के पोरों" की बात सुनता है। यदि कंडक्टर कहता है "ट्यूब को दबाएं," तो सोलोइस्ट महसूस करता है कि ट्यूब फिसल रही है या नहीं और तुरंत दबाव को ठीक करता है। यह एक रिफ्लेक्स की तरह है जो सोचने से भी तेज़ होता है।

पेपर एक विशेष "मिक्स-ऑफ-एक्सपर्ट्स" आर्किटेक्चर का उपयोग करता है ताकि ये दोनों भाग तेज़ रिफ्लेक्स को धीमा किए बिना एक-दूसरे से बात कर सकें।

2. "स्कूली शिक्षा" (प्रशिक्षण रेसिपी)

आप केवल रोबोट को 100 वीडियो दिखाकर यह नहीं सिखा सकते कि महसूस कैसे किया जाता है। इसे एक विशिष्ट प्रकार की शिक्षा की आवश्यकता है, जिसे लेखक तीन-चरणों वाली रेसिपी कहते हैं:

  • चरण 1: सामान्य शिक्षा (मानवीय वीडियो): पहले, वे रोबोट को दैनिक कार्यों (जैसे खाना बनाना या सफाई करना) के 22,000 घंटों के वीडियो दिखाकर सिखाते हैं। यह रोबोट को गति की "शब्दावली" सिखाता है—कैसे पहुंचना है, कैसे पकड़ना है, और कैसे हाथ हिलाना है। यह रोबोट को यह सिखाता है कि इंसान दुनिया के साथ कैसे व्यवहार करते हैं, लेकिन यह अभी तक महसूस करना नहीं सीखता है।
  • चरण 2: विशेष इंटर्नशिप (T-Rex डेटासेट): यही इस पेपर का बड़ा योगदान है। टीम ने 100 घंटे का डेटा रिकॉर्ड किया जिसमें एक इंसान एक रोबोट को टेलीऑपरेट कर रहा था (दूर से नियंत्रित कर रहा था) और विशेष दस्ताने पहने हुए था जो हर सूक्ष्म कंपन, दबाव और फिसलन को रिकॉर्ड करते हैं।
    • उपमा: कल्पना कीजिए कि एक संगीत छात्र जिसने हजारों सिम्फनी सुनी हैं (चरण 1) लेकिन उसने कभी वाद्य यंत्र नहीं बजाया है। चरण 2 में, वे एक मास्टर टीचर के साथ 100 घंटे प्रैक्टिस रूम में बिताते हैं, यह सीखने के लिए कि सही ध्वनि बनाने के लिए कुंजियों (keys) को ठीक से कैसे दबाना है। यहीं पर रोबोट "स्पर्श" को "क्रिया" से जोड़ना सीखता है।
  • चरण 3: अंतिम पॉलिश (कार्य-विशिष्ट ट्यूनिंग): अंत में, वे रोबोट को उस विशिष्ट कार्य के कुछ उदाहरण दिखाते हैं जिसे उसे करना है (जैसे "इस विशिष्ट ताले को खोलना")। पहले दो चरणों के कारण, रोबोट को कार्य में महारत हासिल करने के लिए बहुत कम डेटा की आवश्यकता होती है।

3. "टेस्ट ड्राइव" (परिणाम)

शोधकर्ताओं ने कठिन बल नियंत्रण (force control) वाले 12 कठिन कार्यों पर T-Rex का परीक्षण किया, जैसे:

  • स्टिकर छीलना।
  • कार्ड को स्लॉट में डालना।
  • प्लेट पोंछना।
  • ताला खोलना।

परिणाम:

  • T-Rex मौजूदा सर्वश्रेष्ठ रोबोट मॉडलों की तुलना में 30% अधिक बार सफल रहा।
  • "स्पर्श" प्रशिक्षण (चरण 2) के बिना, रोबोट इन कार्यों में बुरी तरह विफल हो गया, भले ही उसने सभी मानवीय वीडियो देखे हों।
  • यह सिस्टम बहुत डेटा-कुशल (data-efficient) भी था। यह बहुत कम उदाहरणों के साथ नए कार्य सीख सकता था क्योंकि इसकी "मसल मेमोरी" पहले से ही 100 घंटे की इंटर्नशिप के दौरान बन चुकी थी।

सारांश

T-Rex को केवल एक ऐसे रोबोट के रूप में न सोचें जो केवल "देखता" और "पकड़ता" है, बल्कि एक ऐसे रोबोट के रूप में देखें जो महसूस करता है और प्रतिक्रिया देता है। मानव गति के विशाल पुस्तकालय को एक विशेष "स्पर्श इंटर्नशिप" के साथ जोड़कर, लेखकों ने एक ऐसा सिस्टम बनाया है जो नाजुक, संपर्क-प्रधान कार्यों को उस स्तर की निपुणता के साथ संभाल सकता है जो पहले मशीनों के लिए असंभव था। यह साबित करता है कि रोबोटों के वास्तव में फुर्तीला होने के लिए, उन्हें दुनिया को केवल देखना ही नहीं, बल्कि महसूस करना भी सीखना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →