← नवीनतम पेपर
💻 computer science

Hoi! - A Multimodal Dataset for Force-Grounded, Cross-View Articulated Manipulation

यह शोधपत्र "Hoi!" को प्रस्तुत करता है, जो एक मल्टीमॉडल डेटासेट है जिसमें 381 वस्तुओं और 38 वातावरणों के माध्यम से आर्टिकुलेटेड मैनिपुलेशन (articulated manipulation) के 3,048 अनुक्रम शामिल हैं, जो मानव और रोबोटिक अंतःक्रिया की समझ के बीच के अंतर को पाटने के लिए चार विशिष्ट स्वरूपों (embodiments) से दृश्य, बल और स्पर्श संबंधी डेटा को अनूठे रूप से एकीकृत करता है।

मूल लेखक: Tim Engelbracht, René Zurbrügg, Matteo Wohlrapp, Martin Büchner, Abhinav Valada, Marc Pollefeys, Hermann Blum, Zuria Bauer

प्रकाशित 2026-04-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tim Engelbracht, René Zurbrügg, Matteo Wohlrapp, Martin Büchner, Abhinav Valada, Marc Pollefeys, Hermann Blum, Zuria Bauer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को आपकी रसोई के एक जिद्दी, चिपचिपे दराज (drawer) को खोलने का तरीका सिखा रहे हैं। यदि आप केवल रोबोट को इसे करते हुए एक वीडियो दिखाते हैं, तो रोबोट आपके हाथ को चलते हुए तो देख सकता है, लेकिन उसे यह पता नहीं चलेगा कि वास्तव में कितने धक्के या खिंचाव की आवश्यकता है। वह इसे खोलने के लिए बहुत ज़ोर लगा सकता है और हैंडल तोड़ सकता है, या इतना कम ज़ोर लगा सकता है कि वह खुल ही न पाए।

यह शोध पत्र एक नया टूल पेश करता है जिसे Hoi! (अर्थात "Hands-on Interaction") कहा जाता है, जो ठीक इसी समस्या को हल करने के लिए बनाया गया है। Hoi! को एक "सुपर-टीचर के टूलकिट" के रूप में समझें।

यहाँ उन्होंने जो किया है उसका सरल विवरण दिया गया है, जिसमें रोजमर्रा के उदाहरणों का उपयोग किया गया है:

1. समस्या: "मूक" (Silent) वीडियो

अधिकांश रोबोट ट्रेनिंग डेटा एक मूक फिल्म की तरह है। आप अभिनेताओं को हिलते हुए देख सकते हैं (वीडियो), लेकिन आप उनके प्रभाव (बल/force) की आवाज़ नहीं सुन सकते।

  • वर्तमान डेटासेट्स: यह एक कुकिंग शो की तरह है जहाँ आप शेफ को प्याज काटते हुए देखते हैं, लेकिन आपको यह नहीं पता कि वे चाकू पर कितना दबाव डाल रहे हैं।
  • अंतराल (The Gap): रोबोट्स को न केवल यह जानने की ज़रूरत है कि क्या करना है, बल्कि यह भी कि उसे कितनी ताकत से करना है।

2. समाधान: "Hoi! ग्रिपर"

शोधकर्ताओं ने एक विशेष रोबोटिक हाथ (ग्रिपर) बनाया है जो एक सुपर-सेंस मानव हाथ की तरह काम करता है।

  • "जादुई छड़ी" (The Magic Stick): कल्पना कीजिए कि एक इंसान एक छड़ी पकड़े हुए है जिसके अंत में एक कैमरा और एक सुपर-सेंसिटिव प्रेशर सेंसर लगा है। जब वह दराज का हैंडल पकड़ता है, तो वह छड़ी सटीक रूप से मापती है कि वह कितनी ज़ोर से दबा रहा है या खींच रहा है।
  • "डिजिटल स्किन": इस ग्रिपर के "फिंगरटिप्स" विशेष जेल से बने होते हैं जो वस्तु की बनावट और दबाव को महसूस कर सकते हैं, ठीक वैसे ही जैसे आपकी त्वचा किसी दरवाज़े को छूने पर महसूस करती है।

3. डेटासेट: एक "मल्टी-कैमरा, मल्टी-सेंस" मूवी सेट

उन्होंने केवल एक व्यक्ति को एक दराज खोलते हुए रिकॉर्ड नहीं किया। उन्होंने 381 अलग-अलग वस्तुओं (फ्रिज, डिशवॉशर, कैबिनेट) और 38 अलग-अलग कमरों को कवर करने वाले 3,048 वीडियो क्लिप्स की एक विशाल लाइब्रेरी बनाई।

यह सुनिश्चित करने के लिए कि रोबोट सब कुछ सीख ले, उन्होंने हर एक क्रिया को चार अलग-अलग दृष्टिकोणों से एक साथ फिल्माया:

  1. मानव हाथ: एक सामान्य व्यक्ति द्वारा दरवाज़ा खोलना।
  2. "रिस्ट-कैम" मानव: एक व्यक्ति जिसने अपनी कलाई पर कैमरा पहना हुआ है, ताकि रोबलेट वही देख सके जो इंसान देख रहा है।
  3. "रोबोट हाथ" (UMI): एक मानक रोबोट ग्रिपर जो वही कार्य कर रहा है।
  4. "सुपर-हैंड" (Hoi! ग्रिपर): यह विशेष सेंसर-युक्त हाथ जो बल (force) और स्पर्श (touch) का डेटा रिकॉर्ड करता है।

उपमा (Analogy): कल्पना कीजिए कि आप एक जादू का खेल फिल्मा रहे हैं। आपके पास एक वाइड-एंगल कैमरा (exocentric) है, जादूगर के सिर पर एक कैमरा (egocentric) है, और जादूगर के हाथ पर एक कैमरा (wrist) है। लेकिन Hoi! के साथ, आपके पास एक "फोर्स कैमरा" भी है जो रिकॉर्ड करता है कि जादूगर रस्सी को कितनी ज़ोर से खींच रहा है। अब, रोबोट दृश्य ट्रिक और शारीरिक प्रयास दोनों को एक साथ सीख सकता है।

4. यह क्यों महत्वपूर्ण है: "अनुवाद" की समस्या

Hoi! का सबसे बड़ा लक्ष्य रोबोट्स को मानवीय कौशल को रोबोटिक कौशल में अनुवाद करने में मदद करना है।

  • पहले: यदि कोई रोबोट किसी इंसान को फ्रिज खोलते हुए देखता है, तो वह उस गति की नकल करने की कोशिश कर सकता है लेकिन विफल हो सकता है क्योंकि फ्रिज भारी है या अटका हुआ है।
  • Hoi! के साथ: रोबोट वीडियो देख सकता है, इंसान के हाथ को देख सकता है, और "फोर्स डेटा" की जांच कर सकता है कि, "आह, मैं देख रहा हूँ कि इंसान ने 15 न्यूटन के बल से खींचा। मुझे भी उतना ही करना होगा।"

5. परिणाम: रोबोट अभी भी सीख रहे हैं

शोधकर्ताओं ने मौजूदा AI मॉडल्स का इस नए डेटासेट पर परीक्षण किया।

  • अच्छी खबर: मॉडल्स इस बात का अनुमान लगाने में बेहतर हो गए कि वे किस तरह की वस्तु देख रहे हैं (जैसे, "यह एक स्लाइडिंग दराज है")।
  • बुरी खबर: मॉडल्स बल (force) का अनुमान लगाने में बहुत खराब थे। जब उन्होंने अनुमान लगाने की कोशिश की कि कितना ज़ोर से खींचना है, तो वे अक्सर बहुत गलत साबित हुए।
  • सबक: यह साबित करता है कि वर्तमान AI "देखने" में तो अच्छा है लेकिन "महसूस करने" में बुरा है। Hoi! उस लापता "महसूस करने" वाले डेटा को प्रदान करता है ताकि भविष्य के रोबोट नाजुक वस्तुओं के साथ कोमल और भारी वस्तुओं के साथ शक्तिशाली बनना सीख सकें।

सारांश

Hoi! एक विशाल, मल्टी-सेंसरी लाइब्रेरी है जो रोबोट्स को यह सिखाती है कि किसी दरवाज़े को खोलने के लिए इंसान को देखने और उसे खोलने के लिए कितनी ताकत की आवश्यकता होती है, इसके बीच का अंतर क्या है। यह "देखने" और "करने" के बीच के अंतर को पाटता है, जिससे रोबोट अनाड़ी शुरुआती स्तर से बदलकर कुशल, बल-जागरूक मददगार बन सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →