← नवीनतम पेपर
💻 computer science

Human Universal Grasping

यह शोधपत्र HUG को प्रस्तुत करता है, जो 10 लाख फ्रेम के विशाल एगोसेंट्रिक मानव ग्रैस्पिंग डेटासेट पर प्रशिक्षित एक फ्लो-मैचिंग मॉडल है, जो किसी भी वस्तु के लिए एकल RGB-D इमेज से विविध, रिटारगेटेबल ग्रैस्प उत्पन्न करता है, और विभिन्न एम्बॉडिमेंट्स एवं वातावरणों में ज़ीरो-शॉट रोबोटिक ग्रैस्पिंग में अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Kevin Yuanbo Wu, Tianxing Zhou, Isaac Tu, Billy Yan, Irmak Guzey, David Fouhey, Dandan Shan, Lerrel Pinto

प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kevin Yuanbo Wu, Tianxing Zhou, Isaac Tu, Billy Yan, Irmak Guzey, David Fouhey, Dandan Shan, Lerrel Pinto

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कॉफी का मग उठाना सिखा रहे हैं। आमतौर पर, इंजीनियरों को रोबोट को प्रोग्राम करने में महीनों बिताने पड़ते हैं, जिसमें वे उसे हजारों उदाहरण दिखाते हैं कि उस विशिष्ट रोबोट को अपनी उंगलियों को कैसे हिलाना चाहिए। यह एक बच्चे को जूते के फीते बांधना सिखाने जैसा है, जहाँ आप उसे केवल यह दिखाते हैं कि उसके हाथ कैसे काम करते हैं, और फिर उम्मीद करते हैं कि वह दूसरे हाथों से जूते बांधना सीख जाएगा।

यह शोध पत्र, जिसका शीर्षक "ह्यूमन यूनिवर्सल ग्रैस्पिंग" (HUG) है, एक बहुत ही सरल और स्वाभाविक समाधान प्रस्तावित करता है: बस इंसानों को ऐसा करते हुए देखें।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, साधारण शब्दों में:

1. समस्या: रोबोट अनाड़ी छात्र होते हैं

रोबोट कारखानों में दोहराव वाले कार्यों के लिए बेहतरीन होते हैं, लेकिन वे घर की अव्यवस्थित और अप्रत्याशित दुनिया में संघर्ष करते हैं। यदि आप किसी रोबोट को किसी अजीब आकार की वस्तु (जैसे अनानास या हेयरब्रश) देते हैं, तो अक्सर उसे समझ नहीं आता कि उसे बिना गिराए कैसे पकड़ना है। अधिकांश रोबोट "सिम्युलेटेड" डेटा (कंप्यूटर गेम्स) या मनुष्यों द्वारा उन्हें मैन्युअल रूप से नियंत्रित करने से प्रशिक्षित होते हैं, जो धीमा और थकाऊ होता है।

2. समाधान: "स्मार्ट ग्लासेस" फील्ड ट्रिप

शोधकर्ताओं ने महसूस किया कि इंसान पहले से ही चीजें पकड़ने में विशेषज्ञ हैं। हम बिना सोचे-समझे हर दिन हजारों चीजें उठाते हैं। रोबोट को शुरुआत से सिखाने के बजाय, उन्होंने तय किया कि वे इंसानी कार्यप्रणाली (human playbook) की नकल करेंगे।

  • डेटा संग्रह: उन्होंने लोगों को स्मार्ट चश्मा (जिसे Aria Gen 2 कहा जाता है) दिया जो नियमित चश्मे जैसा दिखता है लेकिन इसमें कैमरे और सेंसर लगे हैं।
  • मिशन: लोगों ने ये चश्मे पहने और 41 अलग-अलग इमारतों (घरों, कार्यालयों आदि) में अपना दिन बिताया। उन्होंने 6,707 अलग-अलग वस्तुओं को उठाया।
  • परिणाम: उन्होंने 1M-HUGS नामक एक विशाल लाइब्रेरी बनाई। इसमें मानव हाथों द्वारा चीजों को पकड़ने की 1 मिलियन छवियां हैं। यह मानव पकड़ का एक "यूट्यूब" जैसा है, लेकिन इसमें 3D डेप्थ (गहराई) की जानकारी भी है ताकि कंप्यूटर जान सके कि हाथ कितनी दूर है।

3. मस्तिष्क: एक "फ्लो" मॉडल

एक बार जब उनके पास डेटा आ गया, तो उन्हें रोबोट को इसे सिखाने के लिए एक तरीका चाहिए था। उन्होंने HUG नामक एक मॉडल बनाया।

HUG को एक गिरगिट या यूनिवर्सल ट्रांसलेटर के रूप में समझें:

  • इनपुट: आप उसे किसी वस्तु (जैसे काउंटर पर रखा टोस्टर) की एक फोटो (डेप्थ के साथ) दिखाते हैं। आप अपने माउस से टोस्टर पर क्लिक करते हैं।
  • प्रोसेसिंग: मॉडल अपनी 1 मिलियन मानव पकड़ वाली लाइब्रेरी को देखता है। वह पूछता है, "यदि एक इंसान इस टोस्टर को देखता, तो वह इसे कैसे पकड़ता?"
  • आउटपुट: यह केवल यह नहीं कहता कि "पकड़ो"। यह उस विशिष्ट वस्तु को पकड़ने के लिए आवश्यक सटीक स्थिति (position), रोटेशन और उंगलियों के आकार की गणना करता है।

जादुई बात यह है कि यह मॉडल यह सीखता है कि इंसान कैसे चलते/मूव करते हैं, न कि यह कि एक विशिष्ट रोबोट कैसे चलता है। यह पकड़ (grasp) की अवधारणा को सीखता है।

4. अनुवाद: मानव हाथों से रोबोटिक हाथों तक

यही सबसे चतुर हिस्सा है। मॉडल एक मानक मानव हाथ के आकार (जिसे MANO कहा जाता है) का उपयोग करके पकड़ का अनुमान लगाता है। लेकिन रोबोट के हाथ अलग होते हैं—कुछ में तीन उंगलियां होती हैं, कुछ में चार, कुछ बड़े होते हैं, कुछ छोटे।

शोधकर्ताओं ने एक रिटारगेटिंग सिस्टम (retargeting system) बनाया। कल्पना कीजिए कि आप एक डांसर हैं। आपने एक रूटीन सीखा (मानव पकड़)। अब, आपको वही रूटीन एक अलग फ्लोर लेआउट वाले स्टेज पर, या अपने से लंबे साथी के साथ परफॉर्म करना है। आप नया डांस नहीं सीखते; आप बस अपने नए साथी के अनुकूल होने के लिए अपने कदमों को समायोजित (adjust) करते हैं।

HUG यह काम तुरंत करता है। यह उस मानव हाथ की मुद्रा (pose) को लेता है जिसकी उसने भविष्यवाणी की थी और उसे रोबोट की विशिष्ट उंगलियों के अनुकूल होने के लिए गणितीय रूप से "रिटारगेट" करता है।

  • पुनः प्रशिक्षण की आवश्यकता नहीं: आपको रोबोट को फिर से सिखाने की जरूरत नहीं है। आप बस नया रोबोट जोड़ते हैं, और यह काम करता है।
  • जीरो-शॉट (Zero-shot): इसका मतलब है कि यह उन वस्तुओं पर भी काम करता है जिन्हें रोब de ने कभी नहीं देखा, उन कमरों में भी जहाँ वह कभी नहीं गया।

5. परीक्षण: "HUG-BENCH" चुनौती

यह साबित करने के लिए कि यह काम करता है, उन्होंने केवल गेंदों या बक्सों जैसी आसान चीजों पर परीक्षण नहीं किया। उन्होंने HUG-BENCH नामक एक "फाइनल एग्जाम" बनाया।

  • उन्होंने 90 कठिन वस्तुएं जुटाईं: हैंडल वाली चीजें, अजीब आकार वाली चीजें, छोटी वस्तुएं और बड़ी, भारी वस्तुएं।
  • उन्होंने सिस्टम का दो तरह से परीक्षण किया:
    1. सिमुलेशन में: एक कंप्यूटर की दुनिया जहाँ वे तेजी से हजारों बार परीक्षण कर सकते हैं।
    2. वास्तविक दुनिया में: वे एक वास्तविक रोबोट को एक वास्तविक घर में ले गए और इन 90 वस्तुओं को उठाने की कोशिश की।

परिणाम:

  • HUG टेबलटॉप पर 66.7% बार सफल रहा और वास्तविक वातावरण (अव्यवस्थित घर) में 62% बार।
  • इसने वर्तमान सर्वोत्तम रोबोट विधियों को एक बड़े अंतर से पीछे छोड़ दिया (23% से 34% बेहतर)।
  • जबकि अन्य रोबोट पिकनिक बास्केट या स्प्रे बोतल जैसी कठिन वस्तुओं पर विफल रहे, HUG ने उन्हें पकड़ना सीख लिया क्योंकि उसने पहले इंसानों को ऐसी ही चीजें करते देखा था।

सारांश

यह शोध पत्र दावा करता है कि स्मार्ट चश्मे का उपयोग करके 1 मिलियन वास्तविक मानव पकड़ एकत्र करके, उन्होंने एक ऐसा सिस्टम बनाया है जो रोबोट को मानव अंतर्ज्ञान (intuition) की नकल करके किसी भी चीज़ को, कहीं भी, किसी भी हाथ से पकड़ना सिखाता है। यह हर नई वस्तु के लिए रोबोट को प्रोग्राम करने की आवश्यकता के बिना, मानवीय कुशलता और रोबोट की अनाड़ीपन के बीच के अंतर को पाटता है।

उन्होंने क्या दावा नहीं किया:

  • उन्होंने यह दावा नहीं किया कि यह चिकित्सा सर्जरी या नाजुक नैदानिक कार्यों के लिए काम करता है।
  • उन्होंने यह दावा नहीं किया कि रोबोट जटिल बहु-चरणीय कार्य (जैसे सैंडविच बनाना) की योजना बना सकता है; यह केवल इस विशिष्ट समस्या को हल करता है कि "मैं अभी इस एक वस्तु को कैसे पकड़ूँ?"
  • उन्होंने सीमाओं का उल्लेख किया: वर्तमान में सिस्टम केवल दाएं हाथ की पकड़ (right-handed grasps) को मॉडल करता है और बहुत छोटी वस्तुओं या पूरी तरह से छिपी हुई वस्तुओं के साथ संघर्ष करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →