← नवीनतम पेपर
💻 computer science

UMI-Bench 1.0: An Open and Reproducible Real-World Benchmark for Tabletop Robotic Manipulation with UMI Data

यह शोधपत्र UMI-Bench 1.0 प्रस्तुत करता है, जो कि पहला खुला और पुनरुत्पादक वास्तविक दुनिया का बेंचमार्क है जिसे डेटा संग्रह, दृश्य रीसेट, निष्पादन और विश्लेषण को एक एकल ऑडिट योग्य प्रोटोकॉल के भीतर एकीकृत करके यूनिवर्सल मैनिपुलेशन इंटरफेस (UMI)-शैली की नीतियों के मूल्यांकन को मानकीकृत करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Shi Jin, Yuntian Wang, Yuhui Duan, Di Wu, Gaoqi Dong, Xiaohang Liu, Xiaotong Li, Hongfei Jia, Zehao Zhang, Tianyu Wang, Zhongjie Jia, Yuanqi Yao, Chenjia Bai, Zhaxizhuoma, Siao Liu, Nieqing Cao, Jin W
प्रकाशित 2026-06-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shi Jin, Yuntian Wang, Yuhui Duan, Di Wu, Gaoqi Dong, Xiaohang Liu, Xiaotong Li, Hongfei Jia, Zehao Zhang, Tianyu Wang, Zhongjie Jia, Yuanqi Yao, Chenjia Bai, Zhaxizhuoma, Siao Liu, Nieqing Cao, Jin Wang, Chao Yu, Yan Ding

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कपड़े तह करना, कपों को एक के ऊपर एक रखना या बीन्स डालना सिखा रहे हैं। आपने उसे इंसानों द्वारा ये काम करने के हजारों वीडियो दिखाए हैं। लेकिन जब आप वास्तव में उसे एक असली रसोई में रखते हैं, तो वह एक छाया की वजह से लड़खड़ा सकता है, रोशनी थोड़ी अलग होने के कारण कप गिरा सकता है, या कप के लाल के बजाय नीले होने पर भ्रमित हो सकता है।

लंबे समय तक, वैज्ञानिकों ने वीडियो गेम (सिमुलेशन) में या बहुत विशिष्ट, आदर्श सेटअप के साथ रोबोटों का परीक्षण किया। लेकिन जैसा कि यह पेपर बताता है, सिमुलेशन एक वीडियो गेम में कार चलाने जैसा है: आप नियम सीख सकते हैं, लेकिन आपने हवा को महसूस नहीं किया है, फिसलन भरी सड़क को नहीं देखा है, या सड़क पार करते हुए किसी गिलहरी के अचानक आने के झटके को नहीं झेला है।

यह पेपर UMI-Bench 1.0 पेश करता है, जो अनिवार्य रूप से वास्तविक दुनिया के रोबोटों के लिए एक मानकीकृत "ड्राइविंग टेस्ट" है।

यहाँ बताया गया है कि उन्होंने क्या किया, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "रेसिपी" बनाम "रसोई"

लेखकों ने देखा कि कई रोबोट लर्निंग सिस्टम डेटा एकत्र करने का एक विशिष्ट तरीका उपयोग करते हैं जिसे UMI (यूनिवर्सल मैनिपुलेशन इंटरफेस) कहा जाता है। UMI को एक विशिष्ट प्रकार की रेसिपी बुक की तरह समझें जहाँ निर्देश रोबोट की अपनी "आंखों" (उसकी कलाई पर लगे कैमरे) और उसके "हाथों" (ग्रिपर) से लिखे गए हैं।

समस्या यह थी कि जबकि हर कोई रोबट को प्रशिक्षित करने के लिए इस "रेसिपी बुक" का उपयोग कर रहा था, वे उन्हें एक ही "रसोई" में टेस्ट नहीं कर रहे थे।

  • एक टीम ने लाल मैट वाली मेज पर परीक्षण किया।
  • दूसरी टीम ने नीले मैट और अलग रोशनी के साथ परीक्षण किया।
  • तीसरी टीम ने वस्तुओं को थोड़ा अलग स्थान पर रखा।

यदि रोबोट A विफल होता है और रोबोट B सफल होता है, तो क्या यह इसलिए है क्योंकि रोबोट B अधिक स्मार्ट है? या क्या यह सिर्फ इसलिए है क्योंकि रोबोट B को लाल मैट के साथ किस्मत मिल गई? उनकी तुलना करने का कोई निष्पक्ष तरीका नहीं था।

2. समाधान: एक मानकीकृत "ड्राइविंग टेस्ट"

लेखकों ने UMI-Bench 1.0 बनाया। कल्पना कीजिए कि यह एक सख्ती से विनियमित ड्राइविंग टेस्ट सेंटर है जहाँ हर एक कार (रोबोट) को बिल्कुल समान परिस्थितियों का सामना करना पड़ता है।

  • वही ट्रैक: उन्होंने एक विशिष्ट मेज बनाई जिस पर एक ग्रिड है (एक विशाल गेम बोर्ड की तरह)। प्रत्येक रोबोट को वस्तुओं के साथ ठीक उसी स्थान से शुरू करना होगा।
  • वही कैमरा: प्रत्येक रोबोट को अपनी कलाई पर लगे कैमरे के माध्यम से दुनिया को देखना होगा, ठीक वैसे ही जैसे प्रशिक्षण डेटा में था। कोई "थर्ड-पर्सन" दृश्य नहीं (जैसे छत से नीचे देख रहा सुरक्षा कैमरा)।
  • वही नियम: उन्होंने 10 विशिष्ट कार्य बनाए, जो सरल से जटिल तक हैं।
    • सरल: तीन टोकरियों को एक के ऊपर एक रखना।
    • मध्यम: दो हाथों का उपयोग करके एक कप से टोकरी में बीन्स डालना।
    • कठिन: पैंट तह करना या महजोंग टाइल्स को छाँटना।
  • "सरप्राइज" तत्व: यह परीक्षण करने के लिए कि क्या रोबोट वास्तव में स्मार्ट है या उसने केवल टेस्ट को रट लिया है, उन्होंने चीजें बदल दीं।
    • कारक A (एक "नया पहनावा"): उन्होंने वस्तुओं को अलग रंगों या आकारों से बदल दिया (जैसे लाल गेंद के बजाय हरी गेंद)।
    • कारक B (एक "नया स्थान"): उन्होंने वस्तुओं को ग्रिड पर अलग-अलग स्थानों पर स्थानांतरित कर दिया।

3. उन्होंने इसका परीक्षण कैसे किया

उन्होंने तीन अलग-अलग "छात्र" रोबोटों (AI मॉडल जिन्हें π0, π0.5, और DreamZero कहा जाता है) को लिया और उन्हें प्रत्येक कार्य के लिए 50 बार इस मानकीकृत परीक्षण से गुजारा।

उन्होंने केवल यह नहीं पूछा, "क्या इसने कार्य पूरा किया?" (हाँ/नहीं)। उन्होंने एक शिक्षक की तरह उन्हें गणित के टेस्ट के लिए ग्रेड दिया:

  • पूर्ण सफलता: क्या इसने A+ प्राप्त किया? (पूरी तरह से स्टैक किया गया, कोई बिखराव नहीं)।
  • प्रगति स्कोर: क्या इसे आंशिक क्रेडिट मिला? (इसने कप उठाया, लेकिन कुछ बीन्स गिर गए)।

4. उन्हें क्या मिला (रिपोर्ट कार्ड)

परिणाम काफी खुलासा करने वाले थे:

  • "अच्छी" खबर: जब रोबोट को ठीक उसी सेटअप का सामना करना पड़ा जिस पर उसे प्रशिक्षित किया गया था, तो उसने काफी अच्छा प्रदर्शन किया। वह "देखी गई" (Seen) स्थितियों को संभाल सकता था।
  • "बुरी" खबर: जब रोबोट का सामना एक नए स्थान (कारक B) से हुआ, तो उसे नए ऑब्जेक्ट (कारक A) की तुलना में बहुत अधिक संघर्ष करना पड़ा।
    • उपमा: यह उस छात्र की तरह है जो गणित के सवाल को पूरी तरह से हल कर सकता है यदि संख्याएं उसी क्रम में हों, लेकिन पूरी तरह से भ्रमित हो जाता है यदि आप संख्याओं को दूसरे पेज पर ले जाते हैं। रोबोट कार्यों की ज्यामिति (geometry) को समझने के बजाय, चीजों के स्थान को याद करने पर बहुत अधिक निर्भर करते हैं।
  • सबसे कठिन कार्य: वे कार्य जिनमें क्रियाओं की लंबी श्रृंखला की आवश्यकता होती थी (जैसे पूरी रसोई की शेल्फ को व्यवस्थित करना) या बहुत नाजुक टाइमिंग की आवश्यकता होती थी (घूमते हुए टर्नटेबल पर कैन को पकड़ना) अत्यंत कठिन थे। सभी रोबोट लगभग 100% समय विफल रहे।

5. यह क्यों मायने रखता है

पेपर का तर्क है कि हमें रोबोटों की तुलना इस आधार पर करना बंद कर देना चाहिए कि "किसने अपनी निजी लैब में सबसे अच्छा किया।"

UMI-Bench 1.0 एक मानकीकृत राष्ट्रीय परीक्षा की तरह है। यह शोधकर्ताओं को यह कहने की अनुमति देता है, "ठीक है, रोबोट A कपड़े तह करने में बेहतर है, लेकिन रोबोट B तरल पदार्थ डालने में बेहतर है," इस विश्वास के साथ कि अंतर रोबोट के दिमाग के कारण है, कमरे की रोशनी के कारण नहीं।

यह दावा नहीं करता कि रोबोट अभी आपके घर में इंसानों की जगह लेने के लिए तैयार हैं। इसके बजाय, यह हमें वह पैमाना (रूलर) प्रदान करता है जिसकी हमें यह मापने के लिए आवश्यकता है कि हम वास्तव में उस लक्ष्य से कितनी दूर हैं, यह सुनिश्चित करते हुए कि जब हम कहते हैं कि एक रोबोट "सीख" रहा है, तो हम वास्तविक दुनिया के कौशल को माप रहे हैं, न कि केवल सिमुलेशन के करतबों को।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →