← नवीनतम पेपर
🤖 AI

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

यह शोधपत्र WatchAct प्रस्तुत करता है, जो 3,000 लॉन्ग-होराइजन इंस्टेंस वाला एक व्यापक बेंचमार्क है जो वीडियो के माध्यम से देखे गए मानवीय व्यवहार के बारे में तर्क करने की रोबोटिक मैनिपुलेशन प्रणालियों की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान अत्याधुनिक मॉडल उन कार्यों के लिए काफी संघर्ष करते हैं जिनमें इवेंट ग्राउंडिंग, प्रक्रियात्मक तर्क, इरादा अनुमान और एपिसोडिक ट्रैकिंग की आवश्यकता होती है।

मूल लेखक: Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

प्रकाशित 2026-06-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रसोई में कदम रखते हैं और आपको वहां बिखराव दिखता है: एक व्यक्ति ने दराज खोली, खाना बनाने के लिए तीन मसालों के जार निकाले, और उन्हें काउंटर पर इधर-उधर छोड़ दिया। आप एक रोबोट से कहते हैं, "जो कुछ भी जहाँ से आया था, उसे वहीं वापस रख दो।"

एक इंसान के लिए, यह बहुत आसान है। आपको याद रहता है कि क्या हुआ (जार दराज से आए थे), किस क्रम में हुआ (उन्हें एक-एक करके निकाला गया), और क्यों हुआ (खाना बनाने के लिए)। आप उस काम को सुलझाने के लिए अपने मन में इंसान की क्रियाओं के "वीडियो" का उपयोग करते हैं।

आज के रोबनों के लिए, यह एक दुःस्वप्न है। अधिकांश रोबोट बेंचमार्क रोबोट को केवल काउंटर की एक स्थिर फोटो दिखाते हैं और उनसे सफाई करने के लिए कहते हैं। वे रोबोट को वह "मूवी" नहीं देते कि वह बिखराव कैसे बना। इस संदर्भ के बिना, रोबोट केवल अनुमान लगा रहा होता है।

WatchAct एक नया परीक्षण (बेंचमार्क) है जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या रोबोट वास्तव में एक इंसान का वीडियो देख सकते हैं, समझ सकते हैं कि उन्होंने क्या किया, और फिर उस स्मृति के आधार पर सफाई कर सकते हैं या कार्य को आगे बढ़ा सकते हैं।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. परीक्षण: "जासूस और अभिनेता"

रोबोट को एक जासूस और वीडियो को एक अपराध स्थल (क्राइम सीन) की टेप के रूप में सोचें।

  • इनपुट (Input): रोबोट को किसी इंसान द्वारा कुछ करने (जैसे एक कटोरा हिलाने) का वीडियो और एक टेक्स्ट निर्देश (जैसे "कटोरे को वापस रखें") मिलता है।
  • लक्ष्य: रोबोट को छिपी हुई कहानी का पता लगाना होगा। क्या इंसान ने कटोरे को इसलिए हटाया क्योंकि उसे भूख लगी थी? क्या उसने उसे बाईं ओर या दाईं ओर हटाया? वह मूल रूप से कहाँ से आया था?
  • पैमाना (Scale): इस परीक्षण में 3,000 अलग-अलग परिदृश्य (जैसे छोटी फिल्मों का एक विशाल पुस्तकालय) शामिल हैं जो 14 अलग-अलग प्रकार की चुनौतियों को कवर करते हैं।

2. चार "मस्तिष्क कौशल" जिनका परीक्षण किया गया

शोधकर्ताओं ने कार्यों को चार श्रेणियों में व्यवस्थित किया है, जो जासूसी के विभिन्न स्तरों की तरह हैं:

  • इवेंट ग्राउंडिंग (सुराग पहचानना): क्या रोबोट एक वीडियो देख सकता है और कह सकता है, "आह, 3 सेकंड पर, इंसान ने लाल कप उठाया"? यह एक फिल्म के उस विशिष्ट क्षण को खोजने जैसा है जो महत्वपूर्ण है।
  • प्रोसीजरल रीजनिंग (नुस्खा समझना): क्या रोबोट घटनाओं के क्रम को समझ सकता है? यदि किसी इंसान ने शेल्फ पर एक किताब रखी, फिर मेज पर एक कप रखा, तो रोबोट को इसे उलटने या जारी रखने के लिए उस क्रम को जानना होगा।
  • इम्प्लिसिट इंटेंट इन्फरेंस (मन को पढ़ना): कभी-कभी इंसान अपनी बात नहीं कहते; वे बस इशारा करते हैं। यदि कोई इंसान अस्पष्ट रूप से एक जार की ओर इशारा करता है, तो क्या रोबोट अनुमान लगा सकता है, "ओह, वे चाहते हैं कि मैं इसे खोलूँ"?
  • एपिसोडिक रीजनिंग (स्मृति परीक्षण): क्या रोबोट याद रख सकता है कि दृश्य कैसे बदला? यदि किसी इंसान ने कुर्सी को कोने से हटाकर बीच में रख दिया, तो रोबोट को उसका "मूल घर" जानने की आवश्यकता है ताकि वह उसे वापस रख सके।

3. उन्होंने रोबोटों का परीक्षण कैसे किया

शोधकर्ताओं ने केवल रोबोट को "इसे करो" नहीं कहा। उन्होंने रोबोट के दिमाग को दो भागों में विभाजित किया ताकि यह देखा जा सके कि वह कहाँ विफल होता है:

  1. द प्लानर (दिमाग): क्या रोबोट वीडियो देख सकता है और चरण-दर-चरण योजना लिख सकता है? (जैसे, "1. जार उठाएं। 2. शेल्फ तक ले जाएं।")
  2. द डूअर (हाथ): यदि आप रोबोट को एक परफेक्ट योजना देते हैं, तो क्या वह इसे करने के लिए अपने हाथ वास्तव में चला सकता है?

उन्होंने इसे एक कंप्यूटर सिमुलेशन और एक वास्तविक रोबोट आर्म (Franka Research 3) पर टेस्ट किया।

4. परिणाम: "रोबोट अभी भी सीख रहे हैं"

परिणाम विनम्र करने वाले थे। यहाँ तक कि आज के सबसे स्मार्ट AI मॉडल भी बुरी तरह संघर्ष कर रहे थे।

  • "दिमाग" विफल रहा: जब वीडियो देखने और योजना लिखने के लिए पूछा गया, तो सबसे अच्छे AI (Gemini-3.1-Pro) ने केवल 36.8% सही उत्तर दिए। इंसान 97.1% सही थे। AI मूल रूप से आधे से अधिक कार्यों पर केवल अनुमान लगा रहा है।
  • "हाथ" विफल रहे: भले ही शोधकर्ताओं ने रोबोट को एक परफेक्ट योजना दी थी (ताकि "दिमाग" वाला हिस्सा समस्या न हो), रोबोट के "हाथों" (पॉलिसी) की सफलता दर केवल 21.5% रही। यह एक परफेक्ट रेसिपी होने के बावजूद केक जला देने जैसा है क्योंकि आपको ओवन का उपयोग करना नहीं आता।
  • वास्तविक दुनिया कठिन है: जब उन्होंने इसे एक वास्तविक रोबोट आर्म पर आज़माया, तो सफलता दर और भी गिरकर 14.0% रह गई।

5. वे क्यों विफल होते हैं?

पेपर में तीन मुख्य कारण मिले कि रोबोट क्यों विफल हो रहे हैं:

  • लंबी कहानियाँ: यदि वीडियो लंबा है और इसमें कई चरण हैं (जैसे 6-चरणीय कुकिंग प्रक्रिया), तो रोबोट भ्रमित हो जाता है और अंत तक पहुँचते-पहुँचते शुरुआत को भूल जाता है।
  • परिप्रेक्ष्य (Perspective) के मुद्दे: यदि वीडियो एक अजीब कोण से फिल्माया गया है (जैसे इंसान के पीछे से) या निर्देश कहते हैं "इंसान के बाईं ओर," तो रोबोट खो जाता है। वह "इंसान के बाएं" को "रोबोट के बाएं" में अनुवाद नहीं कर पाता।
  • नई चीजें: यदि रोबोट ऐसी वस्तु देखता है जिसे उसने पहले नहीं देखा है (जैसे किसी नए प्रकार का बॉक्स), तो वह जम जाता है। वह अपने ज्ञान का सामान्यीकरण (generalize) नहीं कर पाता।

निष्कर्ष

WatchAct एक वास्तविकता की जाँच है। यह दिखाता है कि जबकि रोबोट एक स्थिर कमरे में चीजों को इधर-उधर करने में अच्छे हो रहे हैं, वे लोगों को देखने, बिखराव के पीछे की कहानी को समझने और यह समझने में बहुत खराब हैं कि आगे क्या करना है।

पेपर यह निष्कर्ष निकालता है कि हम घर में हमारे साथ वास्तव में काम करने वाले रोबोटों के मामले में अभी बहुत दूर हैं, क्योंकि वे अभी भी उस तरह से "देखकर और सीखकर" नहीं चल सकते जैसे इंसान करते हैं। उन्हें हमें रसोई में मदद करने के लिए भरोसेमंद बनने से पहले वीडियो में कड़ियों को जोड़ने में बहुत बेहतर होना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →