← नवीनतम पेपर
🤖 AI

ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos

यह शोध पत्र ToG-Bench प्रस्तुत करता है, जो एगोसेंट्रिक (egocentric) वीडियो के लिए पहला कार्य-उन्मुख (task-oriented) स्थानिक-कालिक वीडियो ग्राउंडिंग बेंचमार्क है, जो मौजूदा ऑब्जेक्ट-सेंट्रिक दृष्टिकोणों की सीमाओं को संबोधित करने के लिए कार्य-उन्मुख, स्पष्ट-अस्पष्ट द्वैत (explicit-implicit dual), और एक-से-अनेक ग्राउंडिंग परिदृश्यों को प्रदर्शित करता है ताकि एम्बॉडीड इंटेलिजेंस (embodied intelligence) का बेहतर मूल्यांकन और विकास किया जा सके।

मूल लेखक: Qi'ao Xu, Tianwen Qian, Yuqian Fu, Kailing Li, Yang Jiao, Jiacheng Zhang, Xiaoling Wang, Liang He

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qi'ao Xu, Tianwen Qian, Yuqian Fu, Kailing Li, Yang Jiao, Jiacheng Zhang, Xiaoling Wang, Liang He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपने घर के कामों में आपकी मदद करने के लिए सिखा रहे हैं। आप सिर्फ यह नहीं चाहते कि रोबोट कहे, "मुझे मेज पर एक लाल कप दिख रहा है।" आप चाहते हैं कि वह आपके इरादे (intent) को समझे। यदि आप कहते हैं, "मुझे प्यास लगी है, मेरे लिए थोड़ा पानी लाओ," तो रोबोट को यह समझना होगा कि उसे नल खोजना होगा, नल (faucet) खोलना होगा, और एक ग्लास उठाना होगा—भले ही आपने नल या ग्लास का स्पष्ट रूप से उल्लेख न किया हो।

यह बिल्कुल वैसा ही है जैसा ToG-Bench पेपर के बारे में है। यह एक नया "परीक्षा" (exam) है जिसे यह परीक्षण करने के लिए बनाया गया है कि AI रोबोट प्रथम-व्यक्ति परिप्रेक्ष्य (जैसे अपने सिर पर कैमरा लगाकर) से मानवीय कार्यों को कितनी अच्छी तरह समझ सकते हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इस पेपर का विवरण दिया गया है:

1. समस्या: "वर्णनात्मक" रोबोट बनाम "कार्य-उन्मुख" रोबोट

पिछले AI परीक्षण "I Spy" (मैं देख रहा हूँ) खेल खेलने जैसे थे।

  • पुराना तरीका: आप कहते हैं, "नीला तकिया ढूँढो।" रोबोट नीली और मुलायम चीज़ों को खोजता है। यह आसान है क्योंकि रोबट केवल शब्दों को चित्रों से मिलाता है।
  • वास्तविक दुनिया: आप कहते हैं, "कॉफी बनाओ।" रोबोट को पता होना चाहिए कि "कॉफी बनाने" के लिए एक मशीन, बीन्स, एक फिल्टर और एक मग की आवश्यकता होती है। उसे यह समझना होगा कि क्या छूना है और कब छूना है, भले ही आपने हर एक चीज़ की सूची न दी हो।

लेखकों ने महसूस किया कि वर्तमान AI "I Spy" में बहुत अच्छा है लेकिन "कॉफी बनाओ" में बहुत खराब है। यह केवल विवरण को समझता है, लक्ष्य को नहीं।

2. समाधान: ToG-Bench (नया परीक्षा)

टीम ने ToG-Bench (टास्क-ओरिएंटेड ग्राउंडिंग) नामक एक नया बेंचमार्क बनाया है। इसे रोबोट के लिए ड्राइविंग टेस्ट की तरह समझें। केवल "स्टॉप साइन देखें" कहने के बजाय, वे उनसे "किराने की दुकान तक जाने और दूध खरीदने" के लिए कहते हैं।

इस परीक्षा के तीन कठिन नियम हैं:

  • "छिपे हुए सुराग" का नियम (स्पष्ट बनाम अंतर्निहित): कभी-कभी आप कहते हैं "लाइट चालू करो" (स्पष्ट: लाइट स्विच)। कभी-कभी आप कहते हैं "यहाँ अंधेरा है" (अंतर्निहित: रोबोट को यह समझना होगा कि उसे लाइट स्विच ढूंढने की आवश्यकता है, भले ही आपने "स्विच" नहीं कहा)। रोबोट को खाली जगहों को भरने के लिए सामान्य ज्ञान (common sense) का उपयोग करना होगा।
  • "टीमवर्क" का नियम (एक-से-अनेक): एक एकल निर्देश के लिए अक्सर कई उपकरणों की आवश्यकता होती है। यदि आप कहते हैं "व्हाइटबोर्ड साफ करें," तो रोबोट को बोर्ड, मार्कर, और इरेज़र ढूंढना होगा। वह केवल एक चीज़ नहीं ढूंढ सकता; उसे पूरी टीम की आवश्यकता है।
  • "समय यात्रा" का नियम (स्थान-कालिक/Spatio-Temporal): रोबोट को केवल वस्तु को ढूंढना ही नहीं है; उसे यह भी जानना है कि उसके साथ कब इंटरैक्ट करना है। उसे वस्तु को ट्रैक करना होगा जब आप कमरे में घूम रहे हों, न कि केवल एक स्थिर तस्वीर की तरह।

3. उन्होंने इसे कैसे बनाया (असेंबली लाइन)

इस परीक्षा को बनाना कठिन था क्योंकि आप केवल एक इंसान को 100 वीडियो के लिए 2,700 जटिल निर्देश लिखने के लिए नहीं कह सकते। इसमें बहुत समय लगेगा।

  • पाइपलाइन: उन्होंने एक "स्मार्ट असिस्टेंट" (Gemini नामक एक शक्तिशाली AI) का उपयोग किया जो वीडियो देखता है और "अपने हाथ धोएं" जैसे कार्य सुझाता है।
  • सुरक्षा जांच: फिर, वास्तविक मनुष्यों ने संपादकों के रूप में भूमिका निभाई। उन्होंने जांचा: "क्या नल वास्तव में दिखाई दे रहा है? क्या निर्देश सुरक्षित है? क्या रोबोट ने पानी को सही ढंग से ट्रैक किया?"
  • परिणाम: उच्च गुणवत्ता वाला डेटासेट जिसमें 100 वीडियो के साथ 2,700 से अधिक कार्य शामिल हैं, जो सरल कार्यों से लेकर जटिल, बहु-चरणीय घरेलू कामों तक सब कुछ कवर करते हैं।

4. परिणाम: "स्मार्ट लेकिन अनाड़ी" रोबोट

लेखकों ने दुनिया के बेहतरीन AI मॉडल (जैसे GPT-5 और Gemini) का इस नए एग्जाम पर परीक्षण किया। परिणाम अच्छे और बुरे समाचारों का मिश्रण थे:

  • अच्छी खबर: AI विचार को समझने में बहुत स्मार्ट हैं। यदि आप कहते हैं "कॉफी बनाओ," तो वे आमतौर पर बता सकते हैं, "ठीक है, मुझे कॉफी मशीन की आवश्यकता है।" वे "क्या" और "क्यों" के मामले में बहुत अच्छे हैं।
  • बुरी खबर: वे "कहाँ" और "कब" के मामले में बहुत खराब हैं।
    • विचलन (The Drift): कल्पना कीजिए कि एक रोबोट चलते समय कप पकड़ने की कोशिश कर रहा है। AI जानता है कि वह कप पकड़े हुए है, लेकिन जैसे ही कैमरा हिलता है, AI उसका पीछा खो देता है। वह कप के बजाय दीवार की ओर इशारा कर सकता है।
    • "छिपी हुई" संघर्ष: जब कार्य के लिए उस वस्तु को पहचानने की आवश्यकता थी जिसका आपने उल्लेख नहीं किया था (जैसे नल), तो AI का प्रदर्शन काफी गिर गया।
    • जटिलता का पतन (Complexity Crash): जब एक साथ तीन चीजें खोजने (जैसे कंप्यूटर, माउस और कीबोर्ड) के लिए कहा गया, तो AI भ्रमित हो गया और उन सभी को सही ढंग से खोजने में विफल रहा।

मुख्य निष्कर्ष

यह पेपर एक चेतावनी है। हमने ऐसे AI बनाए हैं जो रेसिपी पढ़ सकते हैं और कहानी समझ सकते हैं, लेकिन हमने उन्हें वास्तविक रसोई में घूमते हुए वास्तव में खाना बनाना नहीं सिखाया है।

ToG-Bench इसे ठीक करने की दिशा में पहला कदम है। यह हमें दिखाता है कि रोबोट कहाँ विफल हो रहे हैं ताकि इंजीनियर अगली पीढ़ी के AI बना सकें जो केवल दुनिया को "देखते" नहीं हैं, बल्कि वास्तव में काम पूरा करने के लिए उसके साथ इंटरैक्ट करना समझते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →