← नवीनतम पेपर
🤖 AI

The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering

यह तकनीकी रिपोर्ट एगोसक्रॉस (EgoCross) चैलेंज का परिचय देती है, जो एगोंविज़ (EgoVis) 2026 द्वारा आयोजित एक क्रॉस-डोमेन एगोसेंट्रिक वीडियो प्रश्न उत्तर बेंचमार्क है, जिसने दो विशिष्ट ट्रैक्स के माध्यम से चार विशेष डोमेन में मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का मूल्यांकन किया, जिसके परिणामस्वरूप क्षेत्र को आगे बढ़ाने के लिए 1,500 से अधिक सबमिशन और सार्वजनिक रूप से जारी संसाधन प्राप्त हुए।

मूल लेखक: Yuqian Fu, Tianwen Qian, Yanjun Li, Yu Li, Kunyu Peng, Xu Zheng, Yongqin Xian, Alessio Tonioni, Yanwei Fu, Xiaoling Wang, Danda Paudel, Federico Tombari, Luc Van Gool, Leyi Wu, Yifan Zhao, Jinjie Zhan
प्रकाशित 2026-08-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuqian Fu, Tianwen Qian, Yanjun Li, Yu Li, Kunyu Peng, Xu Zheng, Yongqin Xian, Alessio Tonioni, Yanwei Fu, Xiaoling Wang, Danda Paudel, Federico Tombari, Luc Van Gool, Leyi Wu, Yifan Zhao, Jinjie Zhang, Yinchuan Li, Yingcong Chen, Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Yupeng Hu, Weili Guan, Liqiang Nie, Takuya Murakawa, Toru Tamaki, Yi Wen, Zhenglin Du, Zhengyang Li, Lingling Li, Licheng Jiao, Wenping Ma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपने सिर पर लगे कैमरे के माध्यम से दुनिया को समझना सिखा रहे हैं। यह एर्गोसेंट्रिक वीडियो अंडरस्टैंडिंग (egocentric video understanding) का क्षेत्र है, जहाँ कंप्यूटर पहले व्यक्ति के दृष्टिकोण से जीवन को समझने की कोशिश करते हैं, ठीक वैसे ही जैसे आप देखते हैं। आमतौर पर, इन रोबोट्स को टोस्ट बनाने या कपड़े तह करने जैसे उबाऊ, रोज़मर्रा के कार्यों पर प्रशिक्षित किया जाता है। लेकिन वास्तविक जीवन अव्यवस्थित है और आश्चर्यों से भरा है। क्या होता है जब उस रोबोट को हार्ट सर्जरी करने, एक जटिल मशीन को जोड़ने, पहाड़ से स्कीइंग करने, या एक कुत्ते के नजरिए से दुनिया देखने की आवश्यकता होती है? यह "डोमेन गैप" (domain gap) है: एक अंडा पकाने के ज्ञान से लेकर एक स्कैल्पल (सर्जिकल चाकू) को संभालने के ज्ञान तक की डरावनी छलांग। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: क्या एक स्मार्ट कंप्यूटर बिना सब कुछ दोबारा सीखे इन पूरी तरह से अलग, उच्च-जोखिम वाले संसारों को संभालना सीख सकता है?

यह पेपर 2026 में आयोजित एक विशाल प्रयोग, फर्स्ट एर्गोक्रॉस चैलेंज (First EgoCross Challenge) की रिपोर्ट कार्ड है। आयोजकों ने यह देखने के लिए एक कठिन परीक्षण तैयार किया कि क्या आधुनिक "सुपर-स्मार्ट" वीडियो रोबोट अपनी दैनिक दिनचर्या से परे सामान्यीकरण (generalize) कर सकते हैं। उन्होंने चार बहुत अलग दुनियाओं: सर्जरी, औद्योगिक असेंबली, एक्सट्रीम स्पोर्ट्स, और जानवरों के दृष्टिकोण के माध्यम से एक बेंचमार्क बनाया जिसमें 798 वीडियो क्लिप और 957 पेचीदा प्रश्न थे। लक्ष्य सरल लेकिन कठिन था: एक वीडियो देखें, एक प्रश्न पढ़ें, और चार विकल्पों में से सही उत्तर चुनें। चुनौती ने प्रतिभागियों को दो समूहों में विभाजित किया। एक समूह, "सोर्स-लिमिटेड ट्रैक" (Source-Limited Track), को उदाहरणों के एक बहुत छोटे, निश्चित सेट (केवल 80 नमूने!) और एक विशिष्ट रोबोट मस्तिष्क के साथ काम करना था। दूसरे समूह, "ओपन-सोर्स ट्रैक" (Open-Source Track), के पास बड़े मस्तिष्क और अधिक सार्वजनिक डेटा हो सकते थे, लेकिन उन्हें लक्षित दुनियाओं के लिए नए प्रशिक्षण वीडियो को मैन्युअल रूप से खोजने की अनुमति नहीं थी।

परिणाम "वाह" और "अभी भी कठिन" का मिश्रण थे। 130 से अधिक टीमों ने 1,500 से अधिक प्रयास प्रस्तुत किए। विजेता टीम, डोमेनवाइज इन्फर (DomainWiseInfer), ने केवल एक बड़े रोबोट के साथ समस्या को बलपूर्वक हल नहीं किया; उन्होंने एक चतुर "ट्रैफिक पुलिस" प्रणाली बनाई। हर चीज़ के लिए एक सामान्य रणनीति का उपयोग करने के बजाय, उन्होंने महसूस किया कि स्कीइंग दुर्घटना के बारे में एक प्रश्न को एक सर्जिकल टूल के बारे में प्रश्न की तुलना में सोचने के लिए बिल्कुल अलग तरीके की आवश्यकता होती है। उन्होंने प्रश्नों को डोमेन के आधार पर विशिष्ट "इन्फरेंस रणनीतियों" (inference strategies) की ओर निर्देशित किया। उदाहरण के लिए, जानवरों के वीडियो के लिए, उन्होंने इंटरैक्शन को ट्रैक करने और हिलते हुए कैमरे के मूवमेंट को स्थिर करने पर ध्यान केंद्रित किया। सर्जरी के लिए, उन्होंने इस बात की पुष्टि करने पर ध्यान केंद्रित किया कि क्या एक उपकरण वास्तव में दिखाई दे रहा है। इस दृष्टिकोण ने, जिसमें बहुत कम नया प्रशिक्षण आवश्यक था, रोबोट की सटीकता को लगभग 46% के बेसलाइन से बढ़ाकर विजेता 66.98% तक पहुँचा दिया।

एक अन्य शीर्ष टीम, ओमनीएगो-आर2 (OmniEgo-R2), ने समस्या को एक रहस्य सुलझाने वाले जासूस की तरह माना। उन्होंने कार्य को चरणों में विभाजित किया: पहले, टाइमस्टैम्प के साथ वीडियो फ्रेम को व्यवस्थित करना; दूसरा, यह समझना कि प्रश्न के लिए किस प्रकार के "कौशल" (skill) की आवश्यकता है (जैसे वस्तुओं को गिनना या स्थान ढूँढना); और तीसरा, यह सुनिश्चित करने के लिए कि उत्तर झूठ न हो, वीडियो साक्ष्य के विरुद्ध प्रत्येक संभावित उत्तर की जाँच करना। इस "रूटेड रीजनिंग" (routed reasoning) ने उन्हें सख्त ट्रैक में 66.35% और ओपन ट्रैक में 66.77% स्कोर करने में मदद की।

ओपन ट्रैक में तीसरे स्थान वाली टीम, रिफ्लेक्टिव डायलॉग (Reflective Dialogue), ने एक अलग तरकीब आजमाई। रोबोट को केवल उदाहरण दिखाने के बजाय, उन्होंने उदाहरणों को एक "शिक्षक" और एक "सॉल्वर" के बीच बातचीत में बदल दिया। शिक्षक एक प्रश्न पूछेगा, सॉल्वर अनुमान लगाएगा, और यदि सॉल्वर गलत हुआ, तो शिक्षक समझाएगा कि वह क्यों गलत था और वास्तविक दृश्य साक्ष्य क्या दिखा रहे थे। इस "चिंतनशील" (reflective) चैट को फिर वास्तविक टेस्ट प्रश्नों का उत्तर देने से पहले संकेत के रूप में रोबोट को दिया गया। इस पद्धति ने रोबोट को 65.94% सटीकता तक पहुँचने में मदद की।

पेपर सुझाव देता है कि हालांकि हम प्रगति कर रहे हैं, रोबोट अभी भी सर्जरी और एक्सट्रीम स्पोर्ट्स के साथ सबसे अधिक संघर्ष करता है, जहाँ चीजें बहुत तेज़ी से चलती हैं या बहुत विशिष्ट दिखती हैं। हालाँकि, रोबोट जानवरों के दृष्टिकोण में आश्चर्यजनक रूप से अच्छे थे, क्योंकि संभवतः वे वीडियो सामान्य दृश्य संकेतों पर अधिक निर्भर करते हैं। मुख्य निष्कर्ष यह नहीं है कि हमने समस्या को हल कर लिया है, बल्कि यह है कि सबसे अच्छा तरीका बड़े रोबोट बनाना नहीं है। इसके बजाय, यह उन्हें सोचने के स्मार्ट तरीके देना है: प्रश्नों को सही विशेषज्ञों की ओर भेजना, समस्याओं को तार्किक चरणों में तोड़ना, और गलतियों के बारे में "बातचीत" से सीखना। चुनौती ने साबित कर दिया कि सही रणनीति के साथ, एक रोबोट हमारी दुनिया के जंगली और विविध कोनों को समझना शुरू कर सकता है, भले ही उसने उनके केवल कुछ ही उदाहरण देखे हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →