← नवीनतम पेपर
🤖 AI

EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering

यह शोध पत्र EgoCross को प्रस्तुत करता है, जो चार चुनौतीपूर्ण डोमेन (सर्जरी, उद्योग, चरम खेल और पशु परिप्रेक्ष्य) में 1,000 QA युग्मों वाला एक व्यापक बेंचमार्क है, जिसका उद्देश्य एगोसेंट्रिक वीडियो प्रश्न उत्तर (egocentric video question answering) में वर्तमान मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की खराब क्रॉस-डोमेन सामान्यीकरण क्षमताओं का मूल्यांकन करना और उन्हें उजागर करना है।

मूल लेखक: Yanjun Li, Yuqian Fu, Tianwen Qian, Qi'ao Xu, Silong Dai, Danda Pani Paudel, Luc Van Gool, Xiaoling Wang

प्रकाशित 2026-03-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanjun Li, Yuqian Fu, Tianwen Qian, Qi'ao Xu, Silong Dai, Danda Pani Paudel, Luc Van Gool, Xiaoling Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक प्रतिभाशाली छात्र को प्रशिक्षित किया है ताकि वह एक परम "हाउस हेल्पर" (घर का सहायक) बन सके। इस छात्र ने खाना पकाने, सफाई करने और बागवानी करने के हजारों घंटों के वीडियो देखे हैं। वह "शेफ कौन सी सामग्री मिला रहा है?" या "सूप कब उबलना शुरू होता है?" जैसे सवालों के जवाब देने में माहिर है।

अब, कल्पना कीजिए कि आपने उसी छात्र को एक सर्जिकल थिएटर (शल्य चिकित्सा कक्ष), एक फैक्ट्री फ्लोर, एक स्की जंप (स्कीइंग के मैदान) या यहाँ तक कि एक बिल्ली की पीठ पर बंधे हुए काम करने के लिए काम पर रखा है।

अचानक, छात्र जम जाता है। वह एक स्कैल्पल (सर्जिकल चाकू) और एक स्क्रूड्राइवर के बीच अंतर नहीं कर पाता। स्कीयर (skier) कहाँ लैंड करेगा, इसका अनुमान लगाने में उसे चक्कर आने लगते हैं। उसे यह भी पता नहीं है कि जब कोई बिल्ली लेजर पॉइंटर का पीछा करती है, तो उसे कैसा दिखता है।

यही वह समस्या है जिसे EgoCross पेपर हल कर रहा है।

समस्या: "दैनिक जीवन" का बुलबुला

लंबे समय से, AI शोधकर्ता वीडियो-समझने वाले AI (जिसे मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स या MLLMs कहा जाता है) का परीक्षण केवल "दैनिक जीवन" के वीडियो पर कर रहे हैं। यह ऐसा ही है जैसे किसी कार का परीक्षण केवल एक चिकने, समतल पार्किंग स्थल पर करना। AI को इसमें A+ मिलता है क्योंकि उसने कभी गड्ढा, पहाड़ी सड़क या कीचड़ भरा रास्ता नहीं देखा है।

लेकिन वास्तविक दुनिया में, AI को हर जगह काम करने की आवश्यकता है। यदि कोई रोबोट सर्जन की मदद करने जा रहा है, तो उसे केवल सब्जियां काटना ही नहीं आना चाहिए; उसे यह भी जानना चाहिए कि सर्जिकल टूल को कैसे पकड़ना है। यदि कोई ड्रोन अग्निशमन कर्मी की मदद करने जा वाला है, तो उसे धूप वाले पिकनिक के बजाय धुएं और आग को समझना होगा।

वर्तमान AI मॉडल उस "हाउस हेल्पर" छात्र की तरह हैं: वे घर में बहुत अच्छे हैं, लेकिन घर से बाहर निकलते ही घबरा जाते हैं।

समाधान: EgoCross (एक "फील्ड ट्रिप" परीक्षा)

लेखकों ने एक नई परीक्षा बनाई है जिसे EgoCross कहा जाता है। इसे एक "फील्ड ट्रिप परीक्षा" के रूप में सोचें जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या ये AI छात्र पूरी तरह से अलग वातावरण को संभाल सकते हैं।

केवल कुकिंग वीडियो के बजाय, EgoCross AI का परीक्षण चार बहुत ही अलग, उच्च-जोखिम वाली दुनियाओं में करता है:

  1. सर्जरी: सर्जन के हाथों को उनकी अपनी आँखों के दृष्टिकोण से देखना। उपकरण बहुत छोटे होते हैं, गतिविधियाँ सटीक होती हैं, और शब्दावली चिकित्सा संबंधी होती है।
  2. उद्योग (Industry): किसी को जटिल सर्किट बोर्डों की मरम्मत करते हुए देखना। यह तर्क, औजारों और असेंबली लाइनों के बारे में है।
  3. एक्सट्रीम स्पोर्ट्स: स्कीइंग या स्काईडाइविंग के प्रथम-व्यक्ति (first-person) दृश्य। कैमरा हिल रहा है, तेजी से चल रहा है, और दृश्य बहुत अनियंत्रित है।
  4. जानवरों का दृष्टिकोण: कुत्ते, बिल्ली या कछुए के दृष्टिकोण से वीडियो। दुनिया अलग दिखती है (जमीन से नीचे, अलग गति), और "मानवीय" तर्क यहाँ लागू नहीं होता।

परीक्षा: "आगे क्या होगा?"

यह परीक्षा केवल "आप क्या देख रहे हैं?" के बारे में नहीं है। यह बहुत कठिन है। AI को ऐसे सवालों के जवाब देने होंगे जैसे:

  • पूर्वानुमान (Prediction): "सर्जन ने अभी इस धमनी (artery) को काटा है; वे अगला कौन सा उपकरण उपयोग करेंगे?"
  • लोकलइज़ेशन (Localization): "जब हाथ स्क्रूड्राइवर को छू रहा था, तब वह ठीक कहाँ था?"
  • गिनती (Counting): "इस 10 सेकंड के क्लिप में मैकेनिक ने कितने अलग-अलग औजारों का उपयोग किया?"
  • पहचान (Recognition): "क्या वह एक 'ग्रैस्पर' (पकड़ने वाला यंत्र) है या 'कैंची'?" (भले ही वे दिखने में समान हों)।

इस परीक्षा में लगभग 1,000 प्रश्न शामिल हैं, जो दो प्रकार के हैं:

  • बहुविकल्पीय (CloseQA): एक मानक क्विज़ की तरह।
  • मुक्त प्रतिक्रिया (OpenQA): एक लघु निबंध की तरह जहाँ AI को अपने तर्क की व्याख्या करनी होती है।

परिणाम: AI अटक गया

लेखकों ने आज के सबसे स्मार्ट AI मॉडल्स (गूगल और ओपनएआई के बड़े मॉडल्स सहित) पर यह टेस्ट चलाया।

फैसला? अधिकांश बुरी तरह विफल रहे।

  • "दैनिक जीवन" के परीक्षणों पर, उनका स्कोर उच्च था।
  • EgoCross टेस्ट पर, उनके स्कोर नाटकीय रूप रूप से गिर गए। वे रैंडमली अंदाज़ा लगाने से भी थोड़े बेहतर थे।

यह पता चलता है कि ये AI दैनिक जीवन के "विशेषज्ञ" (specialists) हैं, न कि "सामान्यज्ञ" (generalists)। उन्होंने दुनिया के गहरे नियमों को नहीं सीखा है कि दुनिया कैसे काम करती है; उन्होंने केवल खाना पकाने और सफाई करने के पैटर्न को याद कर लिया है। जब दृश्य शैली और तर्क बदल जाता है (जैसे किचन से ऑपरेटिंग रूम में जाना), तो वे खो जाते हैं।

आशा की किरण: इसे ठीक करने की कोशिश

पेपर ने केवल समस्या की ओर इशारा नहीं किया; उन्होंने इसे ठीक करने की कोशिश भी की। उन्होंने AI को नए विषयों के लिए "पढ़ने" में मदद करने के लिए तीन तरीकों का परीक्षण किया:

  1. प्रॉम्प्टिंग (Prompting): AI को संदर्भ का एक "चीट शीट" देना (जैसे, "याद रखें, आप एक अस्पताल में हैं")। परिणाम: थोड़ी मदद मिली, लेकिन पर्याप्त नहीं।
  2. फाइन-ट्यूनिंग (Fine-Tuning): AI को कुछ नए वीडियो का थोड़ा सा अध्ययन करने देना। परिणाम: बेहतर हुआ, लेकिन यह केवल उन विशिष्ट उदाहरणों तक सीमित था जो उसने देखे थे।
  3. रीइन्फोर्समेंट लर्निंग (Reinforcement Learning): AI को प्रयास करने, असफल होने, फीडबैक मिलने और फिर से प्रयास करने देना (जैसे इनाम देकर कुत्ते को प्रशिक्षित करना)। परिणाम: यह विजेता रहा! इसने AI को नई दुनिया के अनुकूल होने में बहुत बेहतर मदद की।

मुख्य निष्कर्ष

EgoCross एक चेतावनी है। यह हमें बताता है कि जबकि AI हमारे दैनिक जीवन को समझने में बहुत अच्छा हो रहा है, फिर भी यह अपने कंफर्ट ज़ोन से बाहर कदम रखते ही बहुत नाजुक (fragile) हो जाता है।

यदि हम चाहते हैं कि AI वास्तव में अस्पतालों, कारखानों या बचाव मिशनों में हमारी मदद करे, तो हम इसे केवल यूट्यूब कुकिंग वीडियो पर प्रशिक्षित नहीं कर सकते। हमें ऐसे मॉडल बनाने की आवश्यकता है जो वास्तविक दुनिया के अव्यवस्थित, अजीब और विशिष्ट हिस्सों को संभालने के लिए पर्याप्त मजबूत हों। यह पेपर हमें वहां तक पहुँचने के लिए एक मानचित्र और एक परीक्षा प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →