← नवीनतम पेपर
💬 NLP

MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos

यह शोध पत्र MMOU को प्रस्तुत करता है, जो सर्व-मोडल (दृश्य, श्रव्य और पाठ्य) तर्क क्षमता का मूल्यांकन करने के लिए 9038 विविध दीर्घ-रूप वीडियो में 15,000 प्रश्नों वाला एक व्यापक बेंचमार्क है, जो वर्तमान अत्याधुनिक मल्टीमॉडल मॉडलों में महत्वपूर्ण प्रदर्शन अंतराल और व्यवस्थित विफलता मोड को प्रकट करता है।

मूल लेखक: Arushi Goel, Sreyan Ghosh, Vatsal Agarwal, Nishit Anand, Kaousheik Jayakumar, Lasha Koroshinadze, Yao Xu, Katie Lyons, James Case, Karan Sapra, Kevin J. Shih, Siddharth Gururani, Abhinav Shrivastava
प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arushi Goel, Sreyan Ghosh, Vatsal Agarwal, Nishit Anand, Kaousheik Jayakumar, Lasha Koroshinadze, Yao Xu, Katie Lyons, James Case, Karan Sapra, Kevin J. Shih, Siddharth Gururani, Abhinav Shrivastava, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Bryan Catanzaro, Mohammad Shoeybi, Wei Ping

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को केवल देखकर ही नहीं, बल्कि एक साथ देखने, सुनने और सोचने के माध्यम से समझने के लिए सिखाने की कोशिश कर रहे हैं, ठीक वैसे ही जैसे एक इंसान करता है।

यह शोध पत्र MMOU पेश करता है, जो एक विशाल नया "फाइनल एग्जाम" है जिसे यह जांचने के लिए बनाया गया है कि हमारे सबसे स्मार्ट AI रोबोट इस काम में कितने अच्छे हैं।

यहाँ सरल शब्दों में इसका विवरण दिया गया है, जिसमें कुछ रचनात्मक उपमाओं का उपयोग किया गया है:

1. समस्या: "एक ही दिशा में सोचने वाला" रोबोट

अब तक, अधिकांश AI मॉडल विशेषज्ञ संगीतकारों की तरह रहे हैं।

  • कुछ शीट म्यूजिक (टेक्स्ट) पढ़ने में माहिर हैं।
  • कुछ वायलिन बजाने (इमेज/वीडियो) में माहिर हैं।
  • कुछ गाने (ऑडियो) में माहिर हैं।

लेकिन यदि आप उनसे एक सिम्फनी सुनने, कंडक्टर को देखने और यह समझाने के लिए कहें कि कंडक्टर के बैटन (छड़ी) गिराने पर संगीत क्यों रुक गया, तो वे अक्सर भ्रमित हो जाते हैं। वे बैटन गिरते हुए देख सकते हैं, या संगीत रुकते हुए सुन सकते हैं, लेकिन वे वास्तविक समय में इन दोनों को जोड़ने में संघर्ष करते हैं, खासकर यदि वीडियो लंबा और जटिल हो।

2. समाधान: "MMOU" परीक्षा

शोधकर्ताओं ने MMOU (मैसिव मल्टी-टास्क ओम्नी अंडरस्टैंडिंग) बनाया है। इसे एक विशाल, अराजक, 10 घंटे के रियलिटी टीवी मैराथन के रूप में सोचें जिसे AI को चकमा देने के लिए डिज़ाइन किया गया है।

  • सामग्री: इसमें 9,000+ वास्तविक दुनिया के वीडियो (खेल से लेकर व्याख्यान और प्रैंक तक) शामिल हैं जो लंबे और जटिल हैं।
  • प्रश्न: इसमें वीडियो के बारे में 15,000 प्रश्न हैं।
  • चुनौती: आप केवल देखकर या केवल सुनकर प्रश्नों के उत्तर नहीं दे सकते। आपको दोनों कार्य एक साथ करने होंगे।
    • उदाहरण: "12वें मिनट पर भीड़ शांत क्यों हो गई?"
    • जाल: यदि AI केवल देखता है, तो वह लोगों को स्थिर देखता है। यदि वह केवल सुनता है, तो वह सन्नाटा सुनता है। उसे यह महसूस करने की आवश्यकता है कि एक विशिष्ट दृश्य घटना (एक खिलाड़ी का गिरना) ने ऑडियो घटना (भीड़ का हांफना और फिर शांत हो जाना) को जन्म दिया।

3. "13 कौशलों" की चेकलिस्ट

इस परीक्षा को पास करने के लिए, AI को 13 अलग-अलग "सुपरपावर्स" में महारत हासिल करने की आवश्यकता है, जैसे:

  • भूसे में सुई ढूँढना (Needle in a Haystack): 2 घंटे के वीडियो में छिपी हुई एक छोटी सी चीज़ को खोजना।
  • समय यात्रा (Time Travel): यह समझना कि घटना A, घटना B से पहले हुई थी, भले ही वे एक-दूसरे से बहुत दूर हों।
  • जासूसी (Detective Work): ध्वनि और चित्र के सूक्ष्म संकेतों के आधार पर यह पता लगाना कि कुछ क्यों हुआ।
  • गिनती करना (Counting): एक विशिष्ट ध्वनि या वस्तु कितनी बार दिखाई देती है, उसका हिसाब रखना।

4. परिणाम: AI संघर्ष कर रहा है

शोधकर्ताओं ने इस परीक्षा पर 20 से अधिक स्मार्ट AI मॉडल (गूगल, माइक्रोसॉफ्ट और ओपन-सोर्स समुदायों के प्रसिद्ध मॉडलों सहित) का परीक्षण किया।

स्कोरबोर्ड:

  • इंसान: लगभग 84% स्कोर करते हैं (हम काफी अच्छे हैं)।
  • सबसे अच्छा AI (Gemini 2.5 Pro): 64% स्कोर करता है।
  • ओपन-सोर्स AI लीडर्स: लगभग 46% स्कोर करते हैं।

निष्कर्ष: यहाँ तक कि "सबसे स्मार्ट" AI भी बुनियादी परीक्षणों में विफल हो रहे हैं। वे उस छात्र की तरह हैं जिसने पाठ्यपुस्तक तो रट ली है लेकिन व्यावहारिक परीक्षा में विफल हो जाता है क्योंकि वे वास्तविक, अव्यवस्थित स्थिति में ज्ञान को लागू नहीं कर पाते हैं।

5. वे क्यों विफल होते हैं? ("बीच में खो जाने" की समस्या)

शोधकर्ताओं ने पाया कि एक विशिष्ट कमजोरी है: लंबे वीडियो AI को भ्रमित कर देते हैं।
कल्पना कीजिए कि आप 500 पन्नों की किताब पढ़ रहे हैं। यदि आपसे पेज 10 के बारे में पूछा जाता है, तो AI ठीक रहता है। लेकिन यदि आपसे पेज 450 के बारे में पूछा जाता है, तो वह अक्सर भूल जाता है कि शुरुआत में क्या हुआ था।

  • "मिडल" प्रभाव: जैसे-जैसे वीडियो आगे बढ़ता है, AI का प्रदर्शन गिर जाता है। वह कहानी का ट्रैक खो देता है। यह एक घंटे पहले हुई बातचीत को याद रखने की कोशिश करने जैसा है जबकि कोई अभी आपसे बात कर रहा हो; AI अभिभूत हो जाता है और सूत्र खो देता है।

6. "बहुविकल्पीय" बनाम "निबंध" टेस्ट

शोधकर्ताओं ने यह भी देखा कि कुछ अजीब बात है।

  • जब बहुविकल्पीय (A, B, C, D) दिए जाते हैं, तो AI कभी-कभी सही उत्तर अनुमान लगाकर या गलत विकल्पों को हटाकर प्राप्त कर लेता है।
  • जब उत्तर लिखने (ओपन-एंडेड) के लिए कहा जाता है, तो AI अक्सर पूरी तरह से विफल हो जाता है।
  • उपमा: यह उस छात्र की तरह है जो टेस्ट पर सही विकल्प चुन सकता है लेकिन जब शिक्षक उनसे पूछता है कि वह क्यों सही है, तो वह निबंध नहीं लिख सकता। वे उत्तर को "पहचान" रहे हैं, उसे वास्तव में "समझ" नहीं रहे हैं।

7. यह क्यों मायने रखता है?

यह केवल परीक्षा में खराब ग्रेड पाने के बारे में नहीं है।

  • वास्तविक दुनिया: हम चाहते हैं कि AI लंबे सर्जरी वीडियो का विश्लेषण करने में डॉक्टरों की मदद करे, शिक्षकों को घंटों के क्लासरूम फुटेज की समीक्षा करने में मदद करे, या पुलिस को बॉडी-कैम फुटेज की समीक्षा करने में मदद करे।
  • जोखिम: यदि AI 2 घंटे के वीडियो में एक महत्वपूर्ण विवरण को मिस कर देता है क्योंकि वह शुरुआत को "भूल" गया था, तो इसके परिणाम गंभीर हो सकते हैं।

सारांश

MMOU एक चेतावनी है। यह हमें बताता है कि हालांकि AI चित्रों को देखने और टेक्स्ट पढ़ने में बहुत अच्छा हो रहा है, लेकिन यह एक "इंसान जैसे" पर्यवेक्षक बनने में अभी भी खराब है, जो एक लंबी फिल्म देख सके, साउंडट्रैक सुन सके और शुरुआत से अंत तक पूरी कहानी को समझ सके। हमारे रोबोट वास्तव में दुनिया को हमारे तरीके से "समझ" सकें, इसके लिए हमें अभी लंबा रास्ता तय करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →