MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos
यह शोध पत्र MMOU को प्रस्तुत करता है, जो सर्व-मोडल (दृश्य, श्रव्य और पाठ्य) तर्क क्षमता का मूल्यांकन करने के लिए 9038 विविध दीर्घ-रूप वीडियो में 15,000 प्रश्नों वाला एक व्यापक बेंचमार्क है, जो वर्तमान अत्याधुनिक मल्टीमॉडल मॉडलों में महत्वपूर्ण प्रदर्शन अंतराल और व्यवस्थित विफलता मोड को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को दुनिया को केवल देखकर ही नहीं, बल्कि एक साथ देखने, सुनने और सोचने के माध्यम से समझने के लिए सिखाने की कोशिश कर रहे हैं, ठीक वैसे ही जैसे एक इंसान करता है।
यह शोध पत्र MMOU पेश करता है, जो एक विशाल नया "फाइनल एग्जाम" है जिसे यह जांचने के लिए बनाया गया है कि हमारे सबसे स्मार्ट AI रोबोट इस काम में कितने अच्छे हैं।
यहाँ सरल शब्दों में इसका विवरण दिया गया है, जिसमें कुछ रचनात्मक उपमाओं का उपयोग किया गया है:
1. समस्या: "एक ही दिशा में सोचने वाला" रोबोट
अब तक, अधिकांश AI मॉडल विशेषज्ञ संगीतकारों की तरह रहे हैं।
- कुछ शीट म्यूजिक (टेक्स्ट) पढ़ने में माहिर हैं।
- कुछ वायलिन बजाने (इमेज/वीडियो) में माहिर हैं।
- कुछ गाने (ऑडियो) में माहिर हैं।
लेकिन यदि आप उनसे एक सिम्फनी सुनने, कंडक्टर को देखने और यह समझाने के लिए कहें कि कंडक्टर के बैटन (छड़ी) गिराने पर संगीत क्यों रुक गया, तो वे अक्सर भ्रमित हो जाते हैं। वे बैटन गिरते हुए देख सकते हैं, या संगीत रुकते हुए सुन सकते हैं, लेकिन वे वास्तविक समय में इन दोनों को जोड़ने में संघर्ष करते हैं, खासकर यदि वीडियो लंबा और जटिल हो।
2. समाधान: "MMOU" परीक्षा
शोधकर्ताओं ने MMOU (मैसिव मल्टी-टास्क ओम्नी अंडरस्टैंडिंग) बनाया है। इसे एक विशाल, अराजक, 10 घंटे के रियलिटी टीवी मैराथन के रूप में सोचें जिसे AI को चकमा देने के लिए डिज़ाइन किया गया है।
- सामग्री: इसमें 9,000+ वास्तविक दुनिया के वीडियो (खेल से लेकर व्याख्यान और प्रैंक तक) शामिल हैं जो लंबे और जटिल हैं।
- प्रश्न: इसमें वीडियो के बारे में 15,000 प्रश्न हैं।
- चुनौती: आप केवल देखकर या केवल सुनकर प्रश्नों के उत्तर नहीं दे सकते। आपको दोनों कार्य एक साथ करने होंगे।
- उदाहरण: "12वें मिनट पर भीड़ शांत क्यों हो गई?"
- जाल: यदि AI केवल देखता है, तो वह लोगों को स्थिर देखता है। यदि वह केवल सुनता है, तो वह सन्नाटा सुनता है। उसे यह महसूस करने की आवश्यकता है कि एक विशिष्ट दृश्य घटना (एक खिलाड़ी का गिरना) ने ऑडियो घटना (भीड़ का हांफना और फिर शांत हो जाना) को जन्म दिया।
3. "13 कौशलों" की चेकलिस्ट
इस परीक्षा को पास करने के लिए, AI को 13 अलग-अलग "सुपरपावर्स" में महारत हासिल करने की आवश्यकता है, जैसे:
- भूसे में सुई ढूँढना (Needle in a Haystack): 2 घंटे के वीडियो में छिपी हुई एक छोटी सी चीज़ को खोजना।
- समय यात्रा (Time Travel): यह समझना कि घटना A, घटना B से पहले हुई थी, भले ही वे एक-दूसरे से बहुत दूर हों।
- जासूसी (Detective Work): ध्वनि और चित्र के सूक्ष्म संकेतों के आधार पर यह पता लगाना कि कुछ क्यों हुआ।
- गिनती करना (Counting): एक विशिष्ट ध्वनि या वस्तु कितनी बार दिखाई देती है, उसका हिसाब रखना।
4. परिणाम: AI संघर्ष कर रहा है
शोधकर्ताओं ने इस परीक्षा पर 20 से अधिक स्मार्ट AI मॉडल (गूगल, माइक्रोसॉफ्ट और ओपन-सोर्स समुदायों के प्रसिद्ध मॉडलों सहित) का परीक्षण किया।
स्कोरबोर्ड:
- इंसान: लगभग 84% स्कोर करते हैं (हम काफी अच्छे हैं)।
- सबसे अच्छा AI (Gemini 2.5 Pro): 64% स्कोर करता है।
- ओपन-सोर्स AI लीडर्स: लगभग 46% स्कोर करते हैं।
निष्कर्ष: यहाँ तक कि "सबसे स्मार्ट" AI भी बुनियादी परीक्षणों में विफल हो रहे हैं। वे उस छात्र की तरह हैं जिसने पाठ्यपुस्तक तो रट ली है लेकिन व्यावहारिक परीक्षा में विफल हो जाता है क्योंकि वे वास्तविक, अव्यवस्थित स्थिति में ज्ञान को लागू नहीं कर पाते हैं।
5. वे क्यों विफल होते हैं? ("बीच में खो जाने" की समस्या)
शोधकर्ताओं ने पाया कि एक विशिष्ट कमजोरी है: लंबे वीडियो AI को भ्रमित कर देते हैं।
कल्पना कीजिए कि आप 500 पन्नों की किताब पढ़ रहे हैं। यदि आपसे पेज 10 के बारे में पूछा जाता है, तो AI ठीक रहता है। लेकिन यदि आपसे पेज 450 के बारे में पूछा जाता है, तो वह अक्सर भूल जाता है कि शुरुआत में क्या हुआ था।
- "मिडल" प्रभाव: जैसे-जैसे वीडियो आगे बढ़ता है, AI का प्रदर्शन गिर जाता है। वह कहानी का ट्रैक खो देता है। यह एक घंटे पहले हुई बातचीत को याद रखने की कोशिश करने जैसा है जबकि कोई अभी आपसे बात कर रहा हो; AI अभिभूत हो जाता है और सूत्र खो देता है।
6. "बहुविकल्पीय" बनाम "निबंध" टेस्ट
शोधकर्ताओं ने यह भी देखा कि कुछ अजीब बात है।
- जब बहुविकल्पीय (A, B, C, D) दिए जाते हैं, तो AI कभी-कभी सही उत्तर अनुमान लगाकर या गलत विकल्पों को हटाकर प्राप्त कर लेता है।
- जब उत्तर लिखने (ओपन-एंडेड) के लिए कहा जाता है, तो AI अक्सर पूरी तरह से विफल हो जाता है।
- उपमा: यह उस छात्र की तरह है जो टेस्ट पर सही विकल्प चुन सकता है लेकिन जब शिक्षक उनसे पूछता है कि वह क्यों सही है, तो वह निबंध नहीं लिख सकता। वे उत्तर को "पहचान" रहे हैं, उसे वास्तव में "समझ" नहीं रहे हैं।
7. यह क्यों मायने रखता है?
यह केवल परीक्षा में खराब ग्रेड पाने के बारे में नहीं है।
- वास्तविक दुनिया: हम चाहते हैं कि AI लंबे सर्जरी वीडियो का विश्लेषण करने में डॉक्टरों की मदद करे, शिक्षकों को घंटों के क्लासरूम फुटेज की समीक्षा करने में मदद करे, या पुलिस को बॉडी-कैम फुटेज की समीक्षा करने में मदद करे।
- जोखिम: यदि AI 2 घंटे के वीडियो में एक महत्वपूर्ण विवरण को मिस कर देता है क्योंकि वह शुरुआत को "भूल" गया था, तो इसके परिणाम गंभीर हो सकते हैं।
सारांश
MMOU एक चेतावनी है। यह हमें बताता है कि हालांकि AI चित्रों को देखने और टेक्स्ट पढ़ने में बहुत अच्छा हो रहा है, लेकिन यह एक "इंसान जैसे" पर्यवेक्षक बनने में अभी भी खराब है, जो एक लंबी फिल्म देख सके, साउंडट्रैक सुन सके और शुरुआत से अंत तक पूरी कहानी को समझ सके। हमारे रोबोट वास्तव में दुनिया को हमारे तरीके से "समझ" सकें, इसके लिए हमें अभी लंबा रास्ता तय करना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।