LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs
लंबे प्रारूप वाली सामग्री पर ओम्नीमॉडल लार्ज लैंग्वेज मॉडल्स के मूल्यांकन में अंतराल को संबोधित करने के लिए, यह शोध पत्र LVOmniBench पेश करता है, जो एक नया बेंचमार्क है जिसमें 275 वीडियो (10-90 मिनट) और 1,014 QA जोड़े शामिल हैं जो यह प्रकट करते हैं कि वर्तमान मॉडल विस्तृत ऑडियो-विजुअल समझ के साथ संघर्ष करते हैं, जिससे ओपन-सोर्स मॉडल्स के लिए 35% से कम और जेमिनी 3 प्रो के लिए 65% तक की सटीकता प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को दुनिया को समझना सिखाने की कोशिश कर रहे हैं। अब तक, हमने उसे एक फोटो देखना या किसी गाने की 10 सेकंड की क्लिप सुनना सिखाया है। वह इन छोटे कार्यों में काफी अच्छा प्रदर्शन कर रहा है। लेकिन वास्तविक जीवन, छोटे-छोटे स्नैपशॉट्स की एक श्रृंखला नहीं है; यह एक निरंतर, बहती हुई फिल्म की तरह है जो घंटों तक चल सकती है, जिसमें लोग बातें कर रहे होते हैं, संगीत बज रहा होता है और बैकग्राउंड में चीजें होती रहती हैं।
यह पेपर LVOmniBench पेश करता है, जो एक नया "फाइनल एग्जाम" है जिसे यह परीक्षण करने के लिए बनाया गया है कि क्या हमारे सबसे स्मार्ट AI रोबोट वास्तव में इन लंबी, जटिल फिल्मों को संभाल सकते हैं।
यहाँ बताया गया है कि उन्होंने क्या किया, कुछ सरल उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: "शॉर्ट-क्लिप" का जाल
अब तक, अधिकांश AI टेस्ट एक छात्र को बिल्ली के कूदने का 10 सेकंड का वीडियो दिखाने और पूछने जैसे थे, "क्या बिल्ली कूदी?" AI उस विशिष्ट कूद को आसानी से याद कर सकता था।
लेकिन वास्तविक दुनिया में, वीडियो 90 मिनट की डॉक्यूमेंट्री या व्लॉग्स की तरह होते हैं। उनमें होता है:
- लंबे समय की याददाश्त (Long-term memory): "उस आदमी ने 20 मिनट पहले क्या कहा था?"
- जटिल समय (Complex timing): "संगीत कब रुका और बारिश कब शुरू हुई?"
- मिश्रित संकेत (Mixed signals): हाथों से कुछ काम करते समय पृष्ठभूमि में संगीत के साथ लोगों का बात करना।
वर्तमान AI मॉडल उन छात्रों की तरह हैं जो फ्लैशकार्ड तो रट सकते हैं लेकिन 3 घंटे की फाइनल परीक्षा में फेल हो जाते हैं। जब कहानी बहुत लंबी हो जाती है, तो वे खो जाते हैं।
2. समाधान: LVOmniBench (द "मैराथन" टेस्ट)
शोधकर्ताओं ने LVOmniBench नामक एक नया टेस्ट बनाया है। इसे एक स्प्रिंट (तेज दौड़) के बजाय एक मैराथन के रूप में सोचें।
- कोर्स: उन्होंने 275 वास्तविक दुनिया के वीडियो एकत्र किए (जैसे कुकिंग शो, ट्रैवल व्लॉग और इंटरव्यू) जो 10 से 90 मिनट लंबे हैं।
- प्रश्न: उन्होंने 1,000 से अधिक प्रश्न लिखे जिनमें AI को एक ही समय में अपनी आँखों (वीडियो) और कानों (ऑडियो) का उपयोग करने की आवश्यकता होती है।
- उदाहरण: "वीडियो में आदमी कहता है कि वह 'टोबी' को ढूंढ रहा है। उसने वास्तव में आंगन में टोबी को कितनी बार देखा?"
- यह कठिन क्यों है: AI को नाम सुनना होगा, टोबी को खोजने के लिए वीडियो देखना होगा, टोबी के दिखने की गिनती करनी होगी, और उन समयों को अनदेखा करना होगा जब टोबी वहां नहीं है।
3. परिणाम: "अमीर बच्चा" बनाम "संघर्ष करता छात्र"
शोधकर्ताओं ने इस मैराथन पर सर्वश्रेष्ठ AI मॉडल्स का परीक्षण किया। परिणाम थोड़े चौंकाने वाले थे:
- "प्रोपराइटरी" मॉडल्स (अमीर बच्चे): ये सुपर-महंगे, क्लोज्ड-सोर्स मॉडल हैं जैसे Gemini 3 Pro। ये उन छात्रों की तरह हैं जिनके पास निजी ट्यूटर और असीमित अध्ययन का समय है। इनका स्कोर लगभग 65% था। इन्होंने अच्छा प्रदर्शन किया, लेकिन फिर भी ये लगभग एक तिहाई प्रश्नों का उत्तर गलत देते रहे।
- "ओपन-सोर्स" मॉडल्स (संघर्ष करते छात्र): ये मुफ्त, समुदाय द्वारा बनाए गए मॉडल हैं। इनका स्कोर 35% से नीचे था।
- उपमा: यदि आप मल्टीपल-चॉइस टेस्ट पर रैंडम अनुमान लगाते हैं, तो आपको 25% सही उत्तर मिलते हैं। ये ओपन-सोर्स मॉडल रैंडम अनुमान लगाने से भी थोड़ा ही बेहतर कर रहे थे। वे लंबे वीडियो में पूरी तरह से खो जाते थे।
4. वे कहाँ विफल हुए? (द "हैलुसिनेशन" ज़ोन)
पेपर में पाया गया कि AI तीन विशिष्ट तरीकों से विफल होता है, जैसे कि एक ऐसा छात्र जो इन चीजों में बुरा है:
- गिनती (Counting): "कुत्ता कितनी बार भौंका?" (AI अक्सर गिनती भूल जाता है)।
- संगीत की समझ (Music Perception): "किस तरह का वाद्य यंत्र बज रहा है?" (AI शोर तो सुनता है लेकिन धुन को पहचान नहीं पाता)।
- समय यात्रा (Time Travel): "15 मिनट पहले क्या हुआ था?" (AI वीडियो के अंत तक पहुँचते-पहुँचते शुरुआत को भूल जाता है)।
5. मुख्य निष्कर्ष
मुख्य संदेश यह है कि हम अभी वहां तक नहीं पहुंचे हैं।
जबकि AI एक तस्वीर देखने या एक छोटा वाक्य सुनने में अद्भुत है, यह वर्तमान में एक लंबे, निरंतर कहानी को समझने में बहुत खराब है जहाँ ध्वनि और दृश्य आपस में मिले हुए होते हैं। "ओपन-सोर्स" मॉडल लंबे वीडियो की बारीकियों के प्रति अनिवार्य रूप से अंधे और बहरे हैं।
यह क्यों मायने रखता है?
क्योंकि भविष्य का AI केवल एक फोटो के बारे में सवाल पूछने के बारे में नहीं है। यह एक ऐसे AI असिस्टेंट के बारे में है जो चोर को खोजने के लिए 2 घंटे के सुरक्षा कैमरा फीड को देख सके, या 45 मिनट के लेक्चर को सुनकर उसके मुख्य बिंदुओं का सारांश दे सके। यह नया टेस्ट (LVOmniBench) AI डेवलपर्स को ऐसे मॉडल बनाने के लिए मजबूर करने की दिशा में पहला कदम है जो वास्तव में वास्तविक जीवन की लंबाई और जटिलता को संभाल सकें।
संक्षेप में: हमने एक कठिन टेस्ट बनाया, और AI इसमें फेल हो गया। अब, हमें पता है कि अगली पीढ़ी के AI को वास्तव में "ओमनी-स्मार्ट" बनाने के लिए हमें क्या ठीक करने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।