← नवीनतम पेपर
💻 computer science

LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs

लंबे प्रारूप वाली सामग्री पर ओम्नीमॉडल लार्ज लैंग्वेज मॉडल्स के मूल्यांकन में अंतराल को संबोधित करने के लिए, यह शोध पत्र LVOmniBench पेश करता है, जो एक नया बेंचमार्क है जिसमें 275 वीडियो (10-90 मिनट) और 1,014 QA जोड़े शामिल हैं जो यह प्रकट करते हैं कि वर्तमान मॉडल विस्तृत ऑडियो-विजुअल समझ के साथ संघर्ष करते हैं, जिससे ओपन-सोर्स मॉडल्स के लिए 35% से कम और जेमिनी 3 प्रो के लिए 65% तक की सटीकता प्राप्त होती है।

मूल लेखक: Keda Tao, Yuhua Zheng, Jia Xu, Wenjie Du, Kele Shao, Hesong Wang, Xueyi Chen, Xin Jin, Junhan Zhu, Bohan Yu, Weiqiang Wang, Jian Liu, Can Qin, Yulun Zhang, Ming-Hsuan Yang, Huan Wang

प्रकाशित 2026-03-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Keda Tao, Yuhua Zheng, Jia Xu, Wenjie Du, Kele Shao, Hesong Wang, Xueyi Chen, Xin Jin, Junhan Zhu, Bohan Yu, Weiqiang Wang, Jian Liu, Can Qin, Yulun Zhang, Ming-Hsuan Yang, Huan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को समझना सिखाने की कोशिश कर रहे हैं। अब तक, हमने उसे एक फोटो देखना या किसी गाने की 10 सेकंड की क्लिप सुनना सिखाया है। वह इन छोटे कार्यों में काफी अच्छा प्रदर्शन कर रहा है। लेकिन वास्तविक जीवन, छोटे-छोटे स्नैपशॉट्स की एक श्रृंखला नहीं है; यह एक निरंतर, बहती हुई फिल्म की तरह है जो घंटों तक चल सकती है, जिसमें लोग बातें कर रहे होते हैं, संगीत बज रहा होता है और बैकग्राउंड में चीजें होती रहती हैं।

यह पेपर LVOmniBench पेश करता है, जो एक नया "फाइनल एग्जाम" है जिसे यह परीक्षण करने के लिए बनाया गया है कि क्या हमारे सबसे स्मार्ट AI रोबोट वास्तव में इन लंबी, जटिल फिल्मों को संभाल सकते हैं।

यहाँ बताया गया है कि उन्होंने क्या किया, कुछ सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "शॉर्ट-क्लिप" का जाल

अब तक, अधिकांश AI टेस्ट एक छात्र को बिल्ली के कूदने का 10 सेकंड का वीडियो दिखाने और पूछने जैसे थे, "क्या बिल्ली कूदी?" AI उस विशिष्ट कूद को आसानी से याद कर सकता था।

लेकिन वास्तविक दुनिया में, वीडियो 90 मिनट की डॉक्यूमेंट्री या व्लॉग्स की तरह होते हैं। उनमें होता है:

  • लंबे समय की याददाश्त (Long-term memory): "उस आदमी ने 20 मिनट पहले क्या कहा था?"
  • जटिल समय (Complex timing): "संगीत कब रुका और बारिश कब शुरू हुई?"
  • मिश्रित संकेत (Mixed signals): हाथों से कुछ काम करते समय पृष्ठभूमि में संगीत के साथ लोगों का बात करना।

वर्तमान AI मॉडल उन छात्रों की तरह हैं जो फ्लैशकार्ड तो रट सकते हैं लेकिन 3 घंटे की फाइनल परीक्षा में फेल हो जाते हैं। जब कहानी बहुत लंबी हो जाती है, तो वे खो जाते हैं।

2. समाधान: LVOmniBench (द "मैराथन" टेस्ट)

शोधकर्ताओं ने LVOmniBench नामक एक नया टेस्ट बनाया है। इसे एक स्प्रिंट (तेज दौड़) के बजाय एक मैराथन के रूप में सोचें।

  • कोर्स: उन्होंने 275 वास्तविक दुनिया के वीडियो एकत्र किए (जैसे कुकिंग शो, ट्रैवल व्लॉग और इंटरव्यू) जो 10 से 90 मिनट लंबे हैं।
  • प्रश्न: उन्होंने 1,000 से अधिक प्रश्न लिखे जिनमें AI को एक ही समय में अपनी आँखों (वीडियो) और कानों (ऑडियो) का उपयोग करने की आवश्यकता होती है।
    • उदाहरण: "वीडियो में आदमी कहता है कि वह 'टोबी' को ढूंढ रहा है। उसने वास्तव में आंगन में टोबी को कितनी बार देखा?"
    • यह कठिन क्यों है: AI को नाम सुनना होगा, टोबी को खोजने के लिए वीडियो देखना होगा, टोबी के दिखने की गिनती करनी होगी, और उन समयों को अनदेखा करना होगा जब टोबी वहां नहीं है।

3. परिणाम: "अमीर बच्चा" बनाम "संघर्ष करता छात्र"

शोधकर्ताओं ने इस मैराथन पर सर्वश्रेष्ठ AI मॉडल्स का परीक्षण किया। परिणाम थोड़े चौंकाने वाले थे:

  • "प्रोपराइटरी" मॉडल्स (अमीर बच्चे): ये सुपर-महंगे, क्लोज्ड-सोर्स मॉडल हैं जैसे Gemini 3 Pro। ये उन छात्रों की तरह हैं जिनके पास निजी ट्यूटर और असीमित अध्ययन का समय है। इनका स्कोर लगभग 65% था। इन्होंने अच्छा प्रदर्शन किया, लेकिन फिर भी ये लगभग एक तिहाई प्रश्नों का उत्तर गलत देते रहे।
  • "ओपन-सोर्स" मॉडल्स (संघर्ष करते छात्र): ये मुफ्त, समुदाय द्वारा बनाए गए मॉडल हैं। इनका स्कोर 35% से नीचे था।
    • उपमा: यदि आप मल्टीपल-चॉइस टेस्ट पर रैंडम अनुमान लगाते हैं, तो आपको 25% सही उत्तर मिलते हैं। ये ओपन-सोर्स मॉडल रैंडम अनुमान लगाने से भी थोड़ा ही बेहतर कर रहे थे। वे लंबे वीडियो में पूरी तरह से खो जाते थे।

4. वे कहाँ विफल हुए? (द "हैलुसिनेशन" ज़ोन)

पेपर में पाया गया कि AI तीन विशिष्ट तरीकों से विफल होता है, जैसे कि एक ऐसा छात्र जो इन चीजों में बुरा है:

  • गिनती (Counting): "कुत्ता कितनी बार भौंका?" (AI अक्सर गिनती भूल जाता है)।
  • संगीत की समझ (Music Perception): "किस तरह का वाद्य यंत्र बज रहा है?" (AI शोर तो सुनता है लेकिन धुन को पहचान नहीं पाता)।
  • समय यात्रा (Time Travel): "15 मिनट पहले क्या हुआ था?" (AI वीडियो के अंत तक पहुँचते-पहुँचते शुरुआत को भूल जाता है)।

5. मुख्य निष्कर्ष

मुख्य संदेश यह है कि हम अभी वहां तक नहीं पहुंचे हैं।

जबकि AI एक तस्वीर देखने या एक छोटा वाक्य सुनने में अद्भुत है, यह वर्तमान में एक लंबे, निरंतर कहानी को समझने में बहुत खराब है जहाँ ध्वनि और दृश्य आपस में मिले हुए होते हैं। "ओपन-सोर्स" मॉडल लंबे वीडियो की बारीकियों के प्रति अनिवार्य रूप से अंधे और बहरे हैं।

यह क्यों मायने रखता है?
क्योंकि भविष्य का AI केवल एक फोटो के बारे में सवाल पूछने के बारे में नहीं है। यह एक ऐसे AI असिस्टेंट के बारे में है जो चोर को खोजने के लिए 2 घंटे के सुरक्षा कैमरा फीड को देख सके, या 45 मिनट के लेक्चर को सुनकर उसके मुख्य बिंदुओं का सारांश दे सके। यह नया टेस्ट (LVOmniBench) AI डेवलपर्स को ऐसे मॉडल बनाने के लिए मजबूर करने की दिशा में पहला कदम है जो वास्तव में वास्तविक जीवन की लंबाई और जटिलता को संभाल सकें।

संक्षेप में: हमने एक कठिन टेस्ट बनाया, और AI इसमें फेल हो गया। अब, हमें पता है कि अगली पीढ़ी के AI को वास्तव में "ओमनी-स्मार्ट" बनाने के लिए हमें क्या ठीक करने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →