← नवीनतम पेपर
💻 computer science

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

यह शोध पत्र MuseBench को प्रस्तुत करता है, जो विविध दृश्य-श्रव्य कलाओं में 4,000 से अधिक विशेषज्ञ-सत्यापित प्रश्नों वाला एक व्यापक बेंचमार्क है, जिसे मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की इरादा-स्तर (intent-level) की तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है और जो रचनात्मक कलात्मक इरादे को समझने में वर्तमान एआई प्रणालियों और मानव विशेषज्ञों के बीच प्रदर्शन के एक महत्वपूर्ण अंतर को प्रकट करता है।

मूल लेखक: Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म देख रहे हैं। एक मानक वीडियो AI आपको बता सकता है, "एक अंधेरे कमरे में एक आदमी रो रहा है।" वह पिक्सेल को देखता है और वस्तुओं को पहचान लेता है।

लेकिन MuseBench एक बहुत कठिन प्रश्न पूछता है: "निर्देशक ने कमरे को अंधेरा और कैमरा हिलता हुआ क्यों रखा? क्या यह आपको फंसा हुआ महसूस कराने के लिए है, या यह दिखाने के लिए कि पात्र अपना मानसिक संतुलन खो रहा है?"

यह शोध पत्र MuseBench को पेश करता है, जो एक नया "परीक्षा" है जिसे यह परीक्षण करने के लिए बनाया गया है कि क्या AI वीडियो के सतही विवरणों को ही नहीं, बल्कि उसके कलात्मक सार (artistic soul) को भी समझ सकता है। यह कैसे काम करता है, यहाँ सरल रूप में दिया गया है:

1. समस्या: AI एक "स्पॉइलर" है, "समीक्षक" नहीं

वर्तमान AI मॉडल चीजों को पहचानने में माहिर हैं (जैसे "एक कुत्ता" या "एक कार")। लेकिन जब कला की बात आती है—फिल्में, पेंटिंग, थिएटर और वीडियो गेम—तो वे इरादे (intent) को समझने में संघर्ष करते हैं।

  • उपमा: एक ऐसे छात्र की कल्पना करें जो नाटक की पूरी पटकथा रट सकता है लेकिन यह नहीं समझ पाता कि अभिनेता बोलने से पहले तीन सेकंड के लिए क्यों रुका। वह जानता है कि क्या हुआ, लेकिन यह नहीं कि वह ऐसा क्यों किया गया।
  • अंतराल: मौजूदा परीक्षण केवल पूछते हैं, "क्या हो रहा है?" MuseBench पूछता है, "कलाकार आपको क्या महसूस कराना चाह रहा था, और उन्होंने इसे कैसे किया?"

2. समाधान: "वीडियो निबंध" (Video Essay) लाइब्रेरी

इस परीक्षण को बनाने के लिए, शोधकर्ताओं ने केवल यादृच्छिक क्लिप्स नहीं चुनीं। वे इंटरनेट (YouTube, Bilibili, TikTok) पर गए और 10,000 से अधिक "वीडियो निबंध" एकत्र किए।

  • वीडियो निबंध क्या है? इसे एक फिल्म समीक्षक के रूप में सोचें जो एक क्लिप के ऊपर बात कर रहा है, और सटीक रूप से बता रहा है कि क्यों एक विशिष्ट लाइटिंग का चुनाव डर पैदा करता है, या क्यों एक विशिष्ट कैमरा एंगल एक पात्र को शक्तिशाली दिखाता है।
  • प्रक्रिया: शोधकर्ताओं ने इन विशेषज्ञ आलोचनाओं को परीक्षा के प्रश्नों में बदलने के लिए AI का उपयोग किया। उन्होंने 4,016 प्रश्न बनाए जो चार मुख्य कला जगतों को कवर करते हैं:
    1. सिनेमा (फिल्में/टीवी)
    2. स्थिर दृश्य कला (पेंटिंग/फोटोग्राफ)
    3. मंच प्रदर्शन (थिएटर/नृत्य)
    4. गेम आर्ट्स (वीडियो गेम)

3. परीक्षा का प्रारूप: यह केवल "A, B, C, D" नहीं है

वास्तविक कला अक्सर व्याख्या के लिए खुली होती है। एक पेंटिंग एक ही समय में "अकेलेपन" और "शांति" दोनों के बारे में हो सकती है।

  • पुराना तरीका: अधिकांश AI परीक्षण आपको केवल एक ही सही उत्तर चुनने के लिए मजबूर करते हैं (जैसे एक बहुविकल्पीय प्रश्नोत्तरी)।
  • MuseBench का तरीका: वे सिंगल-चॉइस (सबसे अच्छा उत्तर चुनें) और मल्टी-सेलेक्ट (सभी वैध व्याख्याएं चुनें) के मिश्रण का उपयोग करते हैं।
    • उपमा: यदि आप पूछते हैं, "यह गाना किस बारे में है?" तो एक साधारण परीक्षण आपको "उदासी" चुनने के लिए मजबूर कर सकता है। MuseBench आपको "उदासी" और "आशा" दोनों चुनने की अनुमति देता है यदि दोनों वीडियो द्वारा समर्थित हैं। यह परीक्षण करता है कि क्या AI मानव कला की जटिलता को संभाल सकता है।

4. परिणाम: AI अभी भी एक "नौसिखिया" है

शोधकर्ताओं ने आज के सबसे स्मार्ट AI मॉडलों में से 28 मॉडलों (GPT-4, Claude और Gemini जैसे बड़े नामों सहित) का इस परीक्षा पर परीक्षण किया।

  • स्कोर: सबसे अच्छे AI ने भी लगभग 48% सही उत्तर दिए।
  • मानव स्कोर: कला विशेषज्ञों ने 87% सही उत्तर दिए।
  • निष्कर्ष: AI मूल रूप से आधे सवालों पर अनुमान लगा रहा है। उसने अभी तक कला की "भाषा" नहीं सीखी है।

5. वे कहाँ विफल होते हैं?

शोध पत्र में इस बात के कुछ मजेदार और विशिष्ट पैटर्न मिले कि AI कैसे विफल होता है:

  • "गेम" की अंध बिंदु (Blind Spot): AI वीडियो गेम को समझने में बहुत खराब था। ऐसा लगता है कि AI ने बहुत सारे मूवी स्क्रिप्ट पढ़े हैं लेकिन उसने यह समझने के लिए पर्याप्त गेम नहीं "खेला" है कि गेम डिजाइन भावनाओं को कैसे पैदा करता है।
  • "प्रथम विकल्प" का पूर्वाग्रह: जब AI को उत्तर नहीं पता होता था, तो उसमें एक अजीब आदत थी कि वह मनुष्यों की तुलना में विकल्प 'A' को अधिक बार चुनता था।
  • "सैलिएंट" (Salient) जाल: जिन प्रश्नों में कई सही उत्तर थे, AI आमतौर पर सबसे स्पष्ट उत्तर को ढूंढ लेता था लेकिन सूक्ष्म (subtle) उत्तरों को छोड़ देता था। यह बड़े पेड़ को देखने लेकिन जंगल को न देख पाने जैसा है।

सारांश

MuseBench AI के लिए एक वास्तविकता की जाँच है। यह साबित करता है कि जबकि AI एक वीडियो का वर्णन कर सकता है, यह उसके पीछे के रचनात्मक विकल्पों को समझने में अभी भी बहुत बुरा है। बेहतर होने के लिए, AI को केवल पिक्सेल को "देखना" बंद करना होगा और कलाकारों, निर्देशकों और गेम डिजाइनरों की "शब्दावली" सीखना शुरू करना होगा।

मुख्य बात: हमारे पास ऐसा AI है जो एक पेंटिंग का वर्णन कर सकता है, लेकिन हमारे पास अभी ऐसा AI नहीं है जो वास्तव में इसकी प्रशंसा कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →