← नवीनतम पेपर
💻 computer science

VABench: A Comprehensive Benchmark for Audio-Video Generation

यह शोधपत्र VABench को प्रस्तुत करता है, जो एक व्यापक बहु-आयामी बेंचमार्क ढांचा है जिसे मौजूदा वीडियो जनरेशन बेंचमार्क में विश्वसनीय मूल्यांकन की कमी को दूर करने के लिए तीन कार्य प्रकारों, सात सामग्री श्रेणियों और 15 मूल्यांकन आयामों के माध्यम से सिंक्रोनस ऑडियो-वीडियो जनरेशन क्षमताओं का व्यवस्थित रूप से मूल्यांकन करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Daili Hua, Xizhi Wang, Bohan Zeng, Xinyi Huang, Hao Liang, Junbo Niu, Xinlong Chen, Quanqing Xu, Wentao Zhang

प्रकाशित 2026-04-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daili Hua, Xizhi Wang, Bohan Zeng, Xinyi Huang, Hao Liang, Junbo Niu, Xinlong Chen, Quanqing Xu, Wentao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मूवी थिएटर में हैं। वर्षों से, स्क्रीन अधिक स्पष्ट होती जा रही है, रंग अधिक जीवंत हो रहे हैं, और एक्शन अधिक सुचारू होता जा रहा है। हमने फिल्म के दृश्य (visual) भाग में महारत हासिल कर ली है। लेकिन हाल ही में, फिल्म निर्माताओं ने कुछ नया करने की कोशिश शुरू की है: वे चाहते थे कि ध्वनि दृश्य के साथ पूरी तरह मेल खाए, न कि केवल बैकग्राउंड शोर के रूप में, बल्कि दृश्यों के एक जीवित, सांस लेते साथी के रूप में।

समस्या क्या थी? हमारे पास इन नए "ऑडियो-वीडियो" फिल्मों को ग्रेड करने का कोई अच्छा तरीका नहीं था। हमारे पास चित्र के लिए पैमाने (rulers) थे, लेकिन ध्वनि के लिए कोई पैमाने नहीं थे, और निश्चित रूप से इस बात के लिए भी कोई पैमाना नहीं था कि ध्वनि और चित्र कितनी अच्छी तरह एक साथ नृत्य करते हैं।

यहाँ पेश है VABench। VABench को अगली पीढ़ी के AI फिल्म निर्माताओं के लिए अंतिम "टेस्ट ऑफ टेस्ट" और "क्वालिटी कंट्रोल" लैब के रूप में समझें।

यहाँ इस पेपर का एक सरल विवरण दिया गया है, जिसे कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करके समझाया गया है:

1. समस्या: "मूक फिल्म" बनाम "टॉकी"

लंबे समय तक, AI बेहतरीन वीडियो (जैसे एक मूक फिल्म) या बेहतरीन ध्वनि (जैसे एक रेडियो नाटक) बना सकता था, लेकिन उन्हें एक साथ जोड़ना बहुत अव्यवरेज था।

  • पुराना तरीका: यह एक गाने को डांस के साथ सिंक करने के लिए अनुमान लगाने जैसा था। कभी-कभी गायक का मुँह आवाज आने से पहले हिल जाता था, या कार के इंजन की आवाज कार की गति से मेल नहीं खाती थी।
  • नया लक्ष्य: हम एक ऐसा AI वीडियो चाहते हैं जहाँ ऑडियो और वीडियो एक साथ पैदा हुए हों, पूरी तरह से सिंक में हों, जैसे कि एक वास्तविक इंसान बोल रहा हो या कोई वास्तविक घटना घट रही हो।

2. समाधान: VABench (द "मास्टर शेफ का स्कोरकार्ड")

लेखकों ने VABench बनाया है, जो इन AI शेफ के लिए एक विशाल, सुपर-विस्तृत स्कोरकार्ड की तरह है। केवल "अच्छा काम किया" कहने के बजाय, यह प्रदर्शन को 15 अलग-अलग श्रेणियों में विभाजित करता है।

यहाँ तीन मुख्य "चुनौतियां" हैं जिन्हें AI को पास करना होगा:

  • चुनौती A: टेक्स्ट-टू-वीडियो (द "इमेजिनेशन टेस्ट")
    • प्रॉम्ट (Prompt): आप टाइप करते हैं, "एक बिल्ली सैक्सोफोन पर जैज़ बजा रही है।"
    • टेस्ट: क्या AI ने एक बिल्ली बनाई? क्या वह बजाते हुए दिख रही है? क्या जैज़ का संगीत सही लग रहा है? क्या बिल्ली का मुँह संगीत के साथ हिल रहा है?
  • चुनौती B: इमेज-टू-वीडियो (द "सीक्वल टेस्ट")
    • प्रॉम्ट: आप एक जमी हुई झरने की तस्वीर दिखाते हैं।
    • टेस्ट: AI को इसे एनिमेट करना होगा। क्या पानी बहना शुरू होता है? क्या आप बहते हुए पानी की आवाज सुनते हैं? क्या ध्वनि गिरते हुए बर्फ की गति से मेल खाती है?
  • चुनौती C: स्टीरियो साउंड (द "3D ऑडियो टेस्ट")
    • प्रॉम्ट: "एक पक्षी बाएं से दाएं उड़ता है।"
    • टेस्ट: वास्तविक दुनिया में, पक्षी की आवाज आपके बाएं कान से दाएं कान तक जानी चाहिए। VABench यह जांचता है कि क्या AI इस "स्पेशियल" (स्थानिक) ध्वनि को बना सकता है, न कि केवल एक सपाट, उबाऊ शोर।

3. कंटेंट के सात "फ्लेवर्स" (Flavors)

जिस तरह एक रेस्टोरेंट में मेनू होता है, VABench AI को विभिन्न प्रकार के कंटेंट के सात "फ्लेवर्स" पर टेस्ट करता है ताकि देखा जा सके कि वह सब कुछ संभाल सकता है या नहीं:

  1. जानवर: क्या पक्षी सही ढंग से चहचहाते हैं?
  2. मानवीय ध्वनियाँ: जब लोग बोलते या हंसते हैं तो क्या वे स्वाभाविक लगते हैं? (यह AI के लिए आश्चर्यजनक रूप से कठिन है!)
  3. संगीत: क्या बीट विजुअल रिदम (दृश्य लय) से मेल खाती है?
  4. प्रकृति: क्या हवा की आवाज हवा जैसी लगती है?
  5. फिजिक्स (भौतिकी): यदि आप एक गिलास गिराते हैं, तो क्या वह फर्श से टकराते ही ठीक उसी क्षण कड़क की आवाज करता है?
  6. जटिल दृश्य: यदि एक व्यस्त सड़क दिखाई जाती है, तो क्या AI कार के हॉर्न, कदमों की आहट और लोगों की बातचीत को बिना किसी गड़बड़ी के मिला सकता है?
  7. आभासी दुनिया (Virtual Worlds): क्या AI जादू या साइंस-फिक्शन के लिए ऐसी आवाजें बना सकता है जो उस दुनिया के भीतर अभी भी "वास्तविक" महसूस हों?

4. ग्रेडिंग कैसे होती है: रोबोट जज और मानव आलोचक

AI को ग्रेड करने के लिए, VABench दो-तरफा दृष्टिकोण का उपयोग करता है:

  • रोबोट जज (विशेषज्ञ मॉडल): ये विशेष AI प्रोग्राम हैं जो एक साउंड इंजीनियर या फिल्म संपादक की तरह काम करते हैं। वे तकनीकी चीजों की जांच करते हैं जैसे, "क्या ऑडियो स्पष्ट है?" या "क्या ध्वनि 0.5 सेकंड देरी से शुरू हुई?"
  • मानव-समान जज (लार्ज लैंग्वेज मॉडल्स): ये सुपर-स्मार्ट AI "क्रिटिक्स" हैं जो स्क्रिप्ट पढ़ते हैं, वीडियो देखते हैं और ऑडियो सुनते हैं। वे सवालों के जवाब देते हैं जैसे, "क्या संगीत इस दृश्य के लिए पर्याप्त उदास महसूस होता है?" या "क्या चरित्र की आवाज उसके गुस्से वाले चेहरे से मेल खाती है?"

5. परिणाम: कुकिंग कॉन्टेस्ट कौन जीता?

पेपर ने कई प्रसिद्ध AI मॉडलों (जैसे Sora, Veo, और Wan) का परीक्षण किया। यहाँ उन्होंने क्या पाया:

  • "ऑल-इन-वन" मॉडल जीतते हैं: वे मॉडल जो वीडियो और ध्वनि को साथ मिलकर बनाने के लिए प्रशिक्षित किए जाते हैं (जैसे एक पूर्ण ऑर्केस्ट्रा), उन मॉडलों से बेहतर प्रदर्शन करते हैं जो पहले वीडियो बनाने और फिर बाद में उसमें ध्वनि जोड़ने की कोशिश करते हैं (जैसे एक सोलोइस्ट जो एक साथ दो वाद्य यंत्र बजाने की कोशिश कर रहा हो)।
  • "मानवीय आवाज" अभी भी कठिन है: सबसे अच्छे AI भी मानवीय भाषण के साथ थोड़ा संघर्ष करते हैं। शब्दों के साथ होंठों को पूरी तरह से हिलाना अभी भी एक बड़ी चुनौती है।
  • फिजिक्स ट्रिकी है: यदि कोई कार तेजी से गुजरती है, तो ध्वनि का पिच बदलना चाहिए (डॉप्लर प्रभाव)। कुछ मॉडलों ने इसे सही पकड़ा, जबकि अन्य ने केवल एक सपाट ध्वनि बजाई।

यह क्यों मायने रखता है?

सोचिए कि VABench AI वीडियो के लिए ओलंपिक कमेटी की तरह है। पहले, हम केवल अंदाजा लगा रहे थे कि कौन सबसे अच्छा है। अब, हमारे पास एक स्कोरबोर्ड है।

यह बेंचमार्क शोधकर्ताओं को बताता है कि उन्हें वास्तव में कहाँ सुधार करने की आवश्यकता है। यह एक धावक को बताने जैसा है, "आप स्प्रिंट करने में बहुत अच्छे हैं, लेकिन आपकी शुरुआती ब्लॉक धीमी हैं।" इन विशिष्ट मुद्दों को ठीक करके, हम एक ऐसे भविष्य की ओर बढ़ते हैं जहाँ AI ऐसी फिल्में, कार्टून या आभासी दुनिया बना सकता है जो इतनी वास्तविक महसूस होती हैं कि आप भूल सकते हैं कि वे कंप्यूटर द्वारा बनाई गई थीं।

संक्षेप में: VABेंच वह नियम पुस्तिका और रेफरी है जो यह सुनिश्चित करता है कि अगली पीढ़ी की AI फिल्में न केवल दिखने में अच्छी हों, बल्कि सुनने में भी अच्छी हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →