← नवीनतम पेपर
💻 computer science

Analytic Score Optimization for Multi Dimension Video Quality Assessment

यह शोध पत्र UltraVQA प्रस्तुत करता है, जो मानव-एनोटेटेड आयामों और AI-जनरेटेड तर्कों वाला एक बड़े पैमाने का बहु-आयामी वीडियो गुणवत्ता मूल्यांकन डेटासेट है, साथ ही एनालिटिक स्कोर ऑप्टिमाइज़ेशन (ASO) भी प्रस्तुत करता है, जो एक सैद्धांतिक रूप से आधारित पोस्ट-ट्रेनिंग विधि है जो गुणवत्ता मूल्यांकन को एक नियमित (regularized) निर्णय लेने की प्रक्रिया के रूप में पुनर्गठित करके भविष्यवाणी की सटीकता और मानव प्राथमिकताओं के साथ संरेखण में सुधार करती है।

मूल लेखक: Boda Lin, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan

प्रकाशित 2026-02-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Boda Lin, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए रेस्टोरेंट के फूड क्रिटिक (खाद्य समीक्षक) हैं। पुराने दिनों में, आप शायद भोजन को केवल एक संख्या दे देते: 10 में से 7। यह मददगार तो है, लेकिन यह बहुत अस्पष्ट भी है। क्या आपने इसे 7 इसलिए दिया क्योंकि स्टेक सख्त था? क्योंकि लाइटिंग खराब थी? या इसलिए क्योंकि डेज़र्ट शानदार था लेकिन सूप ठंडा था? एक अकेली संख्या उस 'क्यों' को छिपा लेती है।

यह पेपर वीडियो के लिए उस फूड क्रिटिक सिस्टम को अपग्रेड करने के बारे में है। केवल एक वीडियो को एक "स्कोर" देने के बजाय, लेखकों ने एक ऐसा सिस्टम बनाया है जो समीक्षा को पांच विशिष्ट श्रेणियों में विभाजित करता है: मोशन (गति), मूवमेंट साइज (आकार), ब्यूटी (सौंदर्य), स्टोरी (कहानी), और क्लैरिटी (स्पष्टता)

यहाँ उनके तीन बड़े योगदानों का एक सरल विवरण दिया गया है:

1. "UltraVQA" डेटासेट: एक विशाल, विस्तृत स्कोरकार्ड

कल्पना कीजिए कि आप एक रोबोट को यह सिखाना चाहते हैं कि वीडियो का निर्णय कैसे किया जाए। यदि आप उसे केवल 1,000 वीडियो दिखाते हैं और कहते हैं "यह अच्छा है, वह बुरा है," तो रोबोट भ्रमित हो जाएगा। उसे यह नहीं पता चलेगा कि क्या एक वीडियो को अच्छा बनाता है।

लेखकों ने UltraVQA बनाया, जो 40,000 वीडियो का एक विशाल पुस्तकालय है। लेकिन यहाँ एक ट्विस्ट है:

  • मानवीय पैनल: एक व्यक्ति द्वारा निर्णय लेने के बजाय, उन्होंने 40 प्रशिक्षित विशेषज्ञों की एक टीम का उपयोग किया। प्रत्येक वीडियो को कम से कम तीन अलग-अलग लोगों द्वारा देखा गया।
  • 5-पॉइंट मेनू: एक स्कोर के बजाय, विशेषज्ञों ने प्रत्येक वीडियो को पांच विशिष्ट चीजों पर रेट किया:
    1. मोशन क्वालिटी (गति की गुणवत्ता): क्या गति सुचारू है, या यह किसी हिलते हुए फोन कैमरे की तरह झटकेदार है?
    2. मोशन एम्प्लीट्यूड (गति का आयाम): क्या इसमें बहुत अधिक एक्शन है, या यह एक स्थिर छवि है?
    3. एस्थेटिक क्वालिटी (सौंदर्य गुणवत्ता): क्या यह सुंदर है? अच्छी लाइटिंग? अच्छे रंग?
    4. कंटेंट क्वालिटी (सामग्री की गुणवत्ता): क्या कहानी समझ में आती है? क्या विषय स्पष्ट है?
    5. क्लैरिटी क्वालिटी (स्पष्टता की गुणवत्ता): क्या यह शार्प है, या यह धुंधला और पिक्सेलेटेड है?
  • "क्यों" (तर्क): महत्वपूर्ण रूप से, विशेषज्ञों ने केवल नंबर नहीं लिखे। उन्होंने संक्षिप्त स्पष्टीकरण भी लिखे (जैसे, "वीडियो धुंधला है क्योंकि कैमरा हिल गया था")। लेखकों ने फिर इन मानवीय नोट्स को स्पष्ट, संरचित अनुच्छेदों में बदलने के लिए एक AI (GPT) का उपयोग किया। यह रोबोट को न केवल यह सिखाता है कि स्कोर क्या है, बल्कि यह भी कि उसे वह स्कोर क्यों मिला।

2. "एनालिटिक स्कोर ऑप्टिमाइज़ेशन" (ASO): एक स्मार्ट गणितीय ट्रिक

यह इस पेपर का तकनीकी केंद्र है, लेकिन आइए एक उपमा का उपयोग करें।

कल्पना कीजिए कि आप एक कुत्ते को गेंद लाने के लिए प्रशिक्षित कर रहे हैं।

  • पुराना तरीका (रिग्रेशन): आप कुत्ते से कहते हैं, "गेंद को 7.5 मीटर के निशान तक लाओ।" यदि कुत्ता उसे 7.4 मीटर पर लाता है, तो आप कहते हैं "करीब है, लेकिन नहीं।" यह निराशाजनक है क्योंकि मानवीय राय शायद ही कभी सटीक होती है। एक व्यक्ति सोच सकता है कि एक वीडियो "3.5" है, और दूसरा इसे "4.0" मान सकता है।
  • नया तरीका (ASO): लेखकों ने महसूस किया कि वीडियो स्कोर एक सीढ़ी की तरह होते हैं, न कि एक रूलर (पैमाने) की तरह। आप पायदान 3, पायदान 3.5, या पायदान 4 पर हो सकते हैं। आप पायदानों के "बीच में" नहीं हो सकते।

उन्होंने एनालिटिक स्कोर ऑप्टिमाइज़ेशन (ASO) नामक एक गणितीय विधि विकसित की।

  • इसे AI के लिए एक GPS के रूप में सोचें। बिना किसी अंदाजे के सही उत्तर पाने की कोशिश करने के बजाय (जो धीमा और अस्थिर है), ASO उत्तर के लिए परफेक्ट प्रोबेबिलिटी डिस्ट्रीब्यूशन (संभावना वितरण) की गणना करता है।
  • यह कहता है: "मानवीय डेटा के आधार पर, 60% संभावना है कि स्कोर 3.5 है, 30% संभावना है कि यह 4.0 है, और 10% संभावना है कि यह 3.0 है।"
  • यह AI को केवल एक संख्या याद करने के बजाय इस प्रोबेबिलिटी मैप को सीखने के लिए मजबूर करता है। यह AI को बहुत अधिक स्थिर और सटीक बनाता है, विशेष रूप से "मोशन" जैसी कठिन चीजों के लिए, जहाँ एक "अच्छे" और "बुरे" वीडियो के बीच का अंतर बहुत सूक्ष्म हो सकता है।

3. परिणाम: एक स्मार्ट, अधिक मानवीय क्रिटिक

जब उन्होंने अपने नए सिस्टम (UltraVQA + ASO) का अन्य शीर्ष AI मॉडलों और यहाँ तक कि महंगे क्लोज्ड-सोर्स API (जैसे GPT-4) के मुकाबले परीक्षण किया:

  • यह अधिक सटीक था: इसने उन स्कोरों की भविष्यवाणी की जो वास्तव में मनुष्यों के विचारों के करीब थे।
  • यह समझाने में बेहतर था: क्योंकि इसे "तर्क" (rationale) पर प्रशिक्षित किया गया था, इसलिए यह अपने स्कोर के लिए बेहतर कारण दे सका।
  • यह अच्छी तरह से सामान्यीकरण (generalize) कर सका: यहाँ तक कि जब इसे उन वीडियो दिखाए गए जिन्हें इसने पहले कभी नहीं देखा था (जैसे स्पोर्ट्स क्लिप या समाचार), तब भी इसने विशेष वीडियो मॉडलों की तुलना में बेहतर प्रदर्शन किया।

बड़ी तस्वीर

इस पेपर से पहले, AI वीडियो जज उस छात्र की तरह थे जिसने गणित समझने के बजाय केवल उत्तर कुंजी (answer key) रट ली थी। वे एक स्कोर का अनुमान लगा सकते थे, लेकिन वे इसे समझा नहीं सकते थे, और वे मानवीय पसंद की बारीकियों के साथ संघर्ष करते थे।

यह पेपर AI को एक विस्तृत पाठ्यपुस्तक (डेटासेट) और एक बेहतर अध्ययन पद्धति (ASO गणित) देता है। परिणाम एक ऐसा वीडियो जज है जो केवल यह नहीं कहता कि "यह 7/10 है," बल्कि यह भी कह सकता है कि "यह 7/10 है क्योंकि कहानी बेहतरीन है, लेकिन कैमरा शेक मोशन क्वालिटी को थोड़ा खराब बनाता है।"

यह उस AI की ओर एक कदम है जो केवल पिक्सेल को नहीं देखता, बल्कि वीडियो देखने के अनुभव को वास्तव में समझता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →