← नवीनतम पेपर
💻 computer science

Breaking Annotation Barriers: Generalized Video Quality Assessment via Ranking-based Self-Supervision

यह शोध पत्र एक ऐसे स्व-पर्यवेक्षित शिक्षण ढांचे (self-supervised learning framework) का प्रस्ताव करता है जो एक सामान्यीकृत वीडियो गुणवत्ता मूल्यांकन मॉडल को प्रशिक्षित करने के लिए बड़े पैमाने पर बिना लेबल वाले वेब वीडियो पर लर्निंग-टू-रैंक प्रतिमान (learning-to-rank paradigm) और एक पुनरावृत्ति स्व-सुधार रणनीति (iterative self-improvement strategy) का लाभ उठाता है, जो श्रम-साध्य मैनुअल एनोटेशन पर निर्भर किए बिना अत्याधुनिक प्रदर्शन और उत्कृष्ट आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण प्राप्त करता है।

मूल लेखक: Linhan Cao, Wei Sun, Kaiwei Zhang, Yicong Peng, Guangtao Zhai, Xiongkuo Min

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Linhan Cao, Wei Sun, Kaiwei Zhang, Yicong Peng, Guangtao Zhai, Xiongkuo Min

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: "मानवीय जज" की बाधा

कल्पना कीजिए कि आप एक विशाल वीडियो स्ट्रीमिंग सेवा चला रहे हैं। आपको यह जानने की ज़रूरत है कि लाखों लोगों को दिखाने से पहले कोई वीडियो अच्छा दिख रहा है या बुरा। ऐसा करने के लिए, आमतौर पर आपको विशेषज्ञों की एक टीम की आवश्यकता होती है जो हजारों वीडियो देखें और उन्हें रेटिंग दें।

समस्या क्या है? यह धीमा, महंगा और बड़े पैमाने पर करना असंभव है। आप हर नए वीडियो को देखने के लिए पर्याप्त इंसानों को काम पर नहीं रख सकते, खासकर जब टिकटॉक और यूट्यूब जैसे प्लेटफॉर्म पर कंटेंट का विस्फोट हो रहा हो। इसके अलावा, मानव विशेषज्ञ उन चीज़ों को परखने में माहिर होते हैं जो उन्होंने पहले देखी हैं, लेकिन वे अक्सर नए प्रकार के वीडियो (जैसे हाई-स्पीड गेमिंग या AI-जनरेटेड कंटेंट) के सामने भ्रमित हो जाते हैं जिन्हें देखकर उन्होंने प्रशिक्षण नहीं लिया है।

समाधान: कंप्यूटर को "टेनिस खेलना" सिखाना

कंप्यूटर को किसी वीडियो को एक विशिष्ट स्कोर देने के लिए कहने के बजाय (जैसे "10 में से 7.5"), शोधकर्ताओं ने कंप्यूटर को वीडियो टेनिस खेलना सिखाने का फैसला किया।

टेनिस में, आपको यह जानने की ज़रूरत नहीं है कि गेंद कितनी तेज़ चल रही है ताकि आप जान सकें कि किसने पॉइंट जीता; आपको बस यह जानना है कि किस खिलाड़ी ने गेंद को बेहतर तरीके से हिट किया। इसी तरह, यह पेपर कंप्यूटर को एक समय में दो वीडियो दिखाना सिखाता है और बस यह तय करना सिखाता है: "क्या वीडियो A, वीडियो B से बेहतर है, या वीडियो B बेहतर है?"

इसे रैंकिंग (Ranking) कहा जाता है। एक चीज़ को एक सटीक नंबर देने की तुलना में दो चीज़ों की तुलना करना कंप्यूटर (और इंसानों) के लिए बहुत आसान है।

उन्होंने ट्रेनिंग डेटा कैसे बनाया (द "जिम")

इस कंप्यूटर को सिखाने के लिए, उन्हें अभ्यास मैचों के एक विशाल जिम की आवश्यकता थी। लेकिन वे हर मैच को लेबल करने के लिए मानव जजों का उपयोग नहीं कर सकते थे। इसलिए, उन्होंने अपना खुद का "ऑटो-जेनरेटेड" प्रैक्टिस डेटा बनाने के लिए दो चतुर ट्रिक्स का उपयोग किया:

  1. "पैनल ऑफ जजेस" ट्रिक: उन्होंने पांच मौजूदा, शीर्ष-स्तरीय वीडियो क्वालिटी मॉडल्स (वर्तमान "चैंपियंस") को लिया और उनसे लाखों वीडियो जोड़ों की तुलना करने के लिए कहा। यदि पांचों जजों ने सहमति जताई कि वीडियो A, वीडियो B से बेहतर है, तो उन्होंने उस जोड़ी को वीडियो A के लिए एक "जीत" के रूप में चिह्नित किया। उन्होंने इन पांच मॉडल्स की राय को मिलाकर एक बहुत ही विश्वसनीय "सुपर-जज" बनाया।
  2. "आर्टिफिशियल डैमेज" ट्रिक: उन्होंने साफ-सुथरे वीडियो लिए और उन्हें जानबूझकर विशिष्ट तरीकों से खराब कर दिया (उन्हें धुंधला, गहरा, शोर वाला या कंप्रेस्ड बनाना)। चूंकि वे जानते थे कि उन्होंने कितना नुकसान पहुँचाया है, इसलिए वे जानते थे कि मूल वीडियो खराब किए गए वर्जन से बेहतर है। इससे उन्होंने "स्पष्ट" तुलनाओं का एक विशाल पुस्तकालय बना लिया।

परिणाम: उन्होंने 7,00,000 वीडियो जोड़ों का एक डेटासेट बनाया। यह एक लाइब्रेरी की तरह है जिसमें 7,00,000 टेनिस मैच शामिल हैं, जिन्हें बिना किसी इंसान के देखे स्वचालित रूप से लेबल किया गया है।

असली मंत्र: "स्वयं-सुधार" वाला लूप (The "Self-Improving" Loop)

यहाँ उनके तरीके का सबसे रचनात्मक हिस्सा है। आमतौर पर, आप एक रोबोट को प्रशिक्षित करते हैं और फिर रुक जाते हैं। इस टीम ने कुछ अलग किया: उन्होंने रोबोट को अपना होमवर्क खुद ग्रेड करने दिया।

  1. राउंड 1: वे "पैनल ऑफ जजेस" द्वारा बनाए गए 7,00,000 जोड़ों का उपयोग करके एक मॉडल को प्रशिक्षित करते हैं।
  2. राउंड 2: एक बार जब वह मॉडल प्रशिक्षित हो जाता है, तो वे उसे एक नया जज बना देते हैं। वे इस नए रोबोट को कुछ वीडियो जोड़ों का पुनर्मूल्यांकन करने के लिए कहते हैं। क्योंकि रोबोट ने पहले दौर से सीखा है, इसलिए वह उन सूक्ष्म अंतरों को पकड़ सकता है जो पुराने जजों ने मिस कर दिए होंगे।
  3. राउंड 3: वे पुराने लेबल को नए, स्मार्ट लेबल के साथ मिलाते हैं और एक और भी बेहतर मॉडल को प्रशिक्षित करते हैं।

यह एक छात्र की तरह है जो एक अभ्यास टेस्ट देता है, उत्तरों का अध्ययन करता है, और फिर उच्च स्कोर प्राप्त करने के लिए फिर से टेस्ट देता है। इस "स्वयं-सुधार" लूप को दोहराकर, मॉडल गुणवत्ता संबंधी समस्याओं को पहचानने में स्मार्ट और स्मार्ट होता जाता है, यहाँ तक कि उन समस्याओं को भी जिन्हें उसने पहले कभी नहीं देखा।

परिणाम: एक स्पेशलिस्ट नहीं, बल्कि एक जनरलिस्ट

अधिकांश वीडियो क्वालिटी मॉडल्स 'स्पेशलिस्ट' की तरह होते हैं: वे फिल्में परखने में बेहतरीन होते हैं लेकिन वीडियो गेम परखने में खराब।

इस पेपर में बनाया गया मॉडल एक जनरलिस्ट (Generalist) है।

  • जीरो-शॉट पावर (Zero-Shot Power): जब उन्होंने उन वीडियो पर इसका परीक्षण किया जिन्हें उन्होंने पहले कभी नहीं देखा था (जैसे हाई-फ्रेम-रेट स्पोर्ट्स या 4K गेमिंग), तो इसने महंगे मानव-प्रशिक्षित मॉडल्स के समान या उनसे बेहतर प्रदर्शन किया।
  • "OOD" की जीत: पेपर की भाषा में, "आउट-ऑफ-डिस्ट्रीब्यूशन" (OOD) का अर्थ है "अजीब चीजें जिस पर हमने ट्रेनिंग नहीं ली है।" उनके मॉडल ने अजीब चीजों से भ्रमित होने के बजाय, उन्हें आसानी से संभाला।

सारांश

इस पेपर को एक रेसिपी के रूप में सोचें जो कंप्यूटर को वीडियो देखने के लिए एक भी इंसान को काम पर रखे बिना वीडियो क्वालिटी को परखना सिखाती है।

  1. स्कोर माँगना बंद करें; तुलना (वीडियो A बनाम वीडियो B) पूछना शुरू करें।
  2. मौजूदा रोबोट्स के पैनल और जानबूझकर खराब किए गए वीडियो का उपयोग करके एक विशाल ट्रेनिंग लाइब्रेरी बनाएं।
  3. रोबोट को अपने अभ्यास टेस्ट को खुद ग्रेड करने दें ताकि वह समय के साथ और स्मार्ट हो सके।

परिणाम एक ऐसा वीडियो क्वालिटी मॉडल है जिसे प्रशिक्षित करना सस्ता है, जो अनंत रूप से स्केल किया जा सकता है, और किसी भी तरह के वीडियो—चाहे वह कुकिंग ट्यूटोरियल हो या हाई-स्पीड कार रेस—को परखने में आश्चर्यजनक रूप से अच्छा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →