Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models
यह शोध पत्र वीडियो समझ रिवॉर्ड मॉडलिंग में सुदृढ़ बेंचमार्क और उच्च गुणवत्ता वाले डेटा की कमी को संबोधित करते हुए वीडियो अंडरस्टैंडिंग रिवॉर्ड बेंच (VURB), बड़े पैमाने के वीडियो अंडरस्टैंडिंग प्रेफरेंस डेटासेट (VUP-35K), और अत्याधुनिक डिस्क्रिमिनेटिव और जेनेरेटिव रिवॉर्ड मॉडल्स (VideoDRM और VideoGRM) को प्रस्तुत करता है जो प्रदर्शन और तर्क क्षमताओं को महत्वपूर्ण रूप से आगे बढ़ाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप रोबोटों की एक टीम के हेड कोच हैं। ये रोबोट वीडियो देखना और उन पर आधारित सवालों के जवाब देना सीख रहे हैं। कभी-कभी, वे सही उत्तर तो दे देते हैं लेकिन उसे बहुत खराब तरीके से समझाते हैं; दूसरी ओर, कभी-कभार वे गलत उत्तर देते हैं लेकिन बहुत आत्मविश्वास के साथ बोलते हैं।
आपका काम एक रेफरी (Referee) का है। आपको रोबोटों के जवाबों को देखना होगा और यह तय करना होगा कि कौन सा बेहतर है ताकि टीम अपनी गलतियों से सीख सके। यह शोध पत्र विशेष रूप से वीडियो कार्यों के लिए एक बेहतर रेफरी बनाने के बारे में है।
यहाँ बताया गया है कि लेखकों ने क्या बनाया है, इसे सरल भाषा में समझाया गया है:
1. समस्या: रेफरी अंधे थे
लेखकों ने देखा कि जबकि AI टेक्स्ट (जैसे निबंध) और इमेज (जैसे फोटो) को परखने में बहुत अच्छा हो गया है, वह वीडियो को परखने में बहुत खराब है।
- पुराने टेस्ट दोषपूर्ण थे: मौजूदा टेस्ट ऐसे थे जैसे केवल 5 सवालों वाला एक पॉप क्विज़। वे पर्याप्त विषयों को कवर नहीं करते थे, और सवाल बहुत छोटे थे। यह एक मैराथन धावक को उसके जूते बांधते हुए देखने जैसा था।
- डेटा की कमी थी: एक अच्छे रेफरी को प्रशिक्षित करने के लिए, आपको "अच्छे उत्तर" बनाम "बुरे उत्तर" के हजारों उदाहरणों की आवश्यकता होती है। वीडियो के लिए, यह डेटा लगभग न के बराबर था क्योंकि इसे बनाना कठिन और महंगा है।
- परिणाम: वर्तमान AI रेफरी केवल अनुमान लगा रहे थे। वे सिक्का उछालकर (50% सटीकता) जीतने से थोड़ा ही बेहतर प्रदर्शन कर पा रहे थे। वे उस रोबोट के बीच अंतर नहीं कर पा रहे थे जिसने वास्तव में वीडियो को समझा और उस रोबोट के बीच जिसने सिर्फ सही अक्षर चुन लिया।
2. समाधान: एक नया स्टेडियम और एक नया नियम बनाना
इसे ठीक करने के लिए, टीम ने तीन भागों वाला एक पूर्ण नया सिस्टम बनाया:
A. नया स्टेडियम: VURB (द बेंचमार्क)
उन्होंने VURB नामक एक विशाल, उच्च-गुणवत्ता वाला परीक्षण मैदान बनाया।
- पैमाना: 5 सवालों के बजाय, उन्होंने 2,100 जटिल वीडियो चुनौतियाँ बनाईं।
- गहराई: उन्होंने केवल यह नहीं पूछा कि "क्या हुआ?" बल्कि उन्होंने रोबोटों से यह भी पूछा कि यह क्यों हुआ, चरण-दर-चरण। कल्पना कीजिए कि आप एक छात्र से केवल गणित का सवाल हल करने के लिए नहीं, बल्कि अपनी पूरी विचार प्रक्रिया लिखने के लिए कह रहे हैं। इस टेस्ट के जवाब बहुत लंबे हैं (औसतन 1,000 से अधिक शब्द) ताकि AI को वास्तव में सोचने के लिए मजबूर किया जा सके।
- निष्पक्षता: AI को केवल पहला उत्तर देखकर नकल करने से रोकने के लिए, उन्होंने एक "बहुमत मत" (Majority Vote) नियम का उपयोग किया। वे AI से एक ही वीडियो को 8 बार जज करने के लिए कहते हैं, और हर बार उत्तरों का क्रम बदल देते हैं। यदि AI अधिकांश समय सही उत्तर चुनता है, तो वह पास हो जाता है।
B. नया ट्रेनिंग कैंप: VUP-35K (द डेटासेट)
आप अभ्यास मैचों के बिना एक रेफरी को प्रशिक्षित नहीं कर सकते। चूंकि किसी के पास पर्याप्त अभ्यास डेटा नहीं था, इसलिए उन्होंने इसे बनाने के लिए एक मशीन बनाई।
- फैक्ट्री: उन्होंने एक पूरी तरह से स्वचालित पाइपलाइन (जिसमें इंसानों की जरूरत नहीं थी) बनाई जिसने वीडियो के लिए 35,000 "अच्छे उत्तर" बनाम "बुरे उत्तर" के जोड़े तैयार किए।
- चाल (Trick): यह सुनिश्चित करने के लिए कि "बुरे उत्तर" वास्तव में बुरे हों, उन्होंने कभी-कभी जानबूझकर वीडियो में थोड़ी "ग्लिच" (जैसे गुणवत्ता कम करना या फ्रेम हटाना) दी ताकि AI को गलती करने के लिए मजबूर किया जा सके। इसने उदाहरणों का एक विशाल पुस्तकालय बनाया जो दिखाते हैं कि AI वीडियो तर्क (reasoning) में कैसे और क्यों विफल होता है।
C. नए रेफरी: VideoDRM और VideoGRM
उनके नए प्रशिक्षण डेटा का उपयोग करके, उन्होंने दो नए प्रकार के रेफरी बनाए:
- VideoDRM (स्कोरकीपर): यह रेफरी दो उत्तरों को देखता है और उन्हें एक स्कोर देता है (जैसे 9.8 बनाम 2.9) यह तय करने के लिए कि कौन सा बेहतर है।
- VideoGRM (कमेंटेटर): यह रेफरी केवल विजेता नहीं चुनता; यह विस्तार से व्याख्या लिखता है कि एक उत्तर दूसरे से बेहतर क्यों है, जो एक स्पोर्ट्स एनालिस्ट की तरह खेल का विश्लेषण करता है।
3. परिणाम: नए रेफरी जीत गए
जब उन्होंने अपने नए रेफरी को टेस्ट किया:
- पुराने रेफरी: मौजूदा सर्वश्रेष्ठ AI मॉडल लगभग 55-60% स्कोर करते थे। वे रैंडम अनुमान लगाने से थोड़ा ही बेहतर थे।
- नए रेफरी: उनके नए मॉडल (VideoDRM और VideoGRM) उछलकर 63-64% पर पहुँच गए।
- तुलना: उनके नए मॉडल इन विशिष्ट वीडियो कार्यों पर सबसे महंगे, "क्लोज्ड-सोर्स" व्यावसायिक AI मॉडलों (जैसे GPT या Gemini के नवीनतम संस्करण) को भी पछाड़ देते हैं।
4. "Best-of-N" की सुपरपावर
पेपर ने यह भी दिखाया कि ये नए रेफरी वास्तविक खेल के दौरान AI टीम को स्मार्ट बनाने में मदद करते हैं।
- कल्पना कीजिए कि AI रोबोट से एक कठिन सवाल पूछा गया है। केवल एक उत्तर देने के बजाय, वह 8 अलग-अलग संभावित उत्तर उत्पन्न करता है।
- नया रेफरी उन सभी 8 को देखता है, सबसे अच्छा चुनता है, और रोबोट वही उत्तर अंतिम उत्तर के रूप में देता है।
- परिणाम: इस सरल ट्रिक ने AI को काफी सटीक बना दिया, जिससे यह साबित हुआ कि एक अच्छा खिलाड़ी होने के साथ-साथ एक अच्छा रेफरी होना भी उतना ही महत्वपूर्ण है।
सारांश
संक्षेप में, लेखकों ने कहा: "हम वीडियो AI को अच्छी तरह से जज नहीं कर सकते क्योंकि हमारे पास अच्छे टेस्ट या पर्याप्त अभ्यास डेटा नहीं है।" इसलिए, उन्होंने एक विशाल नया टेस्ट, अभ्यास डेटा बनाने वाली एक फैक्ट्री, और दो नए AI रेफरी बनाए जो अब वीडियो देखने और यह तय करने में दुनिया में सर्वश्रेष्ठ हैं कि कौन से उत्तर तर्कसंगत हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।