← नवीनतम पेपर
💻 computer science

EasyVideoR1: Easier RL for Video Understanding

यह शोध पत्र EasyVideoR1 प्रस्तुत करता है, जो एक व्यापक और कुशल सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जिसे विशेष रूप से अनुकूलित प्रीप्रोसेसिंग, एक मॉड्यूलर रिवॉर्ड सिस्टम और एक मिश्रित प्रशिक्षण प्रतिमान के माध्यम से वीडियो समझ कार्यों पर बड़े विजन-लैंग्वेज मॉडल को प्रशिक्षित करने की कम्प्यूटेशनल और मूल्यांकन चुनौतियों को दूर करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली छात्र है जो किताबें पढ़ने और गणित की समस्याओं को हल करने में माहिर है। अब, आप इस छात्र को फिल्में समझना सिखाना चाहते हैं।

फिल्में कठिन होती हैं। वे लंबी होती हैं, उनमें हलचल होती है, उनमें ध्वनि होती है, और वे हर सेकंड बदलती रहती हैं। यदि आप छात्र को हर बार एक कच्ची वीडियो फ़ाइल दिखाकर सिखाने की कोशिश करते हैं, तो यह हर एक निवाले के लिए बगीचे से ताजी सब्जियां काटकर खाना बनाने जैसा है। यह धीमा, थकाऊ है, और आप खाने से ज्यादा सब्जियां काटने में समय बिता देते हैं।

यही वह समस्या है जिसे पेपर "EasyVideoR1" हल करता है। यह एक नया टूलकिट है जिसे AI मॉडल्स को वीडियो समझने का तरीका बहुत तेज़, स्मार्ट और अधिक प्रभावी बनाने के लिए डिज़ाइन किया गया है।

यहाँ बताया गया है कि यह कैसे काम करता है, कुछ रोजमर्रा के उदाहरणों का उपयोग करते हुए:

1. "पहले से कटे हुए सामग्रियां" (Offline Caching)

समस्या: पुराने सिस्टम में, जब भी AI किसी वीडियो को देखता था, कंप्यूटर को रुकना पड़ता था, वीडियो फ़ाइल को डिकोड करना पड़ता था, उसे फ्रेम्स में काटना पड़ता था और तस्वीरों को रीसाइज करना पड़ता था। यह एक ही ट्रेनिंग सेशन के दौरान तीन बार करता था। यह एक शेफ की तरह था जो रेसिपी के हर स्टेप के लिए एक ही प्याज को बार-बार काटता है।

EasyVideoR1 का समाधान: उन्होंने एक "पहले से कटे हुए सामग्रियां" (Pre-Chopped Ingredients) सिस्टम बनाया। ट्रेनिंग शुरू होने से पहले ही, वे सभी वीडियो को एक बार प्रोसेस करते हैं और उन्हें तैयार "टेंसर्स" (डिजिटल सामग्रियां) के रूप में सेव कर लेते हैं।

  • परिणाम: जब AI को सीखने की जरूरत होती है, तो वह फ्रिज से पहले से कटी हुई सामग्रियां उठा लेता है। अब और काटना नहीं पड़ेगा! इसने ट्रेनिंग को 1.5 गुना तेज़ बना दिया, जिससे बहुत सारा समय और कंप्यूटर पावर बची।

2. "मिश्रित कक्षा" (Joint Image & Video Training)

समस्या: आमतौर पर, AI मॉडल तस्वीरों (स्थिर) और वीडियो (गतिशील) से अलग-अलग सीखते हैं। लेकिन एक मॉडल जो केवल फिल्में देखता है, वह यह भूल सकता है कि एक अकेली फोटो को कैसे देखना है, और इसके विपरीत भी। साथ ही, वीडियो बहुत बड़े होते हैं, इसलिए आप कंप्यूटर की मेमोरी में उतनी तस्वीरें नहीं रख सकते जितनी वीडियो रख सकते हैं।

EasyVideoR1 का समाधान: उन्होंने एक "मिश्रित कक्षा" (Mixed Classroom) बनाई जहाँ AI एक ही समय में फोटो और मूवी दोनों से सीखता है।

  • उदाहरण: एक जिम की कल्पना करें जहाँ आप भारी वजन (वीडियो) भी उठा सकते हैं और तेज़ कार्डियो (इमेज) भी कर सकते हैं। सिस्टम इतना स्मार्ट है कि वह जानता है: "ठीक है, इस वीडियो के लिए, आइए इसे अधिक फ्रेम फिट करने के लिए रिज़ॉल्यूशन थोड़ा कम कर दें, लेकिन इस फोटो के लिए, आइए इसे सुपर हाई-डेफिनिशन रखें।" वे एक-दूसरे में बाधा नहीं डालते; वे वास्तव में AI को दोनों क्षेत्रों में मजबूत बनाने में मदद करते हैं।

3. "स्टडी बडी और परीक्षा" (Offline + Online Training)

समस्या: Reinforcement Learning के साथ AI को सिखाना एक छात्र द्वारा टेस्ट देने जैसा है। यदि छात्र ने पहले कभी सामग्री नहीं देखी है (कोल्ड स्टार्ट), तो वह पहले कुछ टेस्ट में फेल हो जाता है, निराश हो जाता है, और धीरे सीखता है।

EasyVideoR1 का समाधान: उन्होंने एक "हाइब्रिड स्टडी मेथड" पेश किया।

  • उदाहरण: छात्र को हर बार शून्य से उत्तरों का अनुमान लगाने के लिए मजबूर करने के बजाय, वे उन्हें उच्च गुणवत्ता वाले उदाहरणों का एक "चीट शीट" (Offline Data) देते हैं जिन्हें वे पहले से जानते हैं कि सही हैं।
  • AI इन परफेक्ट उदाहरणों का अध्ययन करता है और साथ ही साथ खुद से नई समस्याओं को हल करने की कोशिश भी करता है (Online Exploration)। इससे AI कठिन कार्यों को बहुत तेज़ी से सीख पाता है क्योंकि उसके पास निर्माण के लिए एक ठोस आधार होता है।

4. "सुपर-फास्ट ग्रेडर" (Asynchronous Evaluation)

समस्या: 22 अलग-अलग वीडियो बेंचमार्क के लिए AI कितनी अच्छी तरह समझ रहा है, इसकी जांच करना एक हज़ार निबंधों को एक-एक करके ग्रेड करने जैसा है, जबकि शिक्षक भी उसी समय एक नया निबंध लिखने की कोशिश कर रहा है। कंप्यूटर वीडियो लोड होने के लिए रुकता है, फिर AI के सोचने का इंतज़ार करता है, फिर ग्रेड का इंतज़ार करता है। यह एक ट्रैफिक जाम की तरह है।

EasyVideoR1 का समाधान: उन्होंने एक "कन्वेयर बेल्ट ग्रेडिंग सिस्टम" बनाया।

  • उदाहरण: जबकि कंप्यूटर अगला वीडियो लोड कर रहा होता है (Loading Stage), वह साथ ही साथ वर्तमान वीडियो को ग्रेड कर रहा होता है (Decoding Stage) और अगले वीडियो को तैयार कर रहा होता है (Prefill Stage)।
  • कुछ भी किसी चीज़ का इंतज़ार नहीं करता। कंप्यूटर हमेशा काम करता रहता है। इसने उनकी मूल्यांकन प्रक्रिया को मानक तरीकों की तुलना में 6 से 7 गुना तेज़ बना दिया।

बड़ी जीत: उन्होंने क्या हासिल किया?

उन्होंने एक स्मार्ट AI मॉडल (Qwen3-VL-8B) लिया और उसे इस नए टूलकिट का उपयोग करके एक "बूट कैंप" दिया।

  • पहले: मॉडल अच्छा था, लेकिन जटिल वीडियो पहेलियों को सुलझाने में बहुत अच्छा नहीं था।
  • बाद में: केवल 20 घंटों की ट्रेनिंग (32 शक्तिशाली GPUs पर) के बाद, मॉडल कई वीडियो टेस्ट पर अपने "थिंकिंग" वर्जन (एक ऐसा वर्जन जिसे लंबे समय तक सोचने के लिए डिज़ाइन किया गया है) से भी ज़्यादा स्मार्ट हो गया।
  • निष्कर्ष: बेहतर परिणाम पाने के लिए आपको ज़रूरी नहीं कि एक बड़ा, धीमा मॉडल चाहिए। आपको बस उसे प्रशिक्षित करने का एक बेहतर तरीका चाहिए।

संक्षेप में

EasyVideoR1 एक कुकिंग स्कूल को अपग्रेड करने जैसा है। छात्रों को हर व्यंजन के लिए शून्य से सब्जियां काटने के बजाय, वे उन्हें पहले से तैयार सामग्रियां देते हैं, उन्हें सरल और जटिल दोनों रेसिपी एक साथ अभ्यास करने देते हैं, और उनके काम को तुरंत ग्रेड करने के लिए कन्वेयर बेल्ट का उपयोग करते हैं। परिणाम? छात्र (AI मॉडल्स) पहले से कहीं अधिक तेज़ी से और बेहतर तरीके से खाना बनाना (वीडियो समझना) सीख जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →