← नवीनतम पेपर
💻 computer science

STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning

STVG-R1 एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचे को पेश करता है जो अनूठे विजुअल प्रॉम्प्ट्स का उपयोग करके वीडियो ग्राउंडिंग को एक इंस्टेंस-स्तरीय पहचान समस्या के रूप में पुनर्गठित करता है, जिससे कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है और सहायक डिकोडर्स की आवश्यकता समाप्त होती है तथा एनोटेशन लागत कम होती है।

मूल लेखक: Xiaowen Zhang, Zhi Gao, Licheng Jiao, Lingling Li, Qing Li

प्रकाशित 2026-02-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaowen Zhang, Zhi Gao, Licheng Jiao, Lingling Li, Qing Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ STVG-R1 पेपर का सरल भाषा, रोज़मर्रा के उदाहरणों और रचनात्मक रूपकों (metaphors) का उपयोग करके किया गया स्पष्टीकरण है।

बड़ी समस्या: "भ्रमित" होने वाला मूवी क्रिटिक (Movie Critic)

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े भ्रमित मूवी क्रिटिक (एक AI) से वीडियो में एक विशिष्ट दृश्य खोजने के लिए कहते हैं। आप कहते हैं, "मुझे वह पल दिखाओ जब कुत्ता फ्रिसबी (frisbee) का पीछा कर रहा है।"

पुराने AI मॉडल अक्सर इसे दो मज़ेदार लेकिन निराशाजनक तरीकों से गलत करते हैं:

  1. समय यात्री (The Time Traveler): वे कह सकते हैं कि यह घटना 2 मिनट के वीडियो में "100 घंटे" पर हो रही है।
  2. मैप मेकर (The Map Maker): वे कुत्ते के चारों ओर एक बॉक्स बनाने की कोशिश कर सकते हैं, लेकिन उसे स्क्रीन के बाहर या किसी अजीब, असंभव आकार में बना देते हैं क्योंकि वे बिना वस्तु को वास्तव में "देखे" सटीक निर्देशांक (जैसे "x=200, y=50") का अनुमान लगाने की कोशिश कर रहे होते हैं।

इसे हैलुसिनेशन (Hallucination) कहा जाता है। AI कहानी समझने के बजाय केवल नंबरों का अनुमान लगा रहा है।

समाधान: वीडियो को "नेम टैग" देना

इस पेपर के लेखकों ने, STVG-R1, AI से गणित करने (निर्देशांकों का अनुमान लगाने) के बजाय कुछ बहुत सरल करने के लिए कहना शुरू किया: "नंबर ढूँढने का खेल खेलना।"

उन्होंने इसे कैसे किया, यहाँ चरण-दर-चरण बताया गया है:

1. "नेम टैग" वाली ट्रिक (विजुअल प्रॉम्प्टिंग)

AI को कच्चा (raw) वीडियो दिखाने के बजाय, वे पहले वीडियो पर एक विशेष टूल चलाते हैं। यह टूल हर वस्तु (लोग, कुत्ते, कारें) को ढूंढता है और उनके ठीक बीच में एक छोटा सा लाल नंबर चिपका देता है।

  • कुत्ते को एक टैग मिला: #1
  • फ्रिसबी को एक टैग मिला: #2
  • पेड़ को एक टैग मिला: #3

अब, वीडियो एक गेम शो की तरह दिखता है जहाँ हर चीज़ पर एक लेबल लगा हुआ है।

2. नया सवाल

जब आप AI से पूछते हैं, "कुत्ता फ्रिसबी का पीछा कब करता है?", तो AI को अब निर्देशांकों का अनुमान लगाने की ज़रूरत नहीं होती। उसे बस वीडियो को देखना है और कहना है:

"आह! मैं देख पा रहा हूँ कि कुत्ता #1, फ्रिसबी #2 के पीछे भाग रहा है, सेकंड 5 से 10 के बीच।"

यह AI के लिए बहुत आसान है। यह एक बच्चे से पूछने जैसा है, "कौन सा बच्चा दौड़ रहा है?" बजाय इसके कि, "दौड़ रहे बच्चे के GPS निर्देशांक क्या हैं?"

3. "कोच" (रीइन्फोर्समेंट लर्निंग)

लेखकों ने केवल नेम टैग्स तक ही सीमित नहीं रहे। उन्होंने AI को रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) नामक पद्धति का उपयोग करके प्रशिक्षित किया। इसे एक सख्त लेकिन मददगार कोच के रूप में सोचें।

  • खेल: AI वीडियो देखता है और एक अनुमान लगाता है।
  • स्कोरकार्ड: कोच तीन चीजें चेक करता है:
    1. समय (Time): क्या आपने सही सेकंड चुने? (टेम्पोरल एक्यूरेसी)
    2. पहचान (Identity): क्या आपने सही नंबर चुना? (स्पेशियल कंसिस्टेंसी)
    3. फॉर्मेट (Format): क्या आपने अपना उत्तर सही तरीके से लिखा? (स्ट्रक्चर)
  • इनाम (Reward): यदि AI सही होता है, तो उसे एक "ट्रीट" (इनाम पॉइंट) मिलता है। यदि वह गलत होता है, तो उसे "फिर से कोशिश करें" का संकेत मिलता है।

समय के साथ, AI एक बेहतरीन जासूस बनना सीख जाता है। वह अनुमान लगाना बंद कर देता है और तर्क करने लगता है: "मैं #1 को चलते हुए देख रहा हूँ, इसलिए वही कुत्ता होगा। घटना तब शुरू होती है जब #1 चलना शुरू करता है।"

यह एक बड़ी बात क्यों है

पेपर दिखाता है कि यह सरल विचार अविश्वसनीय रूप से काम करता है:

  1. यह एक नया विश्व रिकॉर्ड है: मानक परीक्षणों पर, इस नए AI (STVG-R1) ने पिछले सर्वश्रेष्ठ मॉडलों को बहुत बड़े अंतर से पीछे छोड़ दिया (कुछ मामलों में 20% से भी बेहतर)।
  2. यह एक "ज़ीरो-शॉट" सुपरहीरो है: यह सबसे शानदार हिस्सा है। इसे एक वस्तु वाले वीडियो पर प्रशिक्षित किया गया था। लेकिन जब उन्होंने इसका परीक्षण कई वस्तुओं वाले वीडियो (जैसे एक शोर-शराबे वाली पार्टी का दृश्य) पर किया, तो यह फिर भी पूरी तरह से काम करता रहा! इसे दोबारा प्रशिक्षित करने की आवश्यकता नहीं पड़ी। यह बस नंबरों को ढूँढना जानता था।
  3. कोई गणित नहीं: निर्देशांकों (coordinates) की एक कठिन गणितीय समस्या को एक सरल पढ़ने की समस्या (नंबरों की पहचान) में बदलकर, उन्होंने AI को महंगे नए हार्डवेयर की आवश्यकता के बिना अधिक स्मार्ट और तेज़ बना दिया।

निष्कर्ष (The Takeaway)

कल्पना कीजिए कि आप एक भीड़ भरे स्टेडियम में एक विशिष्ट व्यक्ति को खोजने की कोशिश कर रहे हैं।

  • पुराना तरीका: आप उनके स्थान का वर्णन एक जटिल ग्रिड सिस्टम (रो 45, सीट 12, गलियारे से 3 इंच बाईं ओर) का उपयोग करके करने की कोशिश करते हैं। इसे सही करना कठिन है।
  • STVG-R1 का तरीका: आप हर किसी के सिर पर एक नंबर वाला बड़ा, चमकीला नियॉन टोपी पहना देते हैं। आप बस AI को बताते हैं, "उस व्यक्ति को ढूँढो जिसकी टोपी पर #42 लिखा है।"

वीडियो को एक सरल, सुसंगत भाषा (नंबरों) देकर और एक स्मार्ट कोच (रीइन्फोर्समेंट लर्निंग) का उपयोग करके, लेखकों ने AI के "हैलुसिनेशन" की समस्या को हल किया और वीडियो को समझना बहुत अधिक विश्वसनीय बना दिया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →