← नवीनतम पेपर
💻 computer science

StreamReady: Learning What to Answer and When in Long Streaming Videos

यह शोध पत्र StreamReady प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो नए ProReady-QA बेंचमार्क द्वारा मान्य और कई डेटासेट पर बेहतर प्रदर्शन के साथ, स्ट्रीमिंग वीडियो साक्ष्य पर मॉडल कब प्रतिक्रिया दें, इसे अनुकूलित करने के लिए 'आंसर रेडीनेस स्कोर' के माध्यम से टेम्पोरल रीजनिंग (temporal reasoning) को समय पर उत्तर देने के साथ एकीकृत करता है।

मूल लेखक: Shehreen Azad, Vibhav Vineet, Yogesh Singh Rawat

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shehreen Azad, Vibhav Vineet, Yogesh Singh Rawat

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइव स्पोर्ट्स ब्रॉडकास्ट देख रहे हैं, लेकिन एक मानव कमेंटेटर के बजाय, आपके पास एक सुपर-स्मार्ट AI है जो खेल का वर्णन होते ही उसे समझा रहा है।

समस्या: "बहुत जल्दी" बनाम "बहुत देर से" की दुविधा
वर्तमान के अधिकांश AI वीडियो मॉडल एक घबराए हुए प्रशंसक की तरह हैं जो जैसे ही उन्हें लगता है कि उन्होंने कुछ देखा है, तुरंत उत्तर चिल्ला देते हैं, भले ही उन्होंने अभी तक पूरा प्ले (खेल की घटना) न देखा हो।

  • बहुत जल्दी उत्तर देना: AI अनुमान लगाता है। वह कहता है, "गोल!" इससे पहले कि गेंद वास्तव़ी में रेखा को पार करे। यह एक मतिभ्रम (hallucination) है (एक अनुमान)।
  • बहुत देर से उत्तर देना: AI तब तक इंतजार करता है जब तक खेल खत्म नहीं हो जाता और खिलाड़ी मैदान से बाहर जाने लगते हैं, तभी वह कहता है, "गोल!" यह बेकार है क्योंकि वह क्षण बीत चुका है।
    मौजूदा बेंचमार्क केवल इस बात की परवाह करते हैं कि AI ने तथ्य को सही पकड़ा या नहीं (क्या उन्होंने "गोल!" कहा?)। वे इस बात को नजरअंदाज कर देते हैं कि उन्होंने इसे कब कहा। यह पेपर तर्क देता है कि एक लाइव स्ट्रीम में, उत्तर देने से कहीं अधिक महत्वपूर्ण उसका समय (timing) है।

समाधान: StreamReady
लेखक एक नया सिस्टम पेश करते हैं जिसे StreamReady कहा जाता है। इसे एक ऐसे AI के रूप में सोचें जिसके भीतर एक "धैर्य मीटर" (patience meter) और एक "प्रमाण-जांचकर्ता" (proof-checker) लगा हो।

  1. "वेट" बटन (तैयारी तंत्र/Readiness Mechanism): तुरंत उत्तर देने के बजाय, StreamReady के पास एक विशेष आंतरिक टोकन होता है (एक छोटा डिजिटल झंडा जिसे <RDY> कहा जाता है) जो एक ट्रैफिक लाइट की तरह काम करता है। यह लगातार वीडियो की निगरानी करता है।

    • लाल बत्ती: "मैं एक सवाल देख रहा हूँ, लेकिन मेरे पास अभी पर्याप्त सबूत नहीं है। मैं देखता रहूँगा।"
    • हरी बत्ती: "ठीक है, मैंने अभी-अभी वह विशिष्ट दृश्य साक्ष्य देखा है जिसकी उत्तर देने के लिए आवश्यकता है। मैं अब बोलूँगा।"
  2. "मेमोरी ट्री" (दृश्य स्मृति/Visual Memory): लंबे वीडियो बहुत विशाल होते हैं। यदि आप हर एक फ्रेम को याद रखने की कोशिश करेंगे, तो आपका मस्तिष्क (या कंप्यूटर) फट जाएगा। StreamReady एक चतुर "मेमोरी ट्री" का उपयोग करता है।

    • पत्तियाँ (हाल के फ्रेम्स): यह सबसे नवीनतम फ्रेम्स को उच्च विवरण के साथ रखता है।
    • शाखाएँ (सारांश): जैसे-जैसे समय बीतता है, यह समान फ्रेम्स को "सेंट्रॉइड्स" (centroids) में समूहित करता है (जैसे किसी 10 मिनट के दृश्य को एक मुख्य वाक्य में सारांशित करना)।
    • तना (बड़ी तस्वीर): यह पूरे वीडियो के लिए और भी व्यापक सारांश बनाता है।
    • उपमा: कल्पना कीजिए कि आप एक उपन्यास पढ़ रहे हैं। आप अंतिम पृष्ठ को विस्तार से याद रखते हैं, पिछले अध्याय को एक सारांश के रूप में, और पूरी किताब को एक सामान्य विषय के रूप में। यह AI को शोर के बीच से विशिष्ट "सबूत" खोजने में मदद करता है बिना भटके।
  3. "स्कोरकार्ड" (उत्तर तत्परता स्कोर - ARS): लेखकों ने इन AI मॉडलों को ग्रेड करने का एक नया तरीका बनाया है।

    • यदि आप साक्ष्य दिखने से पहले उत्तर देते हैं, तो आपको कठोर दंड मिलता है (क्योंकि आप अनुमान लगा रहे थे)।
    • यदि आप साक्ष्य गायब होने के बाद उत्तर देते हैं, तो आपको हल्का दंड मिलता है (क्योंकि आप धीमे थे)।
    • यदि आप ठीक उसी समय उत्तर देते हैं जब साक्ष्य दृश्यमान होता है, तो आपको पूर्ण अंक मिलते हैं।
    • उपमा: यह एक कुकिंग प्रतियोगिता में जज की तरह है। यदि आप सूप चखते हैं और कहते हैं "इसमें नमक की जरूरत है" इससे पहले कि नमक डाला ही गया हो, तो आप फेल हो जाते हैं। यदि आप इसे तब कहते हैं जब शेफ पहले ही व्यंजन परोस चुका है, तो आप बहुत देर कर चुके हैं। आपको अंक तभी मिलते हैं जब आप उसे चखते हैं जबकि शेफ उसमें मसाला डाल रहा होता है।

नया परीक्षण: ProReady-QA
अपने सिस्टम को सिद्ध करने के लिए, उन्होंने ProReady-QA नामक एक नया परीक्षण बनाया है।

  • सेटअप: उन्होंने लंबे वीडियो (जैसे फिल्में या दैनिक जीवन के फर्स्ट-पर्सन वीडियो) लिए और ऐसे प्रश्न बनाए जहाँ उत्तर अभी मौजूद नहीं है जब प्रश्न पूछा जाता है।
  • चुनौती: AI को वीडियो के सामने आने का इंतजार करना होगा, उस विशिष्ट क्षण को देखना होगा जब उत्तर दृश्यमान होता है, और फिर बोलना होगा।
  • परिणाम: StreamReady ने न केवल सही उत्तर दिए; बल्कि उन्होंने सही समय पर भी दिए। इसने अन्य मॉडलों को पीछे छोड़ दिया जो या तो बहुत जल्दी अनुमान लगाते थे या बहुत देर से बोलते थे।

यह क्यों महत्वपूर्ण है
पेपर का दावा है कि यह वास्तविक दुनिया के अनुप्रयोगों के लिए एक बड़ा कदम है जैसे:

  • निगरानी (Surveillance): गिरना या दुर्घटना होने के क्षण भर बाद ही उसे नोटिस करना, न कि 10 मिनट बाद।
  • रोबोटिक्स: किसी इंसान की मदद करने वाले रोबोट को इंसान के पूछने से पहले औजार नहीं पकड़ना चाहिए, न ही इंसान के औजार गिराने के बाद इंतजार करना चाहिए।
  • सहायक प्रणालियाँ (Assistive Systems): बाधाओं के प्रकट होते ही उनका वर्णन करके किसी को रास्ता दिखाने में मदद करना।

संक्षेप में
StreamReady AI को अनुमान लगाना बंद करने और इंतजार करना सिखाता है। यह सुनिश्चित करने के लिए कि जब AI बोले, तो वह सही भी हो और समय पर भी हो, यह एक स्मार्ट मेमोरी सिस्टम के साथ "धैर्य सेंसर" को जोड़ता है। यह एक प्रशंसक द्वारा गेंद के हवा में होने के दौरान "गोल!" चिल्लाने और एक पेशेवर कमेंटेटर द्वारा ठीक उसी क्षण "गोल!" कहने के बीच का अंतर है जब गेंद रेखा को पार करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →