← नवीनतम पेपर
💻 computer science

RIVER: A Real-Time Interaction Benchmark for Video LLMs

यह शोधपत्र RIVER प्रस्तुत करता है, जो एक नवीन बेंचमार्क और फ्रेमवर्क है जिसे रिट्रोस्पेक्टिव मेमोरी (Retrospective Memory), लाइव-परसेप्शन (Live-Perception) और प्रोएक्टिव एंटिसिपेशन (Proactive Anticipation) की तीन-कार्य प्रणाली के माध्यम से ऑनलाइन प्रोसेसिंग, दीर्घकालिक स्मृति और सक्रिय पूर्वानुमान में उनकी वर्तमान सीमाओं को संबोधित करते हुए वीडियो लार्ज लैंग्वेज मॉडल्स की वास्तविक समय की संवादात्मक क्षमताओं का मूल्यांकन करने और उन्हें सुधारने के लिए डिज़ाइन किया गया है।

मूल लेखक: Yansong Shi, Qingsong Zhao, Tianxiang Jiang, Xiangyu Zeng, Yi Wang, Limin Wang

प्रकाशित 2026-03-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yansong Shi, Qingsong Zhao, Tianxiang Jiang, Xiangyu Zeng, Yi Wang, Limin Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक दोस्त के साथ फिल्म देख रहे हैं जिसने इसे पहले कभी नहीं देखा है। आप फिल्म चलते दौरान उसके बारे में बात करना चाहते हैं, न कि खत्म होने के बाद।

  • दोस्त A (पुराना तरीका): यह दोस्त फिल्म खत्म होने का इंतज़ार करता है, फिर कहता है, "ठीक है, वह क्या चीज़ थी जो उस आदमी ने 20 मिनट पहले की थी?" उन्हें याद करने के लिए अपने दिमाग में पूरी फिल्म को रिवाइंड करना पड़ता है। वे पूरी कहानी का सारांश बताने में माहिर हैं, लेकिन वास्तविक समय (real-time) में बातचीत करने में बहुत खराब हैं।
  • दोस्त B (नया तरीका): यह दोस्त फिल्म को होते हुए देखता है। वे कह सकते हैं, "देखो, शेर अभी बैठा है!" या "रुको, क्या तुमने देखा कि मैंने अपनी चाबियाँ 5 मिनट पहले कहाँ रखी थीं?" या "मुझे लगता है कि हीरो अब कूदने वाला है!" वे एक साथ अभी पर प्रतिक्रिया दे रहे हैं, अतीत को याद कर रहे हैं, और भविष्य का अनुमान लगा रहे हैं।

यह पेपर RIVER पेश करता है, एक नया "टेस्ट" (बेंचमार्क) यह देखने के लिए कि AI मॉडल दोस्त B बनने में कितने अच्छे हैं।

समस्या: "ऑफलाइन" AI

वर्तमान में, अधिकांश शक्तिशाली AI वीडियो मॉडल दोस्त A की तरह हैं। वे "ऑफलाइन" हैं। उन्हें एक भी सवाल का जवाब देने से पहले पूरा वीडियो फ़ाइल देखना पड़ता है। यदि आप उनसे लाइव कैमरा फीड की तरह स्ट्रीमिंग वीडियो के दौरान बात करने की कोशिश करते हैं, तो वे भ्रमित हो जाते हैं, वे भूल जाते हैं कि 30 सेकंड पहले क्या हुआ था, या बस जम जाते हैं। वे एक समाप्त फिल्म का विश्लेषण करने में माहिर हैं, लेकिन वर्तमान क्षण में जीने में खराब हैं।

समाधान: RIVER टेस्ट

लेखकों ने RIVER (Real-tIme intERaction Bench-mark for Video LLMs) बनाया है। RIVER को एक वीडियो गेम लेवल की तरह समझें जिसे विशेष रूप से यह परीक्षण करने के लिए डिज़ाइन किया गया है कि क्या कोई AI लाइव बातचीत को संभाल सकता है।

इस टेस्ट में तीन मुख्य "लेवल" या चुनौतियाँ हैं:

  1. "रिट्रोस्पेक्टिव मेमोरी" लेवल (पीछे देखना):

    • चुनौती: AI एक वीडियो देख रहा है। अचानक, आप पूछते हैं, "उस आदमी ने 5 मिनट पहले किस रंग की शर्ट पहनी थी?"
    • लक्ष्य: AI के पास अच्छी याददाश्त होनी चाहिए। उसे केवल अनुमान नहीं लगाना चाहिए; उसे पूरे वीडियो को एक साथ देखे बिना अतीत के विशिष्ट विवरणों को याद करना चाहिए।
    • उपमा: यह पहली बार सुनी जा रही कहानी के बारे में "20 सवाल" खेलने जैसा है, लेकिन आपको कहानी के अंत को सुनते समय शुरुआत के विवरणों को याद रखना होगा।
  2. "लाइव-परसेप्शन" लेवल (अभी में जीना):

    • चुनौती: आप पूछते हैं, "इस वक्त ठीक अभी क्या हो रहा है?"
    • लक्ष्य: AI को वीडियो के हर फ्रेम को उसके आने के साथ प्रोसेस करना चाहिए और तुरंत जवाब देना चाहिए। कोई इंतज़ार नहीं, कोई रिवाइंड नहीं।
    • उपमा: यह एक स्पोर्ट्स कमेंटेटर की तरह है। उन्हें गेंद लाइन को पार करने के 10 सेकंड बाद नहीं, बल्कि जैसे ही गेंद लाइन को पार करती है, गोल का वर्णन करना होता है।
  3. "प्रोएक्टिव रिस्पॉन्स" लेवल (भविष्य की भविष्यवाणी करना):

    • चुनौती: आप AI को कहते हैं, "मुझे वह क्षण बताओ जब कुत्ता भौंकना शुरू करता है।"
    • लक्षio: AI को चुपचाप देखते रहना होगा जब तक कि वह विशिष्ट घटना न हो जाए, फिर तुरंत बोलना होगा। यह केवल जवाब देना नहीं है; यह सही क्षण के लिए इंतज़ार करना है।
    • उपमा: कल्पना करें कि आप एक सुरक्षा गार्ड हैं जो कैमरा देख रहे हैं। आपको बताया गया है, "जैसे ही कोई पिछला दरवाज़ा खोले, 'घुसपैठिया!' चिल्लाएं।" आपको धैर्यपूर्वक प्रतीक्षा करनी होगी और फिर तुरंत प्रतिक्रिया देनी होगी।

परिणाम: टेस्ट में कौन पास हुआ?

शोधकर्ताओं ने इस नए RIVER गेम पर कई अलग-अलग AI मॉडल का परीक्षण किया।

  • "बड़े दिमाग" (ऑफलाइन मॉडल): GPT-4o जैसे मॉडल बहुत स्मार्ट हैं। यदि आप उन्हें पूरी वीडियो फ़ाइल देते हैं, तो वे टेस्ट में सफल होते हैं। लेकिन यदि आप उन्हें वीडियो स्ट्रीम करते समय उनसे बात करने की कोशिश करते हैं, तो वे संघर्ष करते हैं। वे चीज़ें जल्दी भूल जाते हैं और इतनी तेज़ी से प्रतिक्रिया नहीं दे पाते।
  • "विशेषज्ञ" मॉडल: कुछ मॉडल विशेष रूप से स्ट्रीमिंग के लिए बनाए गए हैं। वे "लाइव" और "प्रोएक्टिव" भागों में बेहतर हैं, लेकिन अक्सर उनकी याददाश्त छोटी होती है। वे शायद एक घंटे पहले क्या हुआ था, यह भूल जाएं।
  • "नया प्रशिक्षण" (समाधान): लेखकों ने केवल परीक्षण नहीं किया; उन्होंने इस तरह की वास्तविक समय की बातचीत के लिए एक विशेष ट्रेनिंग डेटासेट (एक अभ्यास पुस्तिका) भी बनाया। जब उन्होंने इस नई किताब का उपयोग करके एक AI को सिखाया, तो AI इसमें बेहतर हो गया:
    • अतीत को याद रखना (लॉन्ग-टर्म मेमोरी)।
    • वर्तमान पर प्रतिक्रिया देना (लाइव परसेप्शन)।
    • बोलने के लिए सही क्षण का इंतज़ार करना (प्रोएक्टिव रिस्पॉन्स)।

यह क्यों मायने रखता है?

अभी, हम एक ऐसी दुनिया की ओर बढ़ रहे हैं जहाँ AI वास्तविक समय में हमारी मदद करता है:

  • रोबोट: एक रोबोट जिसे मानव हाथों के इशारों को उनके हिलते समय समझने की आवश्यकता होती है, न कि उनके रुकने के बाद।
  • ऑगमेंटेड रियलिटी (AR): चश्मा जो आपको बताता है, "वह एक दुर्लभ पक्षी है!" जैसे ही आप उसकी ओर देखते हैं।
  • सुरक्षा: एक सिस्टम जो फैक्ट्री फ्लोर की निगरानी करता है और तुरंत चिल्लाता है, "रुकिए! वह मशीन टूटने वाली है!"

RIVER पहला ऐसा पैमाना है जो सटीक रूप से माप सकता है कि क्या कोई AI वास्तविक दुनिया, वास्तविक समय के जीवन के लिए तैयार है। यह हमें दिखाता है कि जबकि AI स्मार्ट हो रहा है, इसे अभी भी "अतीत की समीक्षा" करने के बजाय "वर्तमान क्षण में जीना" सीखने की आवश्यकता है।

संक्षेप में

पेपर कहता है: "हमने RIVER नामक एक नया टेस्ट बनाया है यह देखने के लिए कि क्या AI वीडियो देखते समय हमारे साथ चैट कर सकता है, न कि केवल उसके बाद। हमने पाया कि अधिकांश AI इसमें खराब हैं, लेकिन हमने यह भी पाया कि हम उन्हें अतीत को याद करने, वर्तमान को देखने और भविष्य की भविष्यवाणी करने में बहुत बेहतर बनाने के लिए प्रशिक्षित कर सकते हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →