← नवीनतम पेपर
💻 computer science

Proact-VL: A Proactive VideoLLM for Real-Time AI Companions

यह शोध पत्र Proact-VL प्रस्तुत करता है, जो एक सामान्य रूपरेखा (framework) है जिसे मल्टीमॉडल लैंग्वेज मॉडल्स को सक्रिय, रियल-टाइम एआई साथियों में बदलने के लिए डिज़ाइन किया गया है जो लेटेंसी और निर्णय लेने की चुनौतियों पर विजय प्राप्त करते हैं, जिसे कमेंट्री और मार्गदर्शन परिदृश्यों के माध्यम से नए 'लाइव गेमिंग बेंचमार्क' द्वारा मान्य किया गया है।

मूल लेखक: Weicai Yan, Yuhong Dai, Qi Ran, Haodong Li, Wang Lin, Hao Liao, Xing Xie, Tao Jin, Jianxun Lian

प्रकाशित 2026-03-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weicai Yan, Yuhong Dai, Qi Ran, Haodong Li, Wang Lin, Hao Liao, Xing Xie, Tao Jin, Jianxun Lian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइव वीडियो गेम स्ट्रीम देख रहे हैं। आमतौर पर, आपके पास दो विकल्प होते हैं: या तो एक मानव कमेंटेटर गेम के ऊपर बोलता है, या आप बिना किसी से बात किए अकेले खेलते हैं।

Proact-VL एक नए प्रकार का AI साथी है जिसे इस परिदृश्य में एकदम सही "थर्ड व्हील" (तीसरा साथी) बनने के लिए डिज़ाइन किया गया है। यह केवल एक ऐसा रोबोट नहीं है जो आपके पूछने पर जवाब देता है; यह एक सक्रिय मित्र है जो जानता है कि कब बोलना है, क्या कहना है, और कितनी देर तक बोलना है, और वह भी रियल-टाइम में।

यहाँ बताया गया है कि यह कैसे काम करता है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "ओवर-टॉकर" बनाम "साइलेंट घोस्ट"

वर्तमान AI वीडियो असिस्टेंट दो चरम सीमाओं की तरह हैं:

  • द ओवर-टॉकर (ज़्यादा बोलने वाला): कुछ AI मॉडल पार्टी में आए एक घबराए हुए मेहमान की तरह हैं जो कभी बोलना बंद नहीं करते। वे हर एक फ्रेम का वर्णन करते हैं, भले ही कुछ दिलचस्प न हो रहा हो। यह दर्शकों को परेशान करता है।
  • द साइलेंट घोस्ट (शांत भूत): अन्य मॉडल एक शर्मीले मेहमान की तरह हैं जो केवल तभी बोलते हैं जब आप उनसे स्पष्ट रूप से कोई प्रश्न पूछते हैं। यदि आप नहीं पूछते, तो वे कुछ नहीं कहते, भले ही स्क्रीन पर कोई बड़ा विस्फोट हुआ हो।

Proact-VL इसे एक कुशल स्पोर्ट्स कमेंटेटर की तरह हल करता है। वे जानते हैं कि ठीक कब "गोल!" चिल्लाना है और कब शांत रहना है ताकि आप भीड़ की आवाज़ सुन सकें। वे केवल प्रतिक्रिया नहीं देते; वे पूर्वानुमान लगाते हैं।

2. Proact-VL की तीन महाशक्तियाँ

A. "चंक" रणनीति (1-सेकंड के स्नैपशॉट्स)

अधिकांश AI पूरी फिल्म को एक साथ देखने की कोशिश करते हैं, जो लाइव गेम्स के लिए बहुत धीमा है। Proact-VL वीडियो को एक फ्लिपबुक की तरह मानता है।

  • यह केवल एक सेकंड (एक "चंक") के लिए स्क्रीन को देखता है।
  • यह तुरंत निर्णय लेता है: "क्या यह सेकंड रोमांचक है? क्या मुझे बोलना चाहिए?"
  • यदि हाँ, तो यह एक छोटा, प्रभावशाली वाक्य निकालता है। यदि नहीं, तो यह चुप रहता है और अगले सेकंड का इंतवेट करता है।
  • उपमा: कल्पना कीजिए कि एक फोटोग्राफर हर सेकंड एक फोटो खींच रहा है। पूरा एल्बम विकसित होने का इंतज़ार करने के बजाय, वे आपको तुरंत फोटो दिखाते हैं और तय करते हैं कि क्या प्रिंट करना लायक है।

B. "ट्रैफिक लाइट" (बोलने का निर्णय लेना)

यह सबसे अनूठा हिस्सा है। AI के दिमाग के अंदर एक निर्मित ट्रैफिक लाइट है।

  • लाल बत्ती: कुछ भी दिलचस्प नहीं हो रहा है। AI चुप रहता है।
  • हरी बत्ती: एक बॉस हार गया है, खिलाड़ी खतरे में है, या उपयोगकर्ता कोई प्रश्न पूछता है। AI हरा हो जाता है और बोलना शुरू कर देता है।
  • जादू: यह इस समय को सीखने के लिए हजारों घंटों के मानव स्ट्रीमर्स को देखता है। वे सीखते हैं कि इंसान लगातार नहीं बोलते; वे सही क्षणों पर बोलते हैं।

C. "दो-मोड" व्यक्तित्व

पेपर में Proact-VL का परीक्षण दो विशिष्ट भूमिकाओं में किया गया है, जैसे एक अभिनेता वेशभूषा बदलता है:

  1. द हाइप मैन (कमेंटेटर): League of Legends या Cyberpunk 2077 जैसे खेलों में, यह एक सह-कमेंटेटर के रूप में कार्य करता है। यह अन्य AI कमेंटेटरों के साथ चैट कर सकता है, बारी-बारी से बोल सकते हैं ताकि वे एक-दूसरे के ऊपर न बोलें। यह जानता है कि कब इंसान को बोलने देना है और कब मजाक या रणनीति संबंधी टिप के साथ बीच में आना है।
  2. द कोच (गाइड): Minecraft या Elden Ring जैसे खेलों में, यह एक सहायक ट्यूटर के रूप में कार्य करता है। यदि आप एक गुफा में फंसे हैं, तो यह केवल यह नहीं कहता कि "आप एक गुफा में हैं।" यह कहता है, "हे, उस लावा को देखो! वहां पानी डालो ताकि ऑब्सीडियन बन सके ताकि तुम जल न जाओ।" यह आपको गलती करने से पहले सलाह देता है।

3. "लाइव गेमिंग" डेटासेट (प्रशिक्षण शिविर)

इस AI को सिखाने के लिए, शोधकर्ताओं ने केवल पाठ्यपुस्तकों का उपयोग नहीं किया। उन्होंने एक विशाल प्रशिक्षण शिविर बनाया जिसे "लाइव गेमिंग डेटासेट" कहा जाता है।

  • उन्होंने 12 अलग-अलग लोकप्रिय खेलों (Minecraft से लेकर Street Fighter तक) से वास्तविक गेमप्ले के 561 घंटे एकत्र किए।
  • उन्होंने बैकग्राउंड म्यूजिक और शोर को हटाने के लिए उन्नत उपकरणों का उपयोग किया, ताकि AI सीख सके कि मानव कमेंटेटरों ने वास्तव में क्या कहा और उन्होंने कब कहा।
  • उपमा: एक छात्र को तैरने के बारे में किताब पढ़ाकर सिखाने के बजाय, उन्होंने उसे ओलंपिक चैंपियनों के साथ पूल में फेंक दिया और कहा, "देखो वे कैसे चलते हैं, फिर उनकी नकल करने की कोशिश करो।"

4. यह क्यों महत्वपूर्ण है (परिणाम)

परीक्षणों ने दिखाया कि Proact-VL गति और गुणवत्ता को संतुलित करने में सर्वश्रेष्ठ है।

  • गति: यह लगभग तुरंत प्रतिक्रिया देता है (लो लेटेंसी), जिससे यह एक वास्तविक बातचीत जैसा महसूस होता है, न कि एक देरी वाले वीडियो कॉल जैसा।
  • गुणवत्ता: यह बड़बड़ाता नहीं है। यह केवल आवश्यकता होने पर बोलता है, जिससे अनुभव स्वाभाविक और मानव जैसा लगता है।

सारांश

Proact-VL को गेमर्स के लिए परम AI को-पायलट के रूप में सोचें।

  • पुराना AI एक GPS की तरह था जो केवल तब बोलता है जब आप उसे बताते हैं ("री-कैलकुलेटिंग...")।
  • Proact-VL एक यात्री की तरह है जो सड़क जानता है, सुंदर दृश्यों की ओर इशारा करता है, आपको गड्ढों के बारे में चेतावनी देता है, और ठीक जानता है कि कब चुप रहना है ताकि आप ड्राइविंग पर ध्यान केंद्रित कर सकें।

यह एक ऐसे AI मित्र होने के करीब एक कदम है जो न केवल यह समझता है कि आप क्या देखते हैं, बल्कि यह भी समझता है कि आप जो देखते हैं उसके बारे में आप कैसा महसूस करते हैं, और जानता है कि बातचीत में कब शामिल होना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →