← नवीनतम पेपर
🤖 AI

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

OmniVideo-R1 एक नवीन सुदृढ़ ढांचा (reinforced framework) है जो क्वेरी-गहन ग्राउंडिंग (query-intensive grounding) और मोडैलिटी-अटेंटिव फ्यूजन (modality-attentive fusion) को नियोजित करके ओम्नीवीडियो मॉडलों में ऑडियो-विजुअल रीजनिंग को बढ़ाता है, जिससे कई बेंचमार्क पर बेहतर प्रदर्शन और मजबूत सामान्यीकरण (robust generalization) प्राप्त होता है।

मूल लेखक: Zhangquan Chen, Jiale Tao, Ruihuang Li, Yihao Hu, Ruitao Chen, Zhantao Yang, Xinlei Yu, Haodong Jing, Manyuan Zhang, Shuai Shao, Biao Wang, Qinglin Lu, Ruqi Huang

प्रकाशित 2026-02-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhangquan Chen, Jiale Tao, Ruihuang Li, Yihao Hu, Ruitao Chen, Zhantao Yang, Xinlei Yu, Haodong Jing, Manyuan Zhang, Shuai Shao, Biao Wang, Qinglin Lu, Ruqi Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कमरे में किसी रहस्य को सुलझाने की कोशिश कर रहे हैं। एक साधारण AI सुरागों (वीडियो) को देख सकता है और उत्तर का अनुमान लगा सकता है। लेकिन कभी-कभी, सबसे महत्वपूर्ण सुराग एक आवाज़ होती है—फर्श के चरमराने की आवाज़, एक फुसफुसाहट, या बैकग्राउंड में बज रहा कोई विशिष्ट गाना।

वर्तमान "ओमनीमोडल" (Omnimodal) AI (वे मॉडल जो देख और सुन सकते हैं) ऐसे जासूसों की तरह हैं जिन्हें फोटो देखना सिखाया गया है, लेकिन जब आप उन्हें आवाज़ के साथ एक वीडियो देते हैं, तो वे भ्रमित हो जाते हैं। वे अक्सर ऑडियो को अनदेखा कर देते हैं या, और भी बुरा, आवाज़ उन्हें वह भुला देती है जो उन्होंने देखा था। वे गलत अनुमान लगाते हैं क्योंकि वे अपनी आँखों और कानों का प्रभावी ढंग से एक साथ उपयोग नहीं कर पाते हैं।

OmniVideo-R1 एक नई ट्रेनिंग विधि है जिसे इसे ठीक करने के लिए डिज़ाइन किया गया है। यह AI को एक सच्चा "जासूस" बनने के लिए प्रशिक्षित करती है जो समस्याओं को हल करने के लिए अपनी आँखों और कानों दोनों का उपयोग करता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "भटका हुआ जासूस" (The Distracted Detective)

कल्पना कीजिए कि एक जासूस जो अपराध स्थल की तस्वीरों को देखने का इतना आदी है कि जब आप उसे अपराध की रिकॉर्डिंग दिखाते हैं, तो वह विचलित हो जाता है। वह कह सकता है, "मुझे एक लाल कार दिख रही है," लेकिन वह इस तथ्य को मिस कर देता है कि कार के इंजन से एक विशिष्ट खटखटाने की आवाज़ आ रही थी जो सटीक मॉडल की पहचान कराती है।

पेपर दिखाता है कि यहाँ तक कि स्मार्टेस्ट वर्तमान AI (जैसे Qwen3-Omni) भी वीडियो का उपयोग करने की तुलना में ऑडियो और वीडियो का एक साथ उपयोग करते समय खराब प्रदर्शन करते हैं। उनमें एक "बायस" (bias) होता है जहाँ वे आवाज़ को अनदेखा कर देते हैं।

2. समाधान: दो-चरणीय प्रशिक्षण (Two-Step Training)

लेखकों ने AI को सही ढंग से सोचना सिखाने के लिए एक दो-चरणीय ट्रेनिंग कैंप बनाया है।

चरण 1: "हाइलाइटर" गेम (क्वेरी-इंटेंसिव ग्राउंडिंग)

उपमा: कल्पना कीजिए कि आप एक लंबी, उबाऊ किताब पढ़ रहे हैं और कोई आपसे एक विशिष्ट प्रश्न पूछता है। उत्तर देने से पहले, आपको उस किताब के उन सटीक वाक्यों को हाइलाइट करना होगा जो आपके उत्तर को सिद्ध करते हैं।

AI कैसे सीखता है:
AI को केवल उत्तर देने के बजाय, शोधकर्ताओं ने उसे यह कहने के लिए सिखाया: "रुको, मुझे उस हिस्से को खोजने दो जहाँ उत्तर छिपा है।"

  • AI वीडियो के विशिष्ट क्षणों की ओर इशारा करना सीखता है (जैसे, "0:10 और 0:15 के बीच, व्यक्ति कप गिराता है")।
  • इसके बाद वह उस क्षण के लिए एक छोटा कैप्शन लिखता है।
  • ट्रिक: उन्हें यह हाइलाइट करने के लिए इंसानों की ज़रूरत नहीं थी। उन्होंने एक "सेल्फ-चेक" सिस्टम का उपयोग किया। यदि AI वीडियो के एक हिस्से को हाइलाइट करता है और उसके द्वारा लिखा गया विवरण उस क्लिप में वास्तव में हुई घटना से मेल खाता है, तो उसे इनाम मिलता है। यदि वह गलत हिस्सा हाइलाइट करता है, तो वह फिर से प्रयास करना सीखता है। यह AI को अनुमान लगाने से पहले सबूत खोजने के लिए सिखाता है।

चरण 2: "आँखों पर पट्टी वाला टेस्ट" (मोडालिटी-अटेंटिव फ्यूजन)

उपमा: कल्पना कीजिए कि एक शेफ सूप चख रहा है। यदि वह केवल आँखें बंद करके चखता है (केवल गंध से), तो यह ठीक है। यदि वह केवल नाक ढककर चखता है (केवल स्वाद से), तो यह भी ठीक है। लेकिन सबसे अच्छा सूप वह है जिसे दोनों इंद्रियों का उपयोग करके चखा जाता है।

AI कैसे सीखता है:
शोधकर्ताओं ने AI के साथ एक खेल खेला:

  1. परिदृश्य A: AI को आवाज़ के साथ वीडियो दिखाएं।
  2. परिदृश्य B: AI को बिना आवाज़ के वीडियो दिखाएं (मौन)।
  3. परिदृश्य C: AI को केवल आवाज़ दिखाएं (कोई वीडियो नहीं)।

AI को विशेष बोनस पॉइंट केवल तभी मिलता है जब वह परिदृश्य A (वीडियो + साउंड) में परिदृश्य B या C की तुलना में रहस्य को बेहतर तरीके से सुलझाता है। यह AI को यह महसूस करने के लिए मजबूर करता है: "हे, मैं इसे सिर्फ देखकर हल नहीं कर सकता! मुझे पूरी तस्वीर पाने के लिए आवाज़ सुनने की ज़रूरत है।" यह दोनों इंद्रियों को एक टीम के रूप में काम करने के लिए मजबूर करता है न कि एक-दूसरे से लड़ने के लिए।

3. परिणाम: एक सुपर-डिटेक्टिव

इस प्रशिक्षण के बाद, AI (OmniVideo-R1) इसमें बहुत बेहतर हो गया:

  • सही सुराग ढूंढना: वह जानता है कि कब देखना है और कब सुनना है।
  • इंद्रियों को जोड़ना: वह समझता है कि वीडियो में "दौड़ते हुए व्यक्ति" के अर्थ को ऑडियो में एक "चीख" बदल देती है।
  • देखना न भूलना: हालांकि उसने सुनना सीखा, लेकिन उसने देखना नहीं भुलाया। वह वास्तव में वीडियो देखने में भी बेहतर हो गया, क्योंकि उसने सबसे महत्वपूर्ण हिस्सों पर ध्यान केंद्रित करना सीख लिया।

यह क्यों महत्वपूर्ण है

दुनिया को एक मूक फिल्म के बजाय एक मूवी की तरह सोचें। वास्तविक जीवन में आवाज़ और दृष्टि एक ही समय में घटित होती हैं। OmniVideo-R1 एक बड़ी उपलब्धि है क्योंकि यह AI को आवाज़ को केवल एक "एड-ऑन" (अतिरिक्त चीज़) मानने के बजाय, उसे समझने में एक महत्वपूर्ण साथी के रूप में उपयोग करना सिखाता है।

संक्षेप में: OmniVideo-R1 AI को अनुमान लगाना बंद करने और अपनी आँखों और कानों दोनों का उपयोग करके सच्चाई खोजने के लिए जांच (investigate) करना सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →