← नवीनतम पेपर
💻 computer science

AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning

यह शोध पत्र AgentCVR प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो लक्षित साक्ष्य प्राप्ति के लिए विशिष्ट विजुअल और ऑडियो एजेंटों को पुनरावृत्ति (iteratively) रूप से समन्वित करने के लिए एक मास्टर एजेंट का उपयोग करके क्रॉस-वीडियो रीजनिंग में सिंगल-पास रणनीतियों की सीमाओं को संबोधित करता है, और अत्याधुनिक प्रदर्शन प्राप्त करते हुए प्रशिक्षण दक्षता को अनुकूलित करने के लिए एक नवीन स्क्रिप्ट-सिम्युलेटेड रीइन्फोर्समेंट लर्निंग दृष्टिकोण का उपयोग करता है।

मूल लेखक: Yilun Qiu, Jiahe Wang, Cilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Chun Yuan

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yilun Qiu, Jiahe Wang, Cilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Chun Yuan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ AgentCVR पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी समस्या: "बहुत अधिक जानकारी" का जाल

कल्पना कीजिए कि आप एक जासूस हैं जो किसी रहस्य को सुलझाने की कोशिश कर रहे हैं, लेकिन आपको केवल एक अपराध स्थल के बजाय, अलग-अलग कोणों और समय से ली गई पाँच अलग-अलग सुरक्षा कैमरा टेप दी गई हैं।

वर्तमान AI मॉडल (वे "स्मार्ट" कंप्यूटर जिनका हम आज उपयोग करते हैं) इसे एक ही फाइल में पाँचों टेपों को दबाकर (compress करके) एक साथ पढ़ने की कोशिश करते हैं। यह पूरी घास के ढेर (haystack) की एक फोटो को घूरकर उसमें से एक विशिष्ट सुई खोजने की कोशिश करने जैसा है। क्योंकि AI को बहुत सारा डेटा कंप्रेस करना पड़ता है, इसलिए वह अक्सर बैकग्राउंड में छिपे छोटे, महत्वपूर्ण सुरागों (सुइयों) को मिस कर देता है। वह बहुत अधिक जानकारी से घबरा जाता है और अधूरी जानकारी के आधार पर अनुमान लगाने लगता है।

समाधान: AgentCVR (जासूसों की टीम)

लेखकों ने एक नया तरीका प्रस्तावित किया है जिसे AgentCVR कहा जाता है। एक अकेले AI द्वारा सब कुछ एक साथ करने के बजाय, उन्होंने एक मुख्य जासूस (Master Detective) के नेतृत्व में विशेषज्ञ जासूसों की एक टीम बनाई है।

  1. मास्टर एजेंट (टीम लीडर): यह AI सीधे वीडियो नहीं देखता है। इसके बजाय, यह एक प्रोजेक्ट मैनेजर की तरह काम करता है। यह प्रश्न पढ़ता है, सोचता है कि उसे क्या जानने की आवश्यकता है, और फिर अपने टीम के सदस्यों को विशिष्ट निर्देश भेजता है।
  2. विजुअल एजेंट (आँख): जब लीडर कहता है, "वीडियो 2 में 1:00 से 1:30 के बीच किचन की जाँच करें," तो यह एजेंट केवल समय के उस विशिष्ट हिस्से पर ज़ूम करता है और जो वह देखता है उसकी रिपोर्ट देता है।
  3. ऑडियो एजेंट (कान): यदि लीडर सोचता है, "शायद उन्होंने आग के बारे में कुछ कहा था," तो यह एजेंट केवल उस विशिष्ट समय के हिस्से को सुनता है और संवाद या ध्वनियों की रिपोर्ट देता है।

जादू: पूरी किताब को एक साथ पढ़ने के बजाय, टीम सवाल पूछती है, विशिष्ट पृष्ठों को देखती है, विशिष्ट अध्यायों को सुनती है, और कदम-दर-कदम कहानी को जोड़ती है। यह सुनिश्चित करता है कि वे शोर (noise) के बीच छिपे दुर्लभ, महत्वपूर्ण सुरागों को मिस न करें।

प्रशिक्षण की चुनौती: "महंगा जिम" वाली समस्या

इस टीम लीडर को स्मार्ट बनाने के लिए, आपको आमतौर पर इसे लाखों बार अभ्यास करने की आवश्यकता होती है। लेकिन वास्तविक दुनिया में, वीडियो देखना महंगा और धीमा है (जैसे फिल्म देखने के लिए उच्च प्रति घंटा दर का भुगतान करना)। यदि AI को वीडियो देखना पड़ता है, गलती करनी पड़ती है, और फिर से प्रयास करना पड़ता है, तो इसमें कंप्यूटर पावर का एक बड़ा खर्च आता है।

नवाचार: स्क्रिप्ट-सिम्युलेटेड RL (एक "टेक्स्ट-आधारित सिम्युलेटर")

लेखकों ने वीडियो प्रोसेसिंग पर पैसा खर्च किए बिना AI को प्रशिक्षित करने के लिए एक चतुर तरकीब निकाली है।

कल्पना कीजिए कि आप एक पायलट को प्रशिक्षित करना चाहते हैं। हर अभ्यास सत्र के लिए उन्हें एक असली, महंगे विमान को उड़ाने देने के बजाय, आप उन्हें एक टेक्स्ट-आधारित फ्लाइट सिम्युलेटर में रखते हैं।

  • स्क्रिप्ट: एक शक्तिशाली लैंग्वेज मॉडल वीडियो का वर्णन करने वाली एक "स्क्रिप्ट" लिखता है (जैसे, "10 सेकंड पर, एक लाल कार गुजरती है; 20 सेकंड पर, एक कुत्ता भौंकता है")।
  • सिम्युलेटर: AI एजेंट वास्तविक वीडियो के बजाय इस टेक्स्ट स्क्रिप्ट के साथ इंटरैक्ट करता है। वह पूछता है, "10 सेकंड पर क्या होता है?" और सिम्युलेटर जवाब देता है, "एक लाल कार गुजरती है।"
  • परिणाम: एजेंट जांच करने के तर्क (logic) को सीखता है (कब देखना है, क्या सुनना है, कब रुकना है) और इसके लिए सस्ते टेक्स्ट का उपयोग करता है।

एक बार जब एजेंट "टेक्स्ट सिम्युलेटर" में विशेषज्ञ बन जाता है, तो लेखक बस टेक्स्ट सिम्युलेटर को वास्तविक वीडियो टूल्स से बदल देते हैं। क्योंकि एजेंट ने जांच की रणनीति सीख ली है, वह उन कौशलों को वास्तविक वीडियो पर तुरंत लागू कर सकता है बिना सब कुछ दोबारा सीखे।

परिणाम: स्मार्ट और तेज़

जब उन्होंने इस सिस्टम का परीक्षण एक विशाल बेंचमार्क CrossVid पर किया (जो कठिन प्रश्नों से भरा है जिनमें कई वीडियो की आवश्यकता होती है):

  • पुराने तरीके को पछाड़ना: AgentCVR उन "सिंगल-पास" मॉडलों से काफी बेहतर प्रदर्शन करता है जो सभी वीडियो को एक साथ निगलने की कोशिश करते हैं।
  • दिग्गजों को टक्कर देना: इसने सबसे शक्तिशाली, महंगे, क्लोज्ड-सोर्स AI सिस्टम (जैसे बड़ी टेक कंपनियों के टॉप-टियर मॉडल) के लगभग बराबर प्रदर्शन किया, भले ही AgentCVR छोटे, ओपन-सोर्स मॉडल का उपयोग करता है।
  • सटीकता: यह विशेष रूप से यह खोजने में बहुत अच्छा था कि वास्तव में कब कुछ हुआ (टेम्पोरल ग्राउंडिंग) और विभिन्न वीडियो के बीच विवरणों की तुलना करने में।

सारांश

AgentCVR खेल को "एक साथ पूरी लाइब्रेरी पढ़ने" से बदलकर "विशिष्ट सुराग खोजने के लिए विशेषज्ञों की एक टीम को काम पर रखने" में बदल देता है। यह टीम लीडर को कुशलतापूर्वक प्रशिक्षित करने के लिए एक चतुर "टेक्स्ट-आधारित अभ्यास क्षेत्र" का उपयोग करता है, जिससे यह उन जटिल वीडियो रहस्यों को हल करने में सक्षम होता है जो पहले सबसे स्मार्ट AI को भी उलझा देते थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →