← नवीनतम पेपर
💻 computer science

SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration

SVAgent एक स्टोरीलाइन-गाइडेड क्रॉस-मोडल मल्टी-एजेंट फ्रेमवर्क है जो विकसित होती कहानियों (स्टोरीलाइन्स) का निर्माण करने, फ्रेम चयन को परिष्कृत करने और मजबूत एवं व्याख्या योग्य परिणामों के लिए दृश्य-पाठ्य भविष्यवाणियों को संरेखित करने वाले सहयोगात्मक एजेंटों के माध्यम से मानवीय कथा तर्क (नैरेटिव रीजनिंग) का अनुकरण करके वीडियो क्वेश्चन अनस्विरिंग को बढ़ाता है।

मूल लेखक: Zhongyu Yang, Zuhao Yang, Shuo Zhan, Tan Yue, Wei Pang, Yingfang Yuan

प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhongyu Yang, Zuhao Yang, Shuo Zhan, Tan Yue, Wei Pang, Yingfang Yuan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन एक मेज पर रखे कुछ सुरागों के बजाय, आपको एक 10 घंटे की डॉक्यूमेंट्री थमा दी गई है और पूछा गया है, "कुकी किसने चुराई?"

यदि आप वीडियो को बेतरतीब ढंग से सरसरी तौरकी देखते हैं, तो आप उस महत्वपूर्ण क्षण को चूक सकते हैं जहाँ अपराधी कुकी गिरा देता है। यदि आप केवल पहले 5 मिनट देखते हैं, तो आपको लग सकता है कि बटलर ने यह किया है, जबकि बाद में पता चलता है कि यह कुत्ता था। यह समस्या वर्तमान AI के साथ है जो लंबे वीडियो देखते समय सामना करता है: वे अभिभूत हो जाते हैं, समय का ट्रैक खो देते हैं, या गलत विवरणों पर ध्यान केंद्रित करते हैं।

पेश है SVAgent, एक नया AI सिस्टम जिसे लंबे वीडियो को ठीक उसी तरह देखने के लिए डिज़ाइन किया गया है जैसे एक मानव जासूस देखता है। केवल वीडियो को "देखने" के बजाय, यह देखते समय एक कहानी सुनाता है।

यह कैसे काम करता है, इसे सरल भागों में यहाँ समझाया गया है:

1. कहानी सुनाने वाला (द स्टोरीलाइन एजेंट)

कल्पना कीजिए कि आप एक फिल्म देख रहे हैं और आपका दोस्त पूछता है, "क्या हो रहा है?" आप हर एक फ्रेम का वर्णन नहीं करते; आप कहते हैं, "ठीक है, पहले नायक अंदर आता है, फिर वह एक भूत देखता है, फिर वह भाग जाता है।"

  • SVAgent क्या करता है: इसमें एक विशेष "स्टोरीटेलर" एजेंट है जो लगातार वीडियो को एक चलते हुए वृत्तांत (नैरेटिव) में सारांशित करता है। यह उबाऊ हिस्सों को अनदेखा करता है और कथानक (प्लॉट) पर ध्यान केंद्रित करता है। यह "कहानी" एक मानचित्र की तरह कार्य करती है, ताकि AI 1 घंटे के वीडियो के बीच में कभी खो न जाए।

2. जासूस और सबूत (द हाइपोथीसिस एजेंट)

एक बार जब स्टोरीटेलर के पास कथानक का एक मोटा अंदाज़ा हो जाता है, तो "डिटेक्टिव" एजेंट एक अनुमान लगाता है: "मुझे लगता है कि कुत्ते ने कुकी चुराई है।"

  • समस्या: हमें कैसे पता चलेगा कि कुत्ता दोषी है? हमें सबूत चाहिए।
  • समाधान: डिटेक्टिव एक विशेष उपकरण का उपयोग करता है जिसे DPPs कहा जाता है (इसे एक "स्मार्ट आवर्धक लेंस" के रूप में सोचें)। हर फ्रेम को देखने के बजाय, यह बुद्धिमानी से उन सर्वश्रेष्ठ फ्रेम्स को चुनता है जो अनुमान को सिद्ध या खंडित करते हैं। यह उन दृश्यों को अनदेखा करता है जहाँ कुत्ता बस सो रहा है और उन फ्रेम्स को ढूंढता है जहाँ उसके पंजों के निशान या खाली कुकी जार दिख रहे हों।

3. न्यायाधीशों का पैनल (क्रॉस-मोडल डिसीजन एजेंट्स)

अब, डिटेक्टिव के पास एक सिद्धांत है, लेकिन क्या वह सही है? SVAgent केवल एक राय पर भरोसा नहीं करता। यह दो विशेषज्ञ न्यायाधीशों को बुलाता है:

  • टेक्स्ट जज (Text Judge): यह कैप्शन और विवरणों को देखता है। "स्क्रिप्ट कहती है कि कुत्ता रसोई के पास था।"
  • विजुअल जज (Visual Judge): यह पूरी तरह से पिक्सल्स को देखता है। "मैं रसोई के पास एक कुत्ता देख रहा हूँ।"
  • मेटा-जज (The Referee): यह बॉस है। यह दोनों न्यायाधीशों की बात सुनता है। यदि टेक्स्ट जज कहता है "हाँ" और विजुअल जज कहता "नहीं", तो मेटा-जज जानता है कि कुछ गलत है। यह उन्हें सहमत होने के लिए मजबूर करता है या और सबूत मांगता है। यह AI को भ्रमित होने (hallucinating) या मनगढ़ंत बातें बनाने से रोकता है।

4. "वापस जाओ और जाँच करो" तंत्र (द सजेस्टशन एजेंट)

कभी-कभी, न्यायाधीश सहमत नहीं हो पाते, या सबूत कमजोर होते हैं। शायद वीडियो धुंधला था, या कुत्ता सोफे के पीछे छिपा हुआ था।

  • क्या होता है: हार मानने के बजाय, सजेस्टशन एजेंट कहता है, "रुको, मैंने कुछ मिस कर दिया है। चलिए वापस चलते हैं और विशेष रूप से 15 मिनट के मार्क को देखते हैं जहाँ कुत्ता छिपा हुआ था।"
  • लूप: सिस्टम वापस जाता है, उन विशिष्ट नए फ्रेम्स को लेता है, कहानी को अपडेट करता है, और न्यायाधीशों को फिर से चलाता है। यह तब तक ऐसा करता रहता है जब तक कि वह उत्तर के प्रति आश्वस्त न हो जाए।

यह एक बड़ी बात क्यों है?

अधिकांश वर्तमान AI मॉडल उन छात्रों की तरह हैं जो पूरे टेक्स्टबुक को पेज-दर-पेज याद करने की कोशिश करते हैं। यदि परीक्षा का प्रश्न पेज 500 के किसी विवरण के बारे में है, तो वे पेज 1 को भूल सकते हैं।

SVAgent एक स्मार्ट छात्र की तरह है जो:

  1. विषय-सूची (Table of Contents) पढ़ता है (स्टोरीलाइन) यह जानने के लिए कि कहाँ देखना है।
  2. कीवर्ड्स के लिए स्कैन करता है (हाइपोथीसिस) सही पन्ने खोजने के लिए।
  3. अपनी नोट्स को टेक्स्टबुक के साथ चेक करता है (जजेस) यह सुनिश्चित करने के लिए कि वह गलत नहीं पढ़ रहा है।
  4. विशिष्ट पैराग्राफ को दोबारा पढ़ता है (सजेस्टशन) यदि वह अभी भी भ्रमित है।

परिणाम

परीक्षणों में, इस "स्टोरीटेलिंग डिटेक्टिव" दृष्टिकोण ने अन्य शीर्ष AI मॉडलों को एक महत्वपूर्ण अंतर से पीछे छोड़ दिया (5% से 11% बेहतर)। इसने न केवल अधिक उत्तर सही दिए; बल्कि यह बहुत अधिक सुसंगत था और लंबे, जटिल वीडियो से भ्रमित होने की संभावना बहुत कम थी।

संक्षेप में: SVAgent केवल वीडियो को "देखता" नहीं है; यह एक कहानी बनाकर, अपने काम की जाँच करके और अनिश्चित होने पर दोबारा देखने के लिए पूछकर उन्हें समझता है। यह छवियों के एक अराजक प्रवाह को एक स्पष्ट, तार्किक वृत्तांत में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →