← नवीनतम पेपर
💬 NLP

MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism

MemDreamer एक प्लग-एंड-प्ले फ्रेमवर्क है जो एक पदानुक्रमित ग्राफ मेमोरी (hierarchical graph memory) का निर्माण करके और एक एजेंटिक रिट्रीवल मैकेनिज्म (agentic retrieval mechanism) को नियोजित करके लंबे वीडियो को समझने के लिए धारणा (perception) और तर्क (reasoning) को अलग करता है, जो संदर्भ विंडो की आवश्यकताओं को नाटकीय रूप से कम करते हुए अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Cong Chen, Guo Gan, Kaixiang Ji, ChaoYang Zhang, Zhen Yang, Guangming Yao, Hao Chen, Jingdong Chen, Yi Yuan, Chunhua Shen

प्रकाशित 2026-06-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cong Chen, Guo Gan, Kaixiang Ji, ChaoYang Zhang, Zhen Yang, Guangming Yao, Hao Chen, Jingdong Chen, Yi Yuan, Chunhua Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ MEMDREAMER पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रचनात्मक उपमाओं (analogies) में विभाजित किया गया है।

बड़ी समस्या: "बबेल का पुस्तकालय" (The Library of Babel)

कल्पना कीजिए कि आप एक सुपर-स्मार्ट लाइब्रेरियन (एक AI) से एक ऐसे पुस्तकालय के भीतर एक विशिष्ट तथ्य खोजने के लिए कहते हैं जिसमें दुनिया की हर लिखी हुई किताब मौजूद है, और वे सभी एक विशाल, 100 मील लंबे स्क्रॉल में आपस में जुड़ी हुई हैं।

वर्तमान AI मॉडल इस समस्या को हल करने के लिए पूरे स्क्रॉल को एक साथ पढ़ने की कोशिश करते हैं।

  • परिणाम: लाइब्रेरियन अभिभूत (overwhelmed) हो जाता है। जब तक वह बीच तक पहुँचता है, वह शुरुआत को भूल जाता है ("बीच में खो जाना" या "lost in the middle"), और शब्दों की भारी मात्रा महत्वपूर्ण सुरागों को दबा देती है। यह घास के ढेर में सुई खोजने के लिए पूरे घास के ढेर को खाने जैसा है।

समाधान: MEMDREAMER

लेखकों ने लंबी वीडियो (जैसे घंटों लंबी फिल्में) को संभालने के लिए एक नया तरीका बनाया है, जिसे MEMDREAMER कहा जाता है। वीडियो को एक बार में पूरा पढ़ने के लिए मजबूर करने के बजाय, उन्होंने काम को दो अलग-अलग भूमिकाओं में विभाजित किया है: द ऑब्जर्वर (The Observer - प्रेक्षक) और द डिटेक्टिव (The Detective - जासूस)

1. द ऑब्जर्वर (अवलोकन/Perception)

  • यह क्या करता है: यह AI वास्तविक समय में वीडियो देखता है, जैसे कि एक कैमरा ऑपरेटर।
  • चाल (The Trick): यह केवल कच्चा (raw) वीडियो रिकॉर्ड नहीं करता है। इसके बजाय, यह एक स्मार्ट नोट-टेकर की तरह काम करता है। देखते समय, यह फिल्म को एक संरचित "मानचित्र" या "ग्राफ" में तोड़ देता है।
  • मानचित्र की संरचना:
    • शीर्ष स्तर (पूरी फिल्म): पूरी कहानी का एक वाक्य का सारा में।
    • मध्य स्तर (अध्याय): प्रमुख दृश्यों या "सुपर इवेंट्स" का सारांश।
    • निचला स्तर (दृश्य): विशिष्ट पात्रों, कार्यों और उनके बीच के संबंधों पर विस्तृत नोट्स (जैसे, "जूडी ने एक पॉपसिकल खरीदी," जिसके कारण "निक को गुस्सा आया")।
  • उपमा: डिटेक्टिव को कच्चा वीडियो टेप देने के बजाय, ऑब्जर्वर एक विस्तृत, व्यवस्थित इंडेक्स कार्ड सिस्टम लिखता है और वीडियो टेप को हटा देता है।

2. द डिटेक्टिव (तर्क/Reasoning)

  • यह क्या करता है: यह वह AI है जो वास्तव में आपके प्रश्न का उत्तर देता है।
  • चाल (The Trick): यह कभी भी वीडियो नहीं देखता। यह केवल ऑब्जर्वर द्वारा बनाए गए इंडेक्स कार्ड्स (टेक्स्ट मेमोरी) को देखता है।
  • टूलबेल्ट (औजारों का सेट): डिटेक्टिव के पास इस इंडेक्स को नेविगेट करने के लिए विशेष उपकरणों का एक सेट (एक "एजेंटिक टूलकिट") है:
    • नेविगेशन टूल्स: "मुझे पूरी फिल्म का सारांश दिखाएं," या "मुझे 'चेज़ सीन' वाला अध्याय दिखाएं।"
    • सर्च टूल्स: "मुझे ढूंढ कर बताएं कि पात्र 'निक' कब-कब दिखाई दिया।"
    • ग्राफ टूल्स: "उस घटनाओं की श्रृंखला दिखाएं जिसकी वजह से विस्फोट हुआ।"
  • लूप (The Loop): डिटेक्टिव एक प्रश्न पूछता है, सुराग खोजने के लिए एक टूल का उपयोग करता है, उसके बारे में सोचता है, अधिक विवरण के लिए दूसरे टूल को पूछता है, और यह तब तक दोहराता रहता है जब तक कि उसके पास मामला सुलझाने के लिए पर्याप्त सबूत न हो जाएं।

यह बेहतर क्यों काम करता है

पेपर का दावा है कि यह "डिकपल्ड" (Decoupled - अलग किया हुआ) दृष्टिकोण (देखने वाले और सोचने वाले को अलग करना) दो बड़ी समस्याओं को हल करता है:

  1. "टोकन विस्फोट" का अंत:

    • पुराना तरीका: 2 घंटे की फिल्म को समझने के लिए, AI को एक साथ 1.6 मिलियन से अधिक शब्द प्रोसेस करने पड़ते थे।
    • MEMDREAMER: डिटेक्टिव को मामले को सुलझाने के लिए केवल लगभग 6,000 शब्दों (इंडेक्स कार्ड्स) को पढ़ने की आवश्यकता होती है। यह जानकारी प्रोसेस करने के लिए 40 से 120 गुना कम है!
  2. "तर्क करने की शक्ति" को अनलॉक करना:

    • पेपर ने कुछ आश्चर्यजनक खोजा: जब AI मॉडल को पूरी वीडियो पढ़ने के लिए मजबूर किया जाता है, तो उनके "स्मार्ट रीजनिंग" कौशल शोर (noise) के कारण बाधित हो जाते हैं।
    • लेकिन जब वे MEMDREAMER के साफ-सुथरे इंडेक्स कार्ड्स का उपयोग करते हैं, तो उनकी तर्क करने की क्षमता सीधे वीडियो को समझने में बदल जाती है।
    • उपमा: यह एक बुद्धिमान जासूस को लेने जैसा है जो वर्तमान में आंखों पर पट्टी बंधे हुए है (वीडियो के शोर में डूब रहा है) और उसे एक स्पष्ट मानचित्र देना है। अचानक, वे केस सुलझाने के लिए अपनी पूरी प्रतिभा का उपयोग कर सकते हैं।

परिणाम

पेपर ने चार प्रमुख बेंचमार्क (AI वीडियो समझ के लिए मानकीकृत परीक्षणों की तरह) पर इस सिस्टम का परीक्षण किया।

  • प्रदर्शन: MEMDREAMer ने पिछले सभी तरीकों को पछाड़ दिया, जिसमें आज उपलब्ध सबसे महंगे और शक्तिशाली AI मॉडल भी शामिल हैं।
  • मानव स्तर: इसने AI और मानव विशेषज्ञों के बीच के अंतर को केवल 3.7 अंकों तक कम कर दिया।
  • दक्षता (Efficiency): इसने पारंपरिक तरीकों की तुलना में केवल 2% कंप्यूटर मेमोरी (कॉन्टेक्स्ट विंडो) का उपयोग करके ये उच्च स्कोर प्राप्त किए।

सारांश

MEMDREAMER AI को पूरी फिल्म को "याद रखने" के लिए मजबूर करना बंद करता है। इसके बजाय, इसमें एक AI फिल्म को एक स्मार्ट, खोजने योग्य मानचित्र में व्यवस्थित करता है, और दूसरा AI उस मानचित्र को खोजने के लिए एक डिटेक्टिव के रूप में कार्य करता है। यह AI को स्पष्ट रूप से सोचने, लंबी वीडियो में जटिल तर्क सुलझाने और बहुत कम कंप्यूटिंग पावर के साथ ऐसा करने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →