← नवीनतम पेपर
💬 NLP

VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding

VideoARM एक पदानुक्रमित मल्टीमॉडल मेमोरी (hierarchical multimodal memory) के साथ एक एजेंटिक रीजनिंग प्रतिमान (agentic reasoning paradigm) पेश करता है जो अनुकूलन योग्य, ऑन-द-फ्लाई कोर्स-टू-फाइन (coarse-to-fine) वीडियो विश्लेषण को सक्षम बनाता है, जिससे मौजूदा विधियों की तुलना में टोकन खपत को काफी कम करते हुए लंबी अवधि के वीडियो को समझने में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Yufei Yin, Qianke Meng, Minghao Chen, Jiajun Ding, Zhenwei Shao, Zhou Yu

प्रकाशित 2026-03-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yufei Yin, Qianke Meng, Minghao Chen, Jiajun Ding, Zhenwei Shao, Zhou Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ VideoARM पेपर का सरल, रोज़मर्रा की भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी समस्या: "अलेक्जेंड्रिया के पुस्तकालय" वाली दुविधा

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन सबूत कुछ तस्वीरें नहीं बल्कि एक 3 घंटे की फिल्म है।

यदि आप एक मानक AI (जैसे एक स्मार्ट असिस्टेंट) से इस फिल्म को देखने और एक विशिष्ट प्रश्न का उत्तर देने के लिए कहते हैं (जैसे, "जब फूलदान टूटा था, तब हत्यारा क्या पहने हुए था?"), तो AI के सामने एक बड़ी समस्या आती है:

  1. मेमोरी ओवरलोड (स्मृति का बोझ): यह 3 घंटे की फिल्म के हर एक सेकंड को याद नहीं रख सकता बिना भ्रमित हुए।
  2. लागत का विस्फोट (खर्च का बढ़ना): फिल्म को "पढ़ने" के लिए, AI को लाखों छोटे डेटा पॉइंट्स (टोकन) को प्रोसेस करना पड़ता है। यह एक लाइब्रेरी की किताबों के हर एक पन्ने को सिर्फ एक वाक्य खोजने के लिए पढ़ने जैसा है। यह अविश्वसनीय रूप से महंगा और धीमा है।

पिछले तरीकों ने इसे हल करने की कोशिश की:

  • "प्री-रीड" (पहले से पढ़ने वाला) तरीका: पूरी फिल्म को पहले पढ़ना, हर 10 सेकंड का सारांश लिखना और उसे स्टोर करना। (बहुत महंगा, उबाऊ हिस्सों पर समय बर्बाद करता है)।
  • "मैनुअल मैप" (हाथ से बना नक्शा) तरीका: AI शुरू करने से पहले एक इंसान द्वारा यह तय करना कि महत्वपूर्ण चीजें कहाँ हैं। (बहुत कठोर, इंसान हर सवाल का अनुमान नहीं लगा सकता)।

समाधान: VideoARM (एक "स्मार्ट जासूस")

लेखक VideoARM पेश करते हैं। पूरी किताब पढ़ने वाले रोबोट के बजाय, VideoARM एक सुपर-स्मार्ट, अनुकूलनशील (adaptive) जासूस की तरह है जो टॉर्च और एक नोटबुक लेकर सिनेमा हॉल में प्रवेश करता है।

यह कैसे काम करता है, इसे तीन सरल अवधारणाओं में विभाजित किया गया है:

1. "टॉर्च" की रणनीति (अनुकूलनशील तर्क/Adaptive Reasoning)

कल्पना कीजिए कि आप एक भीड़ भरे स्टेडियम में किसी विशिष्ट व्यक्ति को ढूंढ रहे हैं।

  • पुराना तरीका: आप पूरे स्टेडियम की एक फोटो लेते हैं, हर चेहरे पर ज़ूम करते हैं, और हर किसी का विवरण लिखते हैं। (बर्बादी!)
  • VideoARM का तरीका: आपको उस व्यक्ति के बारे में एक सामान्य अंदाजा मिल जाता है कि वह कहाँ हो सकता है। आप उस हिस्से पर अपनी टॉर्च चमकाते हैं। यदि आपको लाल टोपी दिखती है, तो आप और करीब से ज़ूम करते हैं। यदि वह नहीं दिखता, तो आप अपनी टॉर्च अगले सेक्शन की ओर ले जाते हैं।

VideoARM वीडियो के साथ ऐसा ही करता है। यह पूरी फिल्म को एक साथ नहीं देखता। यह एक कोर्स (coarse) यानी व्यापक नज़र (वाइड शॉट) से शुरू करता है, खुद से पूछता है, "क्या उत्तर यहाँ है?" यदि नहीं, तो यह वीडियो के नए हिस्से पर अपनी "टॉर्च" (टूल) को ले जाता है और करीब से (फाइन/fine) देखता है। यह केवल वीडियो के उन हिस्सों पर ऊर्जा खर्च करता है जो वास्तव में सवाल के लिए महत्वपूर्ण हैं।

2. "तीन-परत वाली नोटबुक" (पदानुक्रमित स्मृति/Hierarchical Memory)

जासूसों को एक अच्छी मेमोरी सिस्टम की आवश्यकता होती है। VideoARM HM3 (Hierarchical Multimodal Memory) नामक एक विशेष नोटबुक का उपयोग करता है जिसमें तीन परतें हैं:

  • परत 1: "सेंसरी" रफ नोट (अल्पकालिक): यहाँ जासूस वह लिखता है जो वह अभी देख रहा है। "मैं नीली कोट में एक आदमी देख रहा हूँ।" एक बार जब वह उस विशिष्ट सुराग को सुलझा लेता है, तो वह अगले सुराग के लिए जगह बनाने के लिए बोर्ड को साफ कर देता है।
  • परत 2: "केस फाइल" (परिणाम स्मृति): यहाँ जासूस वे तथ्य लिखता है जो उसने खोजे हैं। "नीली कोट वाले आदमी ने एक चाबी पकड़ी हुई थी।" यह नोटबुक में रहता है ताकि जासूस उन सुरागों को न भूल जाए जो उसने पहले ही एकत्र कर लिए हैं।
  • परत 3: "स्ट्रेटजी लॉग" (वर्किंग मेमोरी): यह जासूस का आंतरिक संवाद है। "मैंने किचन में देखा, चाबी नहीं मिली। अब मुझे बेडरूम चेक करना चाहिए।" यह इस बात का हिसाब रखता है कि वह जो भी कर रहा है वह क्यों कर रहा है, ताकि वह गोल-गोल न घूमता रहे।

3. "टूलबेल्ट" (एजेंटिक टूल्स)

जासूस केवल "देखता" ही नहीं है; उनके पास उनकी मदद के लिए टूल्स की एक बेल्ट है:

  • "टाइम-स्कोपर" (समय मापने वाला): एक टूल जो समय के एक बड़े हिस्से को जल्दी से स्कैन करता है ताकि यह बता सके, "उत्तर शायद मिनट 10 और मिनट 15 के बीच है।"
  • "सीन स्नैपर" (दृश्य पकड़ने वाला): एक टूल जो एक लंबे दृश्य का त्वरित स्नैपशॉट लेता है और उसका सारांश देता है। "यह एक पार्टी का दृश्य है।"
  • "क्लिप एनालाइज़र" (क्लिप विश्लेषक): यह एक आवर्धक लेंस (magnifying glass) है। यह किसी विशिष्ट विवरण को खोजने के लिए 5 सेकंड के छोटे क्लिप को अत्यधिक विस्तार से देखता है, जैसे शर्ट पर कोई लोगो।
  • "ईयरपीस" (ऑडियो ट्रांसक्राइबर): कभी-कभी केवल दृश्य संकेत पर्याप्त नहीं होते। यह टूल ऑडियो सुनता है और लोग क्या कह रहे हैं उसे लिख देता है, जो अक्सर उत्तर तक पहुँचने की कुंजी होता है।

"अवलोकन-सोच-कार्य-स्मृति" चक्र (Observe-Think-Act-Memorize Loop)

VideoARM एक निरंतर चक्र में चलता है, ठीक वैसे ही जैसे एक इंसान सोचता है:

  1. Observe (अवलोकन): वर्तमान मेमोरी और वीडियो को देखें।
  2. Think (सोचें): "मुझे लाल कार ढूँढनी है। मुझे पार्किंग लॉट वाला हिस्सा चेक करना चाहिए।"
  3. Act (कार्य करें): पार्किंग लॉट वाले हिस्से में ज़ूम करने के लिए एक टूल का उपयोग करें।
  4. Memorize (स्मृति): जो पाया गया (या नहीं पाया गया) उसे नोटबुक में लिखें।
  5. Repeat (दोहराएं): यदि उत्तर स्पष्ट नहीं है, तो चरण 1 पर वापस जाएँ।

यह एक बड़ी बात क्यों है?

1. यह सस्ता है (टोकन दक्षता):
क्योंकि VideoARM केवल वीडियो के उन्हीं हिस्सों को देखता है जो महत्वपूर्ण हैं, यह पिछले तरीकों की तुलना में 50 गुना कम डेटा (टोकन्स) का उपयोग करता है। यह एक पूरा पिज्जा खरीदने के बजाय केवल एक स्लाइस ऑर्डर करने जैसा है।

2. यह स्मार्ट है:
यह इस पर निर्भर नहीं करता कि कोई इंसान इसे बताए कि कहाँ देखना है। यह पहले "कोर्स" स्थान का पता लगाता है, फिर गहराई तक जाता है। यह इसे घास के ढेर में सुई खोजने में बहुत बेहतर बनाता है।

3. यह लचीला है:
यदि सवाल बदल जाता है, तो जासूस अपनी रणनीति बदल देता है। यदि आप फिल्म की आवाज़ के बारे में पूछते हैं, तो जासूस "ईयरपीस" टूल उठा लेता है। यदि आप विजुअल्स के बारे में पूछते हैं, तो वह "मैग्निफाइंग ग्लास" उठा लेता है।

निचोड़ (The Bottom Line)

VideoARM लंबे वीडियो को समझने का एक नया तरीका है। पूरी चीज़ को अंधे होकर पढ़ने या पहले से बने नक्शे पर निर्भर रहने के बजाय, यह एक जिज्ञासु, रणनीतिक जासूस की तरह काम करता है। यह सुरागों को याद रखने के लिए एक स्मार्ट नोटबुक और केवल दिलचस्प हिस्सों पर ज़ूम करने के लिए टूल्स के सेट का उपयोग करता है। यह इसे लंबी फिल्मों, व्याख्यानों (lectures) या मीटिंग्स के बारे में उत्तर देने में तेज़, सस्ता और बहुत अधिक सटीक बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →