← नवीनतम पेपर
💻 computer science

Persistent Object Narratives for Token-Efficient Video Language Models

यह शोधपत्र SlotNarrative को प्रस्तुत करता है, जो एक टोकन-कुशल वीडियो भाषा मॉडल इंटरफ़ेस है जो कॉम्पैक्ट आइडेंटिटी और स्टेट टोकन का उपयोग करके वीडियो सामग्री को निरंतर ऑब्जेक्ट नैरेटिव में व्यवस्थित करता है, जो ऑब्जेक्ट ग्रुपिंग को फ्रेम-वार संपीड़न से अलग करके एक अनुकूल सटीकता-से-टोकन ट्रेड-ऑफ प्राप्त करता है।

मूल लेखक: Junzhe Chen, Siyuan Meng, Xiaojie Guo

प्रकाशित 2026-08-06
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Junzhe Chen, Siyuan Meng, Xiaojie Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को एक फिल्म समझना सिखाने की कोशिश कर रहे हैं। आपके पास किताबों का एक विशाल पुस्तकालय (रोबोट का मस्तिष्क) है, लेकिन वह एक बार में केवल कुछ ही पन्ने पढ़ सकता है इससे पहले कि वह घबरा जाए। यदि आप रोबोट को एक फिल्म का हर एक फ्रेम दिखाने की कोशिश करते हैं—प्रति मिनट हजारों चित्र—तो वह चोक हो जाता है। वह पिक्सेल की भारी मात्रा में खो जाता है और भूल जाता है कि पहले दृश्य में दौड़ रहा पात्र अंतिम दृश्य में कूदने वाला वही पात्र है। यही वह बड़ी पहेली है जिसे वैज्ञानिक वीडियो लार्ज लैंग्वेज मॉडल्स (Video Large Language Models) के क्षेत्र में हल कर रहे हैं। ये वे AI सिस्टम हैं जिन्हें वीडियो "देखने" और उनके बारे में सवालों के जवाब देने के लिए डिज़ाइन किया गया है, लेकिन वे मेमोरी का अधिक उपयोग किए बिना समय के साथ वस्तुओं पर नज़र रखने में संघर्ष करते हैं। मुख्य चुनौती एक लंबे वीडियो को एक छोटी, कुशल कहानी में संक्षिप्त करने का तरीका खोजने की है जिसे रोबोट वास्तव में पढ़ सके, बिना कथानक खोए।

यहाँ SlotNarrative आता है, जो टियांजिन यूनिवर्सिटी के शोधकर्ताओं द्वारा प्रस्तावित एक नया तरीका है जो इन AI रोबोटों के लिए एक चतुर संपादक की तरह कार्य करता है। वीडियो के हजारों फ्रेमों के अराजक ढेर को रोबोट को खिलाने के बजाय, SlotNarrative वीडियो को "परसिस्टेंट ऑब्जेक्ट नैरेटिव्स" (स्थिर वस्तु आख्यानों) में व्यवस्थित करता है। इसे इस प्रकार सोचें: यदि आप अपने उस दोस्त को एक फुटबॉल मैच का वर्णन कर रहे थे जिसने पूरा मैच मिस कर दिया है, तो आप खेल के हर एक सेकंड को सूचीबद्ध नहीं करेंगे। इसके बजाय, आप कहेंगे, "वहाँ एलेक्स नाम का एक स्ट्राइकर था जो मैदान में दौड़ा, फिर उसने गेंद को पास किया, फिर उसने गोल किया।" आप एलेक्स की कहानी को ट्रैक कर रहे हैं, न कि उसकी जर्सी के पिक्सेल को।

पेपर सुझाव देता है कि SlotNarrative पहले विजुअल फीचर्स को "स्लॉट्स" में समूहित करके काम करता है—छोटे बकेट जो उन चीजों को पकड़ते हैं जो वस्तुओं की तरह दिखती हैं। फिर, यह इन बकेट्स को समय के साथ जोड़ने के लिए एक विशेष, अदृश्य मेमोरी सिस्टम का उपयोग करता है। भले ही वस्तु किसी पेड़ के पीछे गायब हो जाए या कैमरा हट जाए, सिस्टम याद रखता है, "आह, यह अभी भी एलेक्स है!" अंत में, यह रोबोट के लिए एक छोटा, निश्चित आकार का रिपोर्ट लिखता है। इस रिपोर्ट के दो भाग हैं: एक "आइडेंटिटी टोकन" (वस्तु के लिए एक स्थायी आईडी कार्ड, जैसे "स्ट्राइकर एलेक्स") और "स्टेट टोकन्स" का एक सेट (उसका डायरी जिसमें अलग-अलग हिस्सों में क्या हुआ उसका विवरण है)।

शोधकर्ताओं ने पाया कि यह तरीका अविश्वसनीय रूप से कुशल है। वे एक वीडियो की पूरी दृश्य कहानी को केवल 144 "टोकन" स्थितियों (सूचना की इकाइयों) में सिकोड़ने में सफल रहे। यह उन हजारों टोकनों का एक बहुत छोटा हिस्सा है जो अन्य तरीके उपयोग करते हैं। इतना कम स्थान उपयोग करने के बावजूद, सिस्टम ने मानक वीडियो क्विज़ पर बहुत अच्छा प्रदर्शन किया, और अक्सर अन्य कॉम्पैक्ट तरीकों को भी पीछे छोड़ दिया। पेपर सुझाव देता है कि "कौन" (पहचान) को "क्या हुआ" (अवस्था) से अलग करके, रोबोट डेटा की भारी मात्रा से भ्रमित हुए बिना वीडियो को बहुत बेहतर समझ सकता है। हालाँकि, लेखक यह भी नोट करते हैं कि जबकि यह वस्तुओं को ट्रैक करने के लिए बहुत अच्छा काम करता है, यह कभी-कभी बहुत जटिल, लंबी अवधि के समय या भीड़भाड़ वाले दृश्यों में संघर्ष करता है जहाँ वस्तुएं आपस में मिल जाती हैं, जो यह दर्शाता है कि इन AI संपादकों को पूर्ण बनाने के लिए अभी भी काम किया जाना बाकी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →