← नवीनतम पेपर
💻 computer science

VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

VLZip एक एकीकृत ढांचे को पेश करता है जो एक शुद्ध ट्रांसफॉर्मर के भीतर विजुअल और टेक्स्ट इंटरलीव्ड अनुक्रमों को कॉम्पैक्ट सॉफ्ट प्रीफिक्स में पदानुक्रमित रूप से संकुचित करता है, जिससे 2M टोकन तक के अल्ट्रा-लॉन्ग कॉन्टेक्स्ट पर हाई-फिडेलिटी रीजनिंग सक्षम होती है और मेमोरी उपयोग को महत्वपूर्ण रूप से कम करते हुए मौजूदा विधियों से बेहतर प्रदर्शन होता है।

मूल लेखक: Yuqi Zhang, Cheng Chen, Yuyu Guo, Wenjie Yang, Lingchen Meng, Peng Di, Hang Yu, Zuxuan Wu, Yu-Gang Jiang

प्रकाशित 2026-08-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuqi Zhang, Cheng Chen, Yuyu Guo, Wenjie Yang, Lingchen Meng, Peng Di, Hang Yu, Zuxuan Wu, Yu-Gang Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को एक ऐसी कहानी समझाने की कोशिश कर रहे हैं जो हजारों तस्वीरों और लाखों शब्दों के मिश्रण से बनी है, जो एक अव्यवस्थित स्क्रैपबुक की तरह आपस में उलझी हुई है। यह विजन-लैंग्वेज मॉडल्स (VLMs) की दुनिया है, जो वे AI दिमाग हैं जो एक छवि को "देख" सकते हैं और उसके कैप्शन को "पढ़" सकते हैं ताकि समझ सकें कि क्या हो रहा है। अभी, ये रोबोट एक एकल स्नैपशॉट देखने या एक छोटा पैराग्राफ पढ़ने में माहिर हैं। लेकिन जब आप उन्हें एक विशाल, इंटरलीव्ड (interleaved) कहानी सौंपते हैं—जैसे कि एक वीडियो जहाँ चित्र और टेक्स्ट घंटों तक बारी-बारी से आते-जाते रहते हैं—तो वे एक दीवार से टकरा जाते हैं। समस्या यह है कि उनका दिमाग एक विशाल जाल की तरह काम करता है जहाँ सूचना के हर हिस्से को दूसरे हिस्से से जुड़ना पड़ता है। जैसे-जैसे कहानी लंबी होती जाती है, कनेक्शनों की संख्या विस्फोट की तरह बढ़ती है, जिससे रोबोट का दिमाग मेमोरी खत्म कर देता है और क्रैश हो जाता है। यह एक 10 घंटे की फिल्म के हर एक शब्द को याद रखने और साथ ही साथ वीडियो के हर एक फ्रेम को याद रखने की कोशिश करने जैसा है; आपका दिमाग एक साथ इतना सब कुछ नहीं संभाल सकता।

वैज्ञानिकों ने इसे ठीक करने के लिए या तो कहानी के कुछ हिस्सों को हटा देने (प्रूनिंग/pruning) या एक पूरी तरह से नया, सरल दिमाग बनाने की कोशिश की है जो शायद उतना स्मार्ट न हो। लेकिन हिस्सों को फेंक देने का मतलब है महत्वपूर्ण विवरणों को खो देना, और मस्तिष्क की संरचना बदलने से अक्सर रोबोट की तर्क करने की क्षमता कम हो जाती है। बड़ा सवाल यह है: क्या हम रोबोट के शक्तिशाली दिमाग को बरकरार रख सकते हैं लेकिन इसे इतना हल्का बना सकते हैं कि वह कहानी को भूले बिना एक विशाल कहानी को ढो सके?

यहीं पर VLZip नामक एक नया फ्रेमवर्क सामने आता है। VLZip को एक मास्टर लाइब्रेरियन के रूप में समझें जो जगह बचाने के लिए किताबें फेंकने के बजाय, हर अध्याय का एक सटीक, संक्षिप्त सारांश लिखता है और उसे किताब की एक विशेष जेब में रख देता है। रोबोट को कहानी के हर शब्द को पढ़ने और हर पिक्सेल को देखने के लिए मजबूर करने के बजाय (जो कि 280,000-टोकन की एक विशाल कहानी है!), VLZip छवियों और टेक्स्ट को छोटे, सूचना-समृद्ध "सॉफ्ट प्रीफिक्स" (soft prefixes) में संकुचित कर देता है। ये केवल रैंडम नोट्स नहीं हैं; ये कहानी के मुख्य विचारों के हाई-डेफिनिशन स्नैपशॉट की तरह हैं, जो रोबोट की सोचने की प्रक्रिया के विभिन्न स्तरों के लिए विशेष रूप से व्यवस्थित किए गए हैं।

यह कैसे काम करता है: VLZip छवियों और टेक्स्ट के एक लंबे अनुक्रम को लेता है और उन्हें टुकड़ों में तोड़ देता है। प्रत्येक टुकड़े के लिए, यह सबसे महत्वपूर्ण दृश्य और पाठ्य विवरणों को टोकन के एक संक्षिप्त सेट में निकालने के लिए एक विशेष टूल का उपयोग करता है। महत्वपूर्ण बात यह है कि यह जानकारी को केवल एक स्थान पर नहीं सिकोड़ता है; यह इन संकुचित सारांशों को रोबोट के मस्तिष्क की प्रत्येक परत में इंजेक्ट करता है जब वह कहानी को प्रोसेस करता है। यह एक टूर गाइड की तरह है जो रोबोट के कान में हर कदम पर कहानी के मुख्य बिंदुओं को फुसफुसाता है, यह सुनिश्चित करते हुए कि वह कथा के सूत्र को कभी न खोए, भले ही वास्तविक अनुक्रम बहुत छोटा क्यों न हो।

इसके परिणाम प्रभावशाली हैं। शोधकर्ताओं ने दिखाया कि VLZip के साथ, रोबोट को 120,000 टोकन तक के अनुक्रमों पर प्रशिक्षित किया जा सकता है—जो मानक मॉडलों की तुलना में 6 गुना अधिक है—और यह वास्तव में 280,000 टोकन से भी लंबे अनुक्रमों को समझ (पढ़ और उत्तर दे) सकता है। जबकि अन्य तरीके इस लंबाई पर क्रैश हो जाते हैं या मेमोरी खत्म होने का शिकार हो जाते हैं, VLZip रोबोट को सुचारू रूप से चलाता रहता है, और काफी कम मेमोरी का उपयोग करता है। वास्तव में, इसका डिज़ाइन इतना कुशल है कि यह भविष्य में 2 मिलियन टोकन तक संभालने का एक स्पष्ट मार्ग दिखाता है।

यह साबित करने के लिए कि यह केवल आसान परीक्षणों वाली विधि नहीं थी, टीम ने एक नया बेंचमार्क भी बनाया जिसे LongVLBench कहा जाता है। पिछले परीक्षणों के विपरीत, जो केवल रोबोट को घास के ढेर में एक विशिष्ट सुई खोजने (एक सरल तथ्य खोजने वाला कार्य) के लिए कहते थे, LongVLBench वास्तविक वीडियो नैरेटिव का उपयोग करता है। यह रोबोट को पूरी कहानी, पात्रों की परस्पर क्रिया और समय के साथ घटनाओं के प्रवाह को समझने के लिए मजबूर करता है। इस चुनौतीपूर्ण परीक्षण पर, VLZip ने न केवल जीत हासिल की; बल्कि इसने एक नया मानक स्थापित किया, जहाँ इसने अगले सर्वश्रेष्ठ मॉडल के 33.1 के मुकाबले 61.9 स्कोर किया, और यह सबसे लंबे, सबसे जटिल कहानियों पर भी मजबूत प्रदर्शन बनाए रखता रहा जहाँ अन्य मॉडल पूरी तरह से विफल हो गए।

यह पेपर तर्क देता है कि यह दृष्टिकोण एक गेम-चेंजर है क्योंकि यह चित्रों और शब्दों दोनों के संपीड़न (compression) को एकीकृत करता है, जिसे पिछले तरीकों ने अनदेखा किया या खराब तरीके से संभाला। अपने शक्तिशाली "ट्रांसफॉर्मर" मस्तिष्क को बरकरार रखते हुए लेकिन इसे लंबे इनपुट को संभालने का एक स्मार्ट तरीका देकर, VLZip सुझाव देता है कि हमें दक्षता के लिए बुद्धिमत्ता का त्याग करने की आवश्यकता नहीं है। यह साबित करता है कि सही संपीड़न रणनीति के साथ, AI अंततः वास्तविक दुनिया की मानवीय गतिविधियों (जैसे विस्तृत मैनुअल का पालन करना या घंटों के वीडियो फुटेज का विश्लेषण करना) के लंबे, जटिल, इंटरलीव्ड नैरेटिव को बिना अभिभूत हुए समझने में सक्षम हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →