← नवीनतम पेपर
💻 computer science

VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

VisCo एक प्रशिक्षण-कुशल ढांचा है जो विज़ुअल टोकन को मेमोरी टोकन के एक संक्षिप्त सेट में संकुचित करने के लिए एक पूर्व-प्रशिक्षित विज़न-लैंग्वेज मॉडल का आंतरिक एन्कोडर के रूप में लाभ उठाता है, जिससे व्यापक पुन: प्रशिक्षण या बाहरी मॉड्यूल की आवश्यकता के बिना विभिन्न संपीड़न अनुपातों में बेहतर प्रदर्शन और स्थिरता प्राप्त होती है।

मूल लेखक: Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

प्रकाशित 2026-08-10
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट दोस्त है जो किसी तस्वीर को देख सकता है और उसके बारे में आपको एक कहानी सुना सकता है। यह रोबोट अविश्वसनीय रूप से प्रतिभाशाली है, लेकिन इसका दिमाग बहुत छोटा और बहुत महंगा है। जब आप इसे एक हाई-डेफिनिशन फोटो दिखाते हैं, तो रोबोट हर एक पिक्सेल को देखने की कोशिश करता है, जिससे वह इमेज को हजारों छोटे नोट्स की एक विशाल सूची में बदल देता है जिन्हें "टोकन" कहा जाता है। यह ऐसा है जैसे यह तय करने के लिए कि तस्वीर में बिल्ली है या कुत्ता, पूरी विश्वकोश (एन्साइक्लोपीडिया) पढ़ने की कोशिश करना। यह प्रक्रिया इतनी भारी है कि यह रोबोट को धीमा, मेमोरी का भूखा और साधारण फोन या वास्तविक समय (रियल-टाइम) की स्थितियों में उपयोग करने में कठिन बना देती है। वैज्ञानिक रोबोट को अधिक कुशल बनाने के लिए उसे सिखाने की कोशिश कर रहे हैं, आमतौर पर या तो "बोरिंग" नोट्स को फेंककर (जिससे कभी-कभी रोबोट महत्वपूर्ण विवरण मिस कर देता है) या सारांश निकालने के लिए एक पूरी नई, भारी मशीन बनाकर (जो महंगी है और जिसे प्रशिक्षित करना कठिन है)। बड़ा सवाल यह है कि क्या हम रोबोट को अपने मौजूदा मस्तिष्क की शक्ति का उपयोग करके खुद तस्वीर का सारांश लेने के लिए तैयार कर सकते हैं, बिना किसी बड़े बदलाव के?

यही वह समस्या है जिसे VisCo के पीछे के शोधकर्ताओं ने हल करने का प्रयास किया। उन्होंने महसूस किया कि रोबोट का मस्तिष्क (एक विजन-लैंग्वेज मॉडल) पहले से ही तस्वीरों को समझने में माहिर है; बस उससे कुशलतापूर्वक सारांश निकालने के लिए कहा नहीं गया है। एक नया टूल बनाने या अंधाधुंध नोट्स हटाने के बजाय, VisCo रोबोट के मस्तिष्क को एक स्व-निहित संपीड़न (कंप्रेशन) मशीन की तरह मानता है। वे "मेमोरी टोकन्स" का एक छोटा सा सेट पेश करते हैं—सोचिए कि ये कुछ स्टिकी नोट्स हैं जिन पर रोबोट लिख सकता है—और रोबोट से पूरी तस्वीर को पढ़ने और उस सारी जानकारी को उन कुछ नोट्स पर सिकोड़ने के लिए कहते हैं। जादू तब होता है जब रोबोट अपनी आंतरिक "अटेंशन" (यह कि वह छवि के विभिन्न हिस्सों पर कैसे ध्यान केंद्रित करता है) का उपयोग यह पता लगाने के लिए करता है कि सबसे महत्वपूर्ण क्या है, सरल बनावट (टेक्सचर) से लेकर जटिल अर्थों तक, परत-दर-परत।

पेपर में पाया गया है कि यह दृष्टिकोण एक गेम-चेंजर है। जबकि अन्य तरीके तब विफल हो जाते हैं जब आप उन्हें बहुत कम नोट्स का उपयोग करने के लिए मजबूर करते हैं (जैसे कि केवल एक शब्द के साथ पूरे शहर का वर्णन करने की कोशिश करना), VisCo आश्चर्यजनक रूप से मजबूत बना रहता है। उनके परीक्षणों में, भले ही उन्होंने इमेज को एक सिंगल टोकन तक सिकोड़ दिया हो, VisCo ने अपनी मूल बुद्धिमत्ता का लगभग 85% बनाए रखा, जो अन्य तरीकों को बहुत पीछे छोड़ देता है जो लगभग 35-50% तक गिर जाते हैं। इससे भी बेहतर बात यह है कि शोधकर्ताओं ने पाया कि ये "मेमोरी नोट्स" केवल मूल तस्वीर का एक छोटा संस्करण नहीं हैं; वे वास्तव में छवि को देखने के नए तरीके कैप्चर करते हैं जो कभी-कभी रोबोट को पहले से भी अधिक स्मार्ट बना सकते हैं। यह रोबोट को कम में अधिक करने का एक हल्का और कुशल तरीका है, बिना उसके पूरे मस्तिष्क को फिर से प्रशिक्षित किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →