A More Word-like Image Tokenization for MLLMs
यह शोध पत्र डिसेंटेंगल्ड विजुअल टोकेनाइजेशन (DiVT) का प्रस्ताव करता है, जो एक नवीन विधि है जो इमेज पैच एम्बेडिंग्स को सुसंगत सिमेंटिक इकाइयों में क्लस्टर करती है और इमेज की जटिलता के आधार पर टोकन बजट को गतिशील रूप से समायोजित करती है, जिससे मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को काफी कम मेमोरी और लेटेंसी लागत के साथ विजुअल इनपुट्स को अधिक कुशलता से और अनुकूल रूप से प्रोसेस करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बहुत ही शाब्दिक (literal) रोबोट (एक लार्ज लैंग्वेज मॉडल) को यह सिखाने की कोशिश कर रहे हैं कि चित्रों को कैसे "देखा" जाए। वर्तमान में, हम यह काम थोड़ा अनाड़ी तरीके से करते हैं।
समस्या: "ग्रिड" बनाम "कहानी"
एक मानक डिजिटल फोटो को छोटे-छोटे वर्गाकार टुकड़ों (पिक्सेल) के एक विशाल ग्रिड के रूप में सोचें। अभी, जब हम किसी रोबोट को फोटो देते हैं, तो हम छवि को निश्चित आकार के वर्गों (जैसे शतरंज के बोर्ड की तरह) में काट देते हैं और रोबोट को उन वर्गों की एक लंबी, उबाऊ सूची थमा देते हैं।
- रोबोट का दृष्टिकोण: रोबोट शब्दों को पढ़ने का आदी है। शब्द अलग-अलग, अर्थपूर्ण इकाइयाँ होते हैं (जैसे "बिल्ली," "दौड़ना," या "नीला")।
- वर्तमान तरीका: रोबोट को "वर्ग-1," "वर्ग-2," "वर्ग-3" की एक लंबी, दोहराव वाली सूची पढ़ने के लिए मजबूर किया जाता है, भले ही वे सभी वर्ग केवल खाली आकाश या एक ही दीवार का हिस्सा क्यों न हों।
- परिणाम: रोबोट अनावश्यक डेटा की बाढ़ से अभिभूत हो जाता है। यह एक सुंदर पेंटिंग का वर्णन करने की कोशिश करने जैसा है जैसे कि फ्रेम की हर एक ईंट के रंग को सूचीबद्ध करना, बजाय इसके कि यह कहा जाए "एक लाल गुलाब।" यह रोबोट की मेमोरी को बर्बाद करता है और उसे धीमा बनाता है।
समाधान: DiVT (डिसेन्टैंगल्ड विजुअल टोकनाइजेशन)
इस शोध पत्र के लेखक DiVT नामक एक नई विधि प्रस्तावित करते हैं। छवि को एक कठोर ग्रिड में काटने के बजाय, DiVT एक स्मार्ट संपादक की तरह काम करता है जो चित्र को देखता है और कहता है, "ठीक है, यहाँ वास्तव में महत्वपूर्ण चीजें क्या हैं?"
यह इस प्रकार काम करता है, एक सरल उदाहरण के साथ:
1. "समूहीकरण" का खेल (क्लस्टरिंग)
कल्पना कीजिए कि आपके पास बिखले हुए खिलौनों से भरा एक अस्त-व्यस्त कमरा है।
- पुराना तरीका: आप हर एक खिलौने को एक-एक करके उठाते हैं और बिना यह देखे कि वह लेगो (Lego) है, गुड़िया है या मोजा है, उन्हें एक बॉक्स में रख देते हैं। आप अंत में 500 छोटे बॉक्स बना देते हैं।
- DiVT का तरीका: आप खिलौनों को देखते हैं और उन्हें उनके प्रकार के आधार पर समूहों में बांटते हैं। आप सभी लेगो को एक ढेर में रखते हैं, सभी गुड़ियों को दूसरे ढेर में, और मोजों को तीसरे ढेर में। आप केवल प्रत्येक विशिष्ट समूह के लिए एक "टोकन" (एक बॉक्स) बनाते हैं।
- यदि कमरा खाली है, तो आप केवल कुछ ही बॉक्स बनाएंगे।
- यदि कमरा जटिल खिलौनों से भरा है, तो आप अधिक बॉक्स बनाएंगे।
- जादू: बॉक्सों की संख्या अपने आप इस बात पर निर्भर करती है कि कमरा कितना "व्यस्त" है।
2. "स्मार्ट सारांश" (टोकन फॉर्मूलेशन)
एक बार समूह बन जाने के बाद, DiVT केवल खिलौनों को बॉक्स में नहीं डालता। यह प्रत्येक समूह के लिए एक एकल, सटीक सारांश बनाता है।
- रोबोट को "बिल्ली के फर" के 500 पैच भेजने के बजाय, यह एक टोकन भेजता है जो कहता है "बिल्ली"।
- रोबोट को "नीले आकाश" के 100 पैच भेजने के बजाय, यह एक टोकन भेजता है जो कहता है "आकाश"।
- महत्वपूर्ण रूप से, यह छोटी, अनूठी बारीकियों (जैसे कोने में एक छोटा पक्षी) को अपने अलग टोकन के रूप में रखता है, ताकि कोई भी महत्वपूर्ण चीज़ खो न जाए।
3. "वॉल्यूम नॉब" (ग्रैनुलैरिटी कंट्रोल)
शोधकर्ताओं ने एक विशेष नॉब (जिसे थ्रेशोल्ड कहा जाता है) जोड़ा है जो आपको यह तय करने की अनुमति देता है कि आप सारांश को कितना विस्तृत रखना चाहते हैं।
- इसे ऊपर घुमाएं: आपको बहुत विस्तृत विवरण मिलते हैं (कई छोटे समूह), जो जटिल छवियों के लिए बहुत अच्छा है लेकिन इसमें अधिक मेमोरी लगती है।
- इसे नीचे घुमाएं: आपको व्यापक सारांश मिलते (कम, बड़े समूह), जो बहुत तेज़ है और मेमोरी बचाता है।
- सबसे अच्छी बात: आप इस नॉब को रोबोट को प्रशिक्षित करने के बाद भी घुमा सकते हैं। आपको रोबोट को फिर से सिखाने की आवश्यकता नहीं है; आप बस अपनी आवश्यकताओं के अनुसार सेटिंग बदल देते हैं।
यह क्यों महत्वपूर्ण है (परिणाम)
इस शोध पत्र ने चित्रों के बारे में प्रश्न पूछने से लेकर दृश्यों का वर्णन करने तक कई कार्यों पर इस नई विधि का परीक्षण किया।
- गति और दक्षता: DiVT ने पुराने तरीकों के समान (या बेहतर) परिणाम प्राप्त किए, जबकि इसने काफी कम टोकन का उपयोग किया। कुछ परीक्षणों में, इसने पुराने तरीके की तुलना में 1/10 से भी कम डेटा का उपयोग किया।
- कम भ्रम: क्योंकि टोकन वास्तविक अवधारणाओं (जैसे "एक कप" या "एक पेड़") का प्रतिनिधित्व करते हैं (न कि यादृच्छिक ग्रिड वर्गों का), रोबोट चित्र को बहुत बेहतर तरीके से समझता है।
- पुनः प्रशिक्षण की आवश्यकता नहीं: आप इस विधि का उपयोग विभिन्न प्रकार के कैमरों (विज़न एनकोडर) और विभिन्न रोबोट दिमागों (LLM) के साथ कर सकते हैं, बिना पूरे सिस्टम को फिर से बनाए।
मुख्य निष्कर्ष
यह शोध पत्र दावा करता है कि छवियों को एक कठोर ग्रिड वर्ग (स्प्रेडशीट) के बजाय एक कहानी (सार्थक अवधारणाओं के समूहीकरण) की तरह मानकर, हम AI विजन को तेज़, सस्ता और स्मार्ट बना सकते हैं। यह एक किताब को अक्षर-दर-अक्षर पढ़ने के बजाय शब्द-दर-शब्द पढ़ने में स्विच करने जैसा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।