← नवीनतम पेपर
🤖 machine learning

A More Word-like Image Tokenization for MLLMs

यह शोध पत्र डिसेंटेंगल्ड विजुअल टोकेनाइजेशन (DiVT) का प्रस्ताव करता है, जो एक नवीन विधि है जो इमेज पैच एम्बेडिंग्स को सुसंगत सिमेंटिक इकाइयों में क्लस्टर करती है और इमेज की जटिलता के आधार पर टोकन बजट को गतिशील रूप से समायोजित करती है, जिससे मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को काफी कम मेमोरी और लेटेंसी लागत के साथ विजुअल इनपुट्स को अधिक कुशलता से और अनुकूल रूप से प्रोसेस करने में सक्षम बनाया जा सके।

मूल लेखक: Hyun Lee, Hyemin Jeong, Yejin Kim, Hyungwook Choi, Hyunsoo Cho, Soo Kyung Kim, Joonseok Lee

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyun Lee, Hyemin Jeong, Yejin Kim, Hyungwook Choi, Hyunsoo Cho, Soo Kyung Kim, Joonseok Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बहुत ही शाब्दिक (literal) रोबोट (एक लार्ज लैंग्वेज मॉडल) को यह सिखाने की कोशिश कर रहे हैं कि चित्रों को कैसे "देखा" जाए। वर्तमान में, हम यह काम थोड़ा अनाड़ी तरीके से करते हैं।

समस्या: "ग्रिड" बनाम "कहानी"

एक मानक डिजिटल फोटो को छोटे-छोटे वर्गाकार टुकड़ों (पिक्सेल) के एक विशाल ग्रिड के रूप में सोचें। अभी, जब हम किसी रोबोट को फोटो देते हैं, तो हम छवि को निश्चित आकार के वर्गों (जैसे शतरंज के बोर्ड की तरह) में काट देते हैं और रोबोट को उन वर्गों की एक लंबी, उबाऊ सूची थमा देते हैं।

  • रोबोट का दृष्टिकोण: रोबोट शब्दों को पढ़ने का आदी है। शब्द अलग-अलग, अर्थपूर्ण इकाइयाँ होते हैं (जैसे "बिल्ली," "दौड़ना," या "नीला")।
  • वर्तमान तरीका: रोबोट को "वर्ग-1," "वर्ग-2," "वर्ग-3" की एक लंबी, दोहराव वाली सूची पढ़ने के लिए मजबूर किया जाता है, भले ही वे सभी वर्ग केवल खाली आकाश या एक ही दीवार का हिस्सा क्यों न हों।
  • परिणाम: रोबोट अनावश्यक डेटा की बाढ़ से अभिभूत हो जाता है। यह एक सुंदर पेंटिंग का वर्णन करने की कोशिश करने जैसा है जैसे कि फ्रेम की हर एक ईंट के रंग को सूचीबद्ध करना, बजाय इसके कि यह कहा जाए "एक लाल गुलाब।" यह रोबोट की मेमोरी को बर्बाद करता है और उसे धीमा बनाता है।

समाधान: DiVT (डिसेन्टैंगल्ड विजुअल टोकनाइजेशन)

इस शोध पत्र के लेखक DiVT नामक एक नई विधि प्रस्तावित करते हैं। छवि को एक कठोर ग्रिड में काटने के बजाय, DiVT एक स्मार्ट संपादक की तरह काम करता है जो चित्र को देखता है और कहता है, "ठीक है, यहाँ वास्तव में महत्वपूर्ण चीजें क्या हैं?"

यह इस प्रकार काम करता है, एक सरल उदाहरण के साथ:

1. "समूहीकरण" का खेल (क्लस्टरिंग)
कल्पना कीजिए कि आपके पास बिखले हुए खिलौनों से भरा एक अस्त-व्यस्त कमरा है।

  • पुराना तरीका: आप हर एक खिलौने को एक-एक करके उठाते हैं और बिना यह देखे कि वह लेगो (Lego) है, गुड़िया है या मोजा है, उन्हें एक बॉक्स में रख देते हैं। आप अंत में 500 छोटे बॉक्स बना देते हैं।
  • DiVT का तरीका: आप खिलौनों को देखते हैं और उन्हें उनके प्रकार के आधार पर समूहों में बांटते हैं। आप सभी लेगो को एक ढेर में रखते हैं, सभी गुड़ियों को दूसरे ढेर में, और मोजों को तीसरे ढेर में। आप केवल प्रत्येक विशिष्ट समूह के लिए एक "टोकन" (एक बॉक्स) बनाते हैं।
    • यदि कमरा खाली है, तो आप केवल कुछ ही बॉक्स बनाएंगे।
    • यदि कमरा जटिल खिलौनों से भरा है, तो आप अधिक बॉक्स बनाएंगे।
    • जादू: बॉक्सों की संख्या अपने आप इस बात पर निर्भर करती है कि कमरा कितना "व्यस्त" है।

2. "स्मार्ट सारांश" (टोकन फॉर्मूलेशन)
एक बार समूह बन जाने के बाद, DiVT केवल खिलौनों को बॉक्स में नहीं डालता। यह प्रत्येक समूह के लिए एक एकल, सटीक सारांश बनाता है।

  • रोबोट को "बिल्ली के फर" के 500 पैच भेजने के बजाय, यह एक टोकन भेजता है जो कहता है "बिल्ली"।
  • रोबोट को "नीले आकाश" के 100 पैच भेजने के बजाय, यह एक टोकन भेजता है जो कहता है "आकाश"।
  • महत्वपूर्ण रूप से, यह छोटी, अनूठी बारीकियों (जैसे कोने में एक छोटा पक्षी) को अपने अलग टोकन के रूप में रखता है, ताकि कोई भी महत्वपूर्ण चीज़ खो न जाए।

3. "वॉल्यूम नॉब" (ग्रैनुलैरिटी कंट्रोल)
शोधकर्ताओं ने एक विशेष नॉब (जिसे थ्रेशोल्ड कहा जाता है) जोड़ा है जो आपको यह तय करने की अनुमति देता है कि आप सारांश को कितना विस्तृत रखना चाहते हैं।

  • इसे ऊपर घुमाएं: आपको बहुत विस्तृत विवरण मिलते हैं (कई छोटे समूह), जो जटिल छवियों के लिए बहुत अच्छा है लेकिन इसमें अधिक मेमोरी लगती है।
  • इसे नीचे घुमाएं: आपको व्यापक सारांश मिलते (कम, बड़े समूह), जो बहुत तेज़ है और मेमोरी बचाता है।
  • सबसे अच्छी बात: आप इस नॉब को रोबोट को प्रशिक्षित करने के बाद भी घुमा सकते हैं। आपको रोबोट को फिर से सिखाने की आवश्यकता नहीं है; आप बस अपनी आवश्यकताओं के अनुसार सेटिंग बदल देते हैं।

यह क्यों महत्वपूर्ण है (परिणाम)

इस शोध पत्र ने चित्रों के बारे में प्रश्न पूछने से लेकर दृश्यों का वर्णन करने तक कई कार्यों पर इस नई विधि का परीक्षण किया।

  • गति और दक्षता: DiVT ने पुराने तरीकों के समान (या बेहतर) परिणाम प्राप्त किए, जबकि इसने काफी कम टोकन का उपयोग किया। कुछ परीक्षणों में, इसने पुराने तरीके की तुलना में 1/10 से भी कम डेटा का उपयोग किया।
  • कम भ्रम: क्योंकि टोकन वास्तविक अवधारणाओं (जैसे "एक कप" या "एक पेड़") का प्रतिनिधित्व करते हैं (न कि यादृच्छिक ग्रिड वर्गों का), रोबोट चित्र को बहुत बेहतर तरीके से समझता है।
  • पुनः प्रशिक्षण की आवश्यकता नहीं: आप इस विधि का उपयोग विभिन्न प्रकार के कैमरों (विज़न एनकोडर) और विभिन्न रोबोट दिमागों (LLM) के साथ कर सकते हैं, बिना पूरे सिस्टम को फिर से बनाए।

मुख्य निष्कर्ष

यह शोध पत्र दावा करता है कि छवियों को एक कठोर ग्रिड वर्ग (स्प्रेडशीट) के बजाय एक कहानी (सार्थक अवधारणाओं के समूहीकरण) की तरह मानकर, हम AI विजन को तेज़, सस्ता और स्मार्ट बना सकते हैं। यह एक किताब को अक्षर-दर-अक्षर पढ़ने के बजाय शब्द-दर-शब्द पढ़ने में स्विच करने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →