← नवीनतम पेपर
🤖 machine learning

InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs

यह शोध पत्र InfoTok का प्रस्ताव करता है, जो सूचना बाधा (Information Bottleneck) सिद्धांत पर आधारित एक सूचना-सैद्धांतिक नियमितीकरण ढांचा है, जो संपीड़न और कार्य प्रासंगिकता के बीच संतुलन बनाने के लिए पारस्परिक सूचना बाधाओं को लागू करके एकीकृत मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में साझा दृश्य टोकनाइज़ेशन को अनुकूलित करता है, जिससे बिना किसी अतिरिक्त प्रशिक्षण डेटा की आवश्यकता के इमेज अंडरस्टैंडिंग और जनरेशन दोनों में सुधार होता है।

मूल लेखक: Lv Tang, Tianyi Zheng, Bo Li, Xingyu Li

प्रकाशित 2026-04-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lv Tang, Tianyi Zheng, Bo Li, Xingyu Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ InfoTok पेपर का विवरण दिया गया है, जिसे सरल अवधारणाओं, रोज़मर्रा की भाषा और रचनात्मक उपमाओं (analogies) में विभाजित किया गया है।

बड़ी तस्वीर: "स्विस आर्मी नाइफ" वाली समस्या

कल्पना कीजिए कि आप एक स्विस आर्मी नाइफ बना रहे हैं जो दो बहुत अलग कामों के लिए एक बेहतरीन उपकरण होना चाहिए:

  1. जासूस (The Detective): इसे अपराध स्थल की फोटो को देखकर यह समझना चाहिए कि क्या हुआ (समझना/Understanding)।
  2. कलाकार (The Artist): इसे एक विवरण को देखकर शून्य से एक नई तस्वीर बनानी चाहिए (निर्माण/Generation)।

AI की दुनिया में, इन "स्विस आर्मी नाइफ" को यूनिफाइड मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) कहा जाता है। वे एक ही सेट "विजुअल टोकन्स" (इमेज को दर्शाने वाले डिजिटल बिल्डिंग ब्लॉक्स) का उपयोग करके ये दोनों काम करने की कोशिश करते हैं।

समस्या:
"जासूस" वाले काम को अर्थ (meaning) की परवाह होती है (जैसे, "वह एक चटाई पर बैठा बिल्ली है")। "कलाकार" वाले काम को बारीकियों (details) की परवाह होती है (जैसे, फर का सटीक रंग, चटाई की बनावट, रोशनी)।

वर्तमान में, ये मॉडल एक ऐसे शेफ की तरह हैं जो एक ही बर्तन में एक साथ एक नाजुक सूफ़ले (soufflé) और एक भारी स्टू (stew) पकाने की कोशिश कर रहा है। परिणाम अक्सर गड़बड़ होता है: मॉडल या तो बारीकियों को भूल जाता है (खराब कला) या अर्थ समझने में भ्रमित हो जाता है (खराब जासूसी)। मौजूदा समाधान इसे दो अलग-अलग बर्तन (दो अलग एनकोडर) बनाकर ठीक करने की कोशिश करते हैं, लेकिन इससे रसोई (कंप्यूटर आर्किटेक्चर) बहुत बड़ी और जटिल हो जाती है।

समाधान: InfoTok (द "स्मार्ट फिल्टर")

इस पेपर के लेखक InfoTok नामक एक नई विधि प्रस्तावित करते हैं। एक बड़ा बर्तन बनाने के बजाय, वे मौजूदा बर्तन में एक स्मार्ट फिल्टर लगाते हैं।

सोचिए कि विजुअल टोकनाइज़र एक बॉटलनेक (bottleneck) या एक संकुचित बिंदु की तरह है। इसे एक विशाल, हाई-डेफिनिशन इमेज (लाखों पिक्सेल) को बहुत कम संख्या में "टोकन्स" (जैसे टेक्स्ट की कुछ पंक्तियाँ) में दबाना होता है ताकि AI मस्तिष्क इसे प्रोसेस कर सके।

पुराना तरीका:
पुराने मॉडल इस बॉटलनेक के माध्यम से सब कुछ दबाने की कोशिश करते थे। उन्होंने महत्वपूर्ण अर्थ को तो रखा, लेकिन बहुत सारा बेकार "शोर" (रैंडम पिक्सेल भिन्नता, बैकग्राउंड स्टैटिक) भी रख लिया। इसने बहुत सारी जगह बर्बाद कर दी, जिससे चित्र बनाने के लिए आवश्यक बारीक विवरणों के लिए कोई जगह नहीं बची।

InfoTok का तरीका:
InfoTok एक क्लब के सख्त बाउंसर (bouncer) की तरह काम करता है। यह इन्फॉर्मेशन बॉटलनेक प्रिंसिपल (Information Bottleneck Principle) नामक एक नियम का उपयोग करता है।

  • नियम: "आप केवल वही जानकारी ला सकते हैं जो पार्टी (कार्य) के लिए उपयोगी है। यदि यह केवल रैंडम शोर या अनावश्यक विवरण है, तो आपको दरवाजे पर ही रुकना होगा।"

InfoTok कैसे काम करता है (तीन नियम)

InfoTok AI को तीन विशिष्ट नियमों का पालन करके बॉटलनेक के माध्यम से इमेज को दबाना सिखाता है:

  1. कॉम्पैक्ट होना (द "पैकिंग" नियम):

    • उपमा: कल्पना कीजिए कि आप यात्रा के लिए एक सूटकेस पैक कर रहे हैं, लेकिन सूटकेस बहुत छोटा है। आप अपना पूरा वार्डरोब नहीं ले जा सकते। आपको उन मोजों को फेंकना होगा जिनकी जरूरत नहीं है और अतिरिक्त जूतों को भी।
    • AI में: InfoTok AI को "हाई-एन्ट्रॉपी" शोर (रैंडम पिक्सेल अराजकता) को हटाने के लिए मजबूर करता है ताकि टोकन छोटे और कुशल रहें।
  2. पर्याप्त होना (द "सर्वाइवल" नियम):

    • उपमा: भले ही आपका सूटकेस छोटा हो, लेकिन आपको पासपोर्ट और टिकट जरूर रखना होगा। यदि आप उन्हें फेंक देते हैं, तो आप यात्रा नहीं कर पाएंगे।
    • AI में: AI को "अर्थ" (जासूस के लिए) और "विजुअल क्यूज़" (कलाकार के लिए) को बनाए रखना होगा। यह उस चीज़ को नहीं फेंक सकता जो छवि को पहचानने योग्य या चित्रित करने योग्य बनाती है।
  3. एलाइन (Aligned) होना (द "अनुवाद" नियम):

    • उपमा: यदि आप एक अलग भाषा बोलने वाले दोस्त के साथ यात्रा के लिए पैकिंग कर रहे हैं, तो आपको यह सुनिश्चित करना होगा कि आपकी पैकिंग लिस्ट उनकी अपेक्षाओं से मेल खाती हो।
    • AI में: विजुअल टोकन्स को टेक्स्ट टोकन्स की "भाषा बोलनी" चाहिए। यह सुनिश्चित करता है कि AI समझता है कि "कुत्ता" शब्द कुत्ते की तस्वीर से मेल खाता है, जिससे पूरा सिस्टम सुचारू रूप से काम करता है।

गुप्त नुस्खा: "बाउंसर की नोटबुक"

AI को कैसे पता चलता है कि क्या रखना है और क्या फेंकना है? यह पेपर म्युचुअल इंफॉर्मेशन (Mutual Information) नामक एक गणितीय अवधारणा का उपयोग करता है।

कल्पना कीजिए कि AI के पास एक बाउंसर की नोटबुक है।

  • यह पूछता है: "यह विशिष्ट पिक्सेल मुझे अंतिम उत्तर के बारे में कितनी जानकारी देता है?"
  • यदि पिक्सेल केवल रैंडम स्टैटिक है, तो नोटबुक कहती है: "शून्य। इसे बाहर निकालो।"
  • यदि पिक्सेल बिल्ली के कान का हिस्सा है, तो नोटबुक कहती है: "उच्च मूल्य। इसे रखो!"

पेपर इस "मूल्य" को कैलकुलेट करने का एक तरीका पेश करता है जिसके लिए सुपरकंप्यूटर की आवश्यकता नहीं है। वे दो व्यावहारिक उपकरणों (VIB और HSIC) का उपयोग करते हैं जो एक "वैल्यू मीटर" की तरह काम करते हैं, जो यह मापता है कि कितना उपयोगी डेटा बॉटलनेक से गुजर रहा है।

परिणाम: एक बेहतर चाकू, कोई नए हिस्से नहीं

लेखकों ने इस "स्मार्ट फिल्टर" का परीक्षण तीन अलग-अलग AI मॉडल्स पर किया। उन्होंने न तो नया डेटा जोड़ा और न ही हार्डवेयर बदला। उन्होंने बस InfoTok फिल्टर लागू किया।

परिणाम:

  • बेहतर जासूसी कार्य: मॉडल छवियों के बारे में सवालों के जवाब देने में बहुत बेहतर हो गए।
  • बेहतर कला: मॉडल निर्देशों का पालन करने वाली छवियां बनाने में बहुत बेहतर हो गए (जैसे, "एक नीले कुत्ते के बगल में लाल कार बनाओ")।
  • जादू: मॉडल अधिक संतुलित हो गए। उन्हें एक अच्छा जासूस होने या एक अच्छा कलाकार होने के बीच चुनाव नहीं करना पड़ा; वे दोनों में माहिर बन गए।

एक वाक्य में सारांश

InfoTok AI इमेज प्रोसेसिंग के लिए एक स्मार्ट "बाउंसर" है जो मॉडल को बेकार विजुअल शोर को फेंकने और केवल सबसे महत्वपूर्ण, पुन: प्रयोज्य जानकारी को रखने के लिए मजबूर करता है, जिससे एक अकेला AI बिना किसी अतिरिक्त हार्डवेयर के एक शानदार जासूस और एक प्रतिभाशाली कलाकार दोनों बन पाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →