How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
यह शोध पत्र F^3A को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) विजुअल टोकन प्रूनिंग राउटर है जो प्रूनिंग को टास्क-कंडीशन्ड एविडेंस सर्च के रूप में मानकर एक निश्चित टोकन बजट को गतिशील रूप से आवंटित करता है, जिससे बिना किसी अतिरिक्त प्रशिक्षण या मूल डिकोडिंग पाइपलाइन को बाधित किए मल्टीमॉडल मॉडल्स में इन्फरेंस लागत को कम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य प्रश्न: हमें वास्तव में तस्वीर के कितने हिस्से की आवश्यकता है?
कल्पना कीजिए कि आप एक पहेली सुलझाने की कोशिश कर रहे हैं, और कोई आपको उत्तर खोजने में मदद करने के लिए एक विशाल, हाई-रिज़ॉल्यूशन फोटो देता है। वह फोटो इतनी विस्तृत है कि इसमें लाखों छोटे-छोटे पिक्सेल हैं।
AI की दुनिया में, इन "पिक्सेल्स" को विजुअल टोकन (visual tokens) कहा जाता है। वर्तमान AI मॉडल (मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स) उन बुद्धिमान जासूसों की तरह हैं जो यह सुनिश्चित करने के लिए कि वे कोई सुराग न छोड़ दें, उस फोटो के हर एक पिक्सेल को देखना चाहते हैं। लेकिन लाखों पिक्सेल को देखने में बहुत समय लगता है और इससे बहुत अधिक बैटरी पावर (कंप्यूटिंग संसाधन) खर्च होती है।
शोधकर्ताओं ने एक सरल प्रश्न पूछा: यदि हमारे पास समय और ऊर्जा सीमित है, तो सही उत्तर प्राप्त करने के लिए हमें वास्तव में उन पिक्सेल्स में से कितने को रखने की आवश्यकता है?
वर्तमान विधियों के साथ समस्या: "वन-शॉट" अनुमान
अभी, अधिकांश AI सिस्टम एक "वन-शॉट" नियम का उपयोग करके पिक्सेल्स की संख्या को कम करने की कोशिश करते हैं। वे फोटो को एक बार देखते हैं और कहते हैं, "ओह, यह हिस्सा चमकीला है, इसलिए यह महत्वपूर्ण है," या "यह हिस्सा धुंधला है, इसलिए इसे फेंक देते हैं।"
लेखकों का तर्क है कि यह घास के ढेर में एक विशिष्ट सुई खोजने की कोशिश करने जैसा है जहाँ आप केवल घास की ऊपरी परत को देखते हैं। यदि सुई गहराई में छिपी है या उसका रंग फीका है, तो एक साधारण "चमक" (brightness) की जांच उसे मिस कर देगी। वे इसे स्टैटिक रैंकिंग (static ranking) कहते हैं। इसे इस बात की परवाह नहीं है कि विशिष्ट प्रश्न क्या है; यह केवल सामान्य नियमों के आधार पर अनुमान लगाता है।
समाधान: F3A (फ्रूट-फ्लाई स्ट्रैटेजी)
यह पेपर एक नई विधि पेश करता है जिसे F3A (फ्रूट-फ्लाई-फोरेजिंग एल्गोरिदम) कहा जाता है। इसे समझने के लिए, एक फल की मक्खी (fruit fly) की कल्पना करें जो सड़ते हुए फल की तलाश कर रही है।
गंध (Odor Field): एक फल की मक्खी केवल फल को नहीं देखती; वह हवा में गंध लेती है। वह एक "मैप" बनाती है कि गंध कहाँ सबसे अधिक प्रबल है।
- AI में: केवल इमेज को देखने के बजाय, AI पहले प्रश्न को पढ़ता है। यह प्रश्न में पूछी गई चीज़ों के आधार पर एक "गंध मैप" बनाता है। यदि प्रश्न है "टोपी का रंग क्या है?", तो AI जानता है कि उसे केवल चमकीले स्थानों के लिए नहीं, बल्कि टोपी के लिए "सूंघना" है।
तीन-चरणीय शिकार (The Three-Step Hunt): मक्खी बेतरतीब ढंग से नहीं उतरती। वह एक स्मार्ट रणनीति का उपयोग करती है:
- चरण 1: कोर्स सर्च (व्यापक जाल - The Wide Net): मक्खी ऊँचा उड़ती है और उस सामान्य क्षेत्र की तलाश करती है जहाँ गंध तेज होती है। वह अभी तक एक अकेला पत्ता नहीं चुनती; वह एक पूरा टहनी चुनती है।
- AI में: सिस्टम इमेज के बड़े हिस्सों को देखता है ताकि प्रश्न से संबंधित सामान्य क्षेत्रों को खोजा जा सके।
- चरण 2: विजुअल लॉक-ऑन (ज़ूम करना - The Zoom): एक बार जब उसे एक आशाजनक टहनी मिल जाती है, तो वह उतरती है और करीब से देखती है कि क्या वास्तव में वहाँ फल है या वह केवल एक पत्ता है जो फल जैसी गंध दे रहा है। यह सुनिश्चित करती है कि वह एक ही चीज़ के बगल में दो पत्ते न चुन ले (अतिरेक/redundancy से बचना)।
- AI में: सिस्टम उन विशिष्ट क्षेत्रों पर ज़ूम करता है ताकि सबसे अच्छे टोकन चुने जा सकें, यह सुनिश्चित करते हुए कि वह एक ही चीज़ को दोबारा न चुने।
- चरण 3: रेस्क्यू जंप (सुरक्षा जाल - The Safety Net): कभी-कभी फल किसी अजीब जगह पर छिपा होता है जिसे मक्खी मिस कर देती है। मक्खी का एक नियम है: "यदि मैंने अभी तक पर्याप्त फल नहीं पाया है, तो मैं बस के लिए एक रैंडम जगह पर कूद जाऊँगी।"
- AI में: यदि सिस्टम को एहसास होता है कि उसने एक छोटा लेकिन महत्वपूर्ण विवरण (जैसे कि एक छोटा टेक्स्ट लेबल या एक छोटी वस्तु) मिस कर दिया है, तो वह उन टोकन्स को "बचा" (rescue) लेता है ताकि वे खो न जाएं।
- चरण 1: कोर्स सर्च (व्यापक जाल - The Wide Net): मक्खी ऊँचा उड़ती है और उस सामान्य क्षेत्र की तलाश करती है जहाँ गंध तेज होती है। वह अभी तक एक अकेला पत्ता नहीं चुनती; वह एक पूरा टहनी चुनती है।
यह क्यों महत्वपूर्ण है: परिणाम
शोधकर्ताओं ने इस "फ्रूट-फ्लाई" रणनीति का परीक्षण कई अलग-अलग AI मॉडल्स पर किया, जिनमें छोटे (2 बिलियन पैरामीटर्स) से लेकर विशाल (235 बिलियन पैरामीटर्स) मॉडल शामिल हैं।
- "फिक्स्ड बजट" टेस्ट: उन्होंने AI को बताया, "आप तस्वीर के केवल 20% हिस्से को देख सकते हैं।"
- परिणाम: फ्रूट-फ्लाई AI (F3A) पूरी तस्वीर देखने की तुलना में 93.86% बार सही उत्तर देता है। अन्य विधियाँ (जैसे "वन-शॉट" अनुमान लगाने वाले) बहुत कम बार सही उत्तर देती हैं।
- "फिक्स्ड गोल" टेस्ट: उन्होंने AI को बताया, "आपको 97% उत्तर सही होने चाहिए, लेकिन कम से कम पिक्सेल्स का उपयोग करके।"
- परिणाम: फ्रूट-फ्लाई AI को उस लक्ष्य तक पहुँचने के लिए केवल 39.9% पिक्सेल्स की आवश्यकता थी। अगली सबसे अच्छी विधि को 50.1% पिक्सेल्स की आवश्यकता थी।
निष्कर्ष
पेपर का दावा है कि आपका ध्यान (attention) कैसे लगाया जाता है, यह आपके मॉडल के आकार से अधिक मायने रखता है।
इमेज को सामान्य नियमों के आधार पर अंधाधुंध काटने के बजाय, F3A इमेज को एक खजाने के नक्शे की तरह मानता है। यह विशिष्ट सुरागों को खोजने के लिए प्रश्न का उपयोग करके एक स्मार्ट, तीन-चरणीय खोज (गंध, लॉक-ऑन, रेस्क्यू) का उपयोग करता है। यह AI को दुनिया को समझने की अपनी क्षमता खोए बिना बहुत तेज़ और कम मेमोरी का उपयोग करने में सक्षम बनाता है।
संक्षेप में: तस्वीर के आधे हिस्से को इसलिए न फेंकें क्योंकि वह "अनावश्यक" दिखता है। आवश्यक सबूत खोजने के लिए प्रश्न का उपयोग करके एक स्मार्ट खोज का उपयोग करें, ठीक वैसे ही जैसे फल की तलाश में फल की मक्खी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।