ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
ReToken एक हल्का, एकल सीखने योग्य एम्बेडिंग (learnable embedding) है जो एक प्री-फिल्ड KV कैश से क्वेरी-प्रासंगिक विजुअल टोकन को कुशलतापूर्वक पुनर्प्राप्त करता है, जो सिंगल GPU पर कम्प्यूटेशनल रूप से व्यवहार्य रहते हुए, लॉन्ग-कॉन्टेक्स्ट इमेज और वीडियो रिट्रीवल कार्यों पर विजन-लैंग्वेज मॉडल्स के प्रदर्शन में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप घास के एक विशाल, अस्त-व्यस्त ढेर में एक विशिष्ट सुई खोजने की कोशिश कर रहे हैं। अब, कल्पना कीजिए कि यह घास का ढेर केवल घास का ढेर नहीं है, बल्कि हजारों किताबों वाला एक विशाल पुस्तकालय है, और आप एक सुपर-स्मार्ट रोबोट लाइब्रेरियन से पूरे पुस्तकालय को पढ़ने और आपके प्रश्न का उत्तर देने वाले एक वाक्य को खोजने के लिए कह रहे हैं। यह "विज़न-लैंग्वेज मॉडल्स" (VLMs) की दुनिया है, जो आर्टिफिशियल इंटेलिजेंस की एक शाखा है जो छवियों और टेक्स्ट दोनों को एक साथ समझने की कोशिश करती है।
लंबे समय से, ये रोबोट एक एकल फोटो या एक छोटी क्लिप को देखने में माहिर रहे हैं। लेकिन जब आप उन्हें एक घंटे का लंबा वीडियो या सौ फोटो का ढेर देते हैं, तो वे घबरा जाते हैं। यह वैसा ही है जैसे किसी इंसान को एक साथ हजार किताबें पढ़ने के लिए कहना; उनका मस्तिष्क (या इस मामले में, कंप्यूटर की मेमोरी) उन सबको संभाल नहीं पाता, और वे भ्रमित होने लगते हैं। वे गलत पन्ने को देख सकते हैं या सुराग को पूरी तरह से मिस कर सकते हैं क्योंकि वे सब कुछ एक साथ प्रोसेस करने की कोशिश कर रहे होते हैं। बड़ा सवाल जो वैज्ञानिक पूछ रहे हैं वह यह है: हम इन रोबोट्स को अपनी याददाश्त में बेहतर तरीके से "खोजने" के लिए कैसे प्रशिक्षित कर सकते हैं? हम उन्हें उबाऊ हिस्सों को अनदेखा करने और बिना किसी घर के आकार के सुपरकंप्यूटर की आवश्यकता के, सटीक क्षण या चित्र पर ध्यान केंद्रित करने में कैसे मदद कर सकते हैं?
यहीं पर एक नया विचार आता है जिसे ReToken कहा जाता है। एक विज़न-लैंग्वेज मॉडल को एक ऐसे जासूस के रूप में सोचें जिसे सबूतों को देखकर अपराध सुलझाने के लिए प्रशिक्षित किया गया है। आमतौर पर, जब आप जासूस को एक प्रश्न देते हैं जैसे, "लाल कार कहाँ है?", तो जासूस सभी साक्ष्यों (छवियों) को देखता है और अनुमान लगाता है कि कौन सी महत्वपूर्ण है, इसके आधार पर कि वह उस पर कितना ध्यान देता है। शोधकर्ताओं ने पाया कि यह "अटेंशन" (ध्यान) विधि वास्तव में वीडियो और छवियों के बड़े संग्रह के लिए काफी अविश्वसनीय है। यह ऐसा है जैसे जासूस पृष्ठभूमि में किसी चमकती वस्तु से विचलित हो जाए और लाल कार को पूरी तरह से मिस कर दे।
टीम ने पाया कि रोबोट के खोजने का वर्तमान तरीका थोड़ा टूटा हुआ है। उन्होंने इसका परीक्षण किया और पाया कि जब रोबोट अपने मानक "अटेंशन" संकेतों का उपयोग करके वीडियो से सही फ्रेम चुनने की कोशिश करता है, तो वह केवल 5% बार ही सही होता है। यह मूल रूप से अंधेरे में अनुमान लगाने जैसा है। उन्होंने यह भी देखा: रोबोट का "अटेंशन" वाक्य में अगले शब्द की भविष्यवाणी करने के लिए प्रशिक्षित है, न कि विशिष्ट छवियों को खोजने के लिए। इसलिए, यह एक लाइब्रेरियन बनने में बहुत अच्छा नहीं है।
इसे ठीक करने के लिए, लेखकों ने ReToken का आविष्कार किया। कल्पना कीजिए कि आपके पास एक जादुई, एकल "सर्च बटन" है जिसे आप अपने प्रश्न पर चिपका सकते हैं। रोबोट को पूरा पुस्तकालय स्कैन करने के लिए कहने के बजाय, आप उसे यह विशेष बटन देते हैं। यह बटन कोड का एक छोटा, सीखने योग्य हिस्सा है जिसका उपयोग करने के लिए रोबोट को विशेष रूप से सही चित्र की तलाश करने के लिए प्रशिक्षित किया गया है। यह उन "लेबल" या "कीज़" के बजाय जो रोबोट आमतौर पर उपयोग करता है, छवियों की "कंटेंट" (जिसे पेपर में "वैल्यू" स्पेस कहा गया है) को देखकर काम करता है।
यहाँ जादू का कमाल है: शोधकर्ताओं ने इस एकल "सर्च बटन" को छवियों के एक छोटे सेट पर प्रशिक्षित किया। उन्होंने इसे शोर को अनदेखा करना और उस सटीक फ्रेम को लॉक करना सिखाया जो प्रश्न का उत्तर देता है। एक बार प्रशिक्षित होने के बाद, यह टोकन एक सुपर-एफिशिएंट रिट्रीवर बन जाता है। जब रोबक को एक लंबे वीडियो के बारे में प्रश्न पूछा जाता है, तो यह टोकन एक लेजर पॉइंटर की तरह काम करता है, जो हजारों में से तुरंत प्रासंगिक फ्रेमों को ढूंढ लेता है और बाकी को अनदेखा कर देता है।
परिणाम आश्चर्यजनक रूप से मजबूत थे। जब उन्होंने इसे एक "विजुअल हेस्टैक" चुनौती (कई छवियों के बीच एक प्रासंगिक छवि खोजना) पर परखा, तो ReToken का उपयोग करने वाले रोबोट ने अपने पिछले सर्वश्रेष्ठ प्रदर्शन की तुलना में सटीकता में 13 अंकों से अधिक सुधार किया। इससे भी अधिक प्रभावशाली बात यह है कि उन्होंने इसे केवल स्थिर छवियों (still images) पर प्रशिक्षित किया था, लेकिन जब उन्होंने इसे एक लंबा वीडियो देखने के लिए दिया, तो यह अभी भी काम कर गया! इसने अपने कौशल को पूरी तरह से स्थानांतरित किया, जिससे LVBench नामक एक कठिन बेंचमार्क पर वीडियो समझ के स्कोर में 8 अंकों का सुधार हुआ।
सबसे अच्छी बात? यह समाधान अविश्वसनीय रूप से हल्का है। इसके लिए पूरे रोबोट को फिर से बनाने या किसी विशाल सुपरकंप्यूटर की आवश्यकता नहीं है। प्रशिक्षण से लेकर लंबा वीडियो देखने तक की पूरी प्रक्रिया, एक सिंगल हाई-एंड ग्राफिक्स कार्ड (H100) पर फिट हो जाती है। लेखक सुझाव देते हैं कि यह सरल, सिंगल-टोकन दृष्टिकोण वास्तव में घंटों के वीडियो या विशाल इमेज कलेक्शन को समझने वाले AI को बनाने की कुंजी हो सकता है। यह एक छोटा सा बदलाव है जो रोबोट को पेड़ों के बीच जंगल देखने में मदद करता है, यह साबित करते हुए कि कभी-कभी, आपको एक बड़े दिमाग की नहीं; बस देखने के एक बेहतर तरीके की आवश्यकता होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।