Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval
यह शोधपत्र SaMer का प्रस्ताव करता है, जो एक ऑब्जेक्ट-अवेयर टोकन मर्जिंग फ्रेमवर्क है जो प्रशिक्षण के दौरान महत्वपूर्ण ऑब्जेक्ट-लेवल साक्ष्य को संरक्षित करके विजन-लैंग्वेज रिट्रीवल के लिए इमेज-साइड टोकन को महत्वपूर्ण रूप से संकुचित करता है, जिससे बिना ग्राउंड-ट्रुथ बाउंडिंग बॉक्स की आवश्यकता के इन्फरेंस के दौरान स्टोरेज लागत कम होती है और रिट्रीवल प्रदर्शन में सुधार होता है।