How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A
यह शोध पत्र F^3A को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) विजुअल टोकन प्रूनिंग राउटर है जो प्रूनिंग को टास्क-कंडीशन्ड एविडेंस सर्च के रूप में मानकर एक निश्चित टोकन बजट को गतिशील रूप से आवंटित करता है, जिससे बिना किसी अतिरिक्त प्रशिक्षण या मूल डिकोडिंग पाइपलाइन को बाधित किए मल्टीमॉडल मॉडल्स में इन्फरेंस लागत को कम किया जा सके।