CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models
تقدم الورقة البحثية LiteLVLM، وهي طريقة لتقليم الرموز (token pruning) تعتمد على التوجيه النصي ولا تتطلب تدريباً، تقوم بعكس ترتيب تشابه الصور والنصوص الخاص بـ CLIP للاحتفاظ بكفاءة بالمناطق المرجعية لعملية التوطين البكسلي (pixel grounding) في النماذج اللغوية البصرية الكبيرة، محققةً بذلك تسريعاً كبيراً وتقليلاً في استهلاك الذاكرة مع التفوق على الأساليب الحالية.