Large Vision-Language Models Get Lost in Attention
यह शोध पत्र एक एकीकृत सूचना-सैद्धांतिक और ज्यामितीय ढांचे का प्रस्ताव करता है जो यह प्रकट करता है कि लार्ज विजन-लैंग्वेज मॉडल्स में अटेंशन मैकेनिज्म कार्यात्मक रूप से अनावश्यक और अक्सर गलत तरीके से आवंटित होते हैं, क्योंकि सीखे गए अटेंशन वेट्स को पूर्व-निर्धारित मानों से बदलने से तुलनीय या बेहतर प्रदर्शन प्राप्त किया जा सकता है।