Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs
यह शोध पत्र मोडैलिटी-म्युचुअल अटेंशन (MMA) का प्रस्ताव करता है, जो एक पैरामीटर-मुक्त आर्किटेक्चरल संशोधन है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में कॉज़ल अटेंशन को प्रतिस्थापित करता है ताकि इमेज टोकन्स को टेक्स्ट टोकन्स पर अटेंड करने में सक्षम बनाया जा सके, जिससे विजन-लैंग्वेज मिसअलाइनमेंट को हल किया जा सके और 12 बेंचमार्क में स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त किया जा सके।