Multi-layer Cross-Attention is Provably Optimal for Multi-modal In-context Learning
यह शोध पत्र यह स्थापित करता है कि जहाँ एकल-परत रैखिक स्व-ध्यान (single-layer linear self-attention) मल्टी-मोडल इन-कॉन्टेक्स्ट लर्निंग के लिए बेयज़-इष्टतम प्रदर्शन प्राप्त करने में विफल रहता है, वहीं एक नवीन रैखिकीकृत क्रॉस-अटेंशन तंत्र (linearized cross-attention mechanism) का उपयोग करने वाला एक गहरा आर्किटेक्चर ग्रेडिएंट फ्लो के माध्यम से प्रशिक्षित होने पर प्रमाणित रूप से इष्टतम है।