Multi-Head Attention as Ensemble Nadaraya-Watson Estimation: Variance Reduction, Decorrelation, and Optimal Head Diversity
यह शोधपत्र एक कठोर सांख्यिकीय ढांचे को स्थापित करता है जो यह सिद्ध करता है कि मल्टी-हेड अटेंशन, नदरया-वाट्सन अनुमानकों (Nadaraya-Watson estimators) के एक डिकोरिलेटेड एन्सेम्बल के रूप में कार्य करता है, जहाँ हेड डाइवर्सिटी इंडेक्स यह परिमाणीकरण करता है कि कैसे ऑर्थोगोनल प्रोजेक्शन सबस्पेस वेरिएन्स को कम करते हैं और माध्य वर्ग त्रुटि (mean squared error) को न्यूनतम करने के लिए इष्टतम आर्किटेक्चरल स्केलिंग लॉज़ को निर्धारित करते हैं।