Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers
यह शोध पत्र Looped Latent Attention (LLA) प्रस्तुत करता है, जो एक पोस्ट-ट्रेनिंग कोडेक है जो वेट-टाइड ट्रांसफॉर्मर्स में लूप-इंडेक्स्ड KV कैश की लो-रैंक संरचना का लाभ उठाकर SVD इनिशियलाइजेशन और डिस्टिलेशन के माध्यम से नियर-लॉसलेस प्रदर्शन बनाए रखते हुए अत्यधिक संपीड़न (32x तक) प्राप्त करता है और बैच क्षमता को महत्वपूर्ण रूप से बढ़ाता है।