S-Attention:Attention-Aligned Endogenous Retrieval for Memory-Bounded Long-Context Inference
S-Attention एक मेमोरी-कुशल इन्फरेंस फ्रेमवर्क है जो रैखिक रूप से स्केल होने वाले KV कैश को स्पार्स फीचर आइडेंटिफायर्स का उपयोग करने वाले एक CPU-आधारित, अटेंशन-अलाइन्ड एंडोजेनस रिट्रीवल सिस्टम से बदल देता है ताकि बाउंडेड GPU मेमोरी के भीतर प्रतिस्पर्धी प्रदर्शन बनाए रखते हुए लॉन्ग-कॉन्टेक्स्ट प्रोसेसिंग को सक्षम किया जा सके।