Beyond Linear Attention: Softmax Transformers Implement In-Context Reinforcement Learning
यह शोध पत्र एक ऐसा प्रथम सैद्धांतिक ढांचा प्रदान करता है जो यह प्रदर्शित करता है कि मानक सॉफ्टमैक्स ट्रांसफॉर्मर (softmax Transformers) उनके लेयरवाइज फॉरवर्ड पास को एक नवीन भारित सॉफ्टमैक्स टेम्पोरल डिफरेंस (weighted softmax temporal difference) एल्गोरिदम के समान मानकर इन-कॉन्टेक्स्ट सुदृढीकरण शिक्षण (in-context reinforcement learning) को लागू करते हैं, जो उनके अभिसरण गुणों (convergence properties) और प्रीट्रेनिंग के दौरान इष्टतम मापदंडों के उद्भव दोनों की व्याख्या करता है।