Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control
यह शोध पत्र WA-LQR नामक एक प्रशिक्षण-मुक्त स्टीयरिंग पद्धति प्रस्तावित करता है जो उनके सक्रियण स्थानों (activation spaces) में निम्न-आयामी रैखिक पृथक्करणीयता (low-dimensional linear separability) का लाभ उठाकर वर्ल्ड एक्शन मॉडल्स की वितरण बदलावों (distribution shifts) के विरुद्ध सुदृढ़ता बढ़ाने के लिए यांत्रिक व्याख्यात्मकता (mechanistic interpretability) और इष्टतम नियंत्रण (optimal control) का उपयोग करता है।