Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features
تقدم هذه الورقة "تعلم التعزيز التحكمي" (Control Reinforcement Learning - CRL)، وهو إطار عمل يدرب سياسة لاختيار وتضخيم ميزات المشفّر التلقائي المتناثر القابل للتفسير ديناميكيًا على مستوى الرمز (token) لتوجيه مخرجات النماذج اللغوية الكبيرة، مما يوفر بروتوكولات تدخل لكل رمز ورؤى ميكانيكية جديدة في سلوك النموذج عبر مختلف الاختبارات المعيارية.