K-Score: Kalman Filter as a Principled Alternative to Reward Normalization in Reinforcement Learning
تقترح الورقة البحثية "K-Score"، وهي طريقة تستبدل تطبيع المكافأة التقليدي في تعلم التعزيز بتدرج السياسة بمرشح كالمان أحادي البعد لتقدير متوسطات المكافأة بشكل تكراري، مما يقلل التباين ويسرع التقارب في البيئات غير المستقرة.