Continuous-time Risk-sensitive Reinforcement Learning via Quadratic Variation Penalty
تؤسس هذه الورقة إطاراً قائماً على المارتينجال للتعلم المعزز الحساس للمخاطر في الوقت المستمر، والذي يدمج عقوبة التباين التربيعي لالتقاط تباين القيمة، مما يتيح تكييف الخوارزميات الحالية وإثبات التقارب لمشكلة ميرتون الاستثمارية مع إظهار أداء محسّن في العينات المحدودة في التحكم الخطي-التربيعي.