Physics-Informed Policy Optimization via Analytic Dynamics Regularization
تقدم هذه الورقة PIPER، وهو إطار عمل للتعلم التعزيزي المستند إلى الفيزياء يعزز كفاءة العينات ودقة التحكم من خلال دمج متبقي لاغرانج التفاضلي كحد تنظيم تحليلي في هدف تحسين السياسة، مما يوجه السياسات العصبية نحو حلول متسقة فيزيائياً دون تعديل المحاكيات أو الخوارزميات الموجودة.