Lyapunov-Guided Self-Alignment: Test-Time Adaptation for Offline Safe Reinforcement Learning
تقدم هذه الورقة إطار عمل SAS، وهو إطار يعتمد على المحولات (transformer-based) يتيح التكيف في وقت الاختبار لتعلم التعزيز الآمن غير المتصل (offline safe reinforcement learning) من خلال توليد واختيار مسارات متخيلة متوافقة مع ليابونوف (Lyapunov-compliant) كـ "سياق توجيهي" (in-context prompts) لإعادة ضبط سلوك الوكيل نحو الأمان دون الحاجة إلى إعادة التدريب.