Adaptive Decoding via Test-Time Policy Learning for Self-Improving Generation
تقدم هذه الورقة البحثية عينة لفك التشفير تعتمد على التعلم التعزيزي، والتي تتعلم سياسة خفيفة الوزن في وقت الاختبار لضبط معلمات أخذ العينات للنماذج اللغوية الكبيرة ديناميكيًا، مما يتفوق بشكل كبير على استراتيجيات فك التشفير الثابتة عبر مهام التلخيص دون الحاجة إلى إعادة تدريب النموذج.