Reward Is Enough: LLMs Are In-Context Reinforcement Learners
تُظهر هذه الورقة أن النماذج اللغوية الكبيرة يمكنها أداء التعلم التعزيزي داخل السياق أثناء الاستدلال من خلال تحسين استجاباتها بشكل تكراري بناءً على إشارات المكافأة المتراكمة، مما يؤدي إلى تحسينات كبيرة في الأداء عبر مهام متنوعة دون الحاجة إلى تدريب إضافي.