SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning
تقدم هذه الورقة البحثية إطار عمل SAPO، وهو إطار عمل موفر للذاكرة ومحسن للحوسبة للتعلم التعزيزي الوكيل، يستخدم عموداً فقرياً ذاتي الانحدار مشتركاً لوظائف السياسة والقيمة لتحقيق أداء واستقرار فائقين مقارنة بالأساليات الحالية مثل PPO وGRPO مع إلغاء الحاجة إلى نموذج ناقد منفصل.