← أحدث الأبحاث
💬 NLP

StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning

تقدم هذه الورقة StepPO، وهو إطار عمل يعزز التعلم التعزيزي الوكيل عبر نقل نموذج التحسين من عمليات ماركوف لاتخاذ القرار على مستوى الرمز (token-level) إلى مستوى الخطوة (step-level)، مما يؤدي إلى مواءمة تحديثات السياسة وتخصيص الائتمان مع التدرج الطبيعي لقرارات الوكيل للتعامل بشكل أفضل مع التفاعلات متعددة الأدوار، والمكافآت الشحيحة، واستخدام الأدوات المعقدة.

المؤلفون الأصليون: Daoyu Wang, Qingchuan Li, Mingyue Cheng, Jie Ouyang, Shuo Yu, Qi Liu, Enhong Chen

نُشر 2026-04-21
📖 1 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Daoyu Wang, Qingchuan Li, Mingyue Cheng, Jie Ouyang, Shuo Yu, Qi Liu, Enhong Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لا يتوفر بعدُ أي شرح بهذه اللغة.

جرّب: AR, DE, EN, ES, FR, HI, IT, JA, KO, NL, PT, ZH

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →