Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization
تقترح هذه الورقة إطار عمل للتعلم المعزز المدرك للاستكشاف يُمكّن وكلاء النماذج اللغوية الكبيرة من التمييز التكيفي بين سيناريوهات عدم اليقين العالية التي تتطلب الاستكشاف والسياقات الواضحة المناسبة للتنفيذ، مما يحقق تحسينات مستمرة في الأداء عبر معايك قياس الوكلاء القائمة على النصوص وواجهات المستخدم الرسومية.