Negative Advantage Is a Double-Edged Sword: Calibrating Advantage in GRPO for Deep Search
تقدم هذه الورقة CalibAdv، وهي طريقة مبتكرة لمعايرة الميزة تخفف من عدم الاستقرار وتدهور الأداء في تحسين السياسة النسبية للمجموعات (GRPO) في وكلاء البحث العميق، وذلك من خلال خفض دقيق للمزايا السلبية المفرطة بناءً على صحة الخطوات المتوسطة وإعادة توازن توزيع المزايا.