Why Tree-Style Branching Matters for Thought Advantage Estimation in GRPO
تُثبت هذه الورقة نظرياً وتجريبياً أنه في خوارزمية GRPO، يُعد زيادة عدد الإجابات التي يتم أخذ عينات منها لكل فكرة (التفرع) آلية ضرورية للقضاء على التباين في تقدير الميزة على مستوى الفكرة، بينما لا يمكن لمجرد زيادة عدد الأفكما التي يتم أخذ عينات منها أن يحقق ذلك، مما يثبت أن التفرع أمر أساسي لتحسين الاستدلال بشكل مستقر وفعال.