A Unified Pair-GRPO Family: From Implicit to Explicit Preference Constraints for Stable and General RL Alignment
تقدم هذه الورقة عائلة Pair-GRPO، وهي إطار نظري موحد يضم متغيري Soft-Pair-GRPO وHard-Pair-GRPO اللذين يستفيدان من التفضيلات الثنائية الزوجية والقيود الصريحة لمعالجة عدم الاستقرار، والتباين العالي، والغموض في التعلم المعزز من التغذية الراجعة البشرية (RLHF) السائد، مما يحقق جودة محاذاة وقدرة على التعميم متفوقة عبر كل من مهام اللغة والتحكم المستمر.