Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO
تقدم هذه الورقة البحثية TurningPoint-GRPO (TP-GRPO)، وهو إطار عمل مبتكر يعزز خوارزمية Flow-Based GRPO لتوليد الصور من النصوص عبر استبدال المكافآت القائمة على النتائج المتفرقة بمكافآت تراكمية كثيفة على مستوى الخطوات، وتحديد "نقاط التحول" لتعيين مكافآت طويلة الأمد مجمعة، مما يساهم بفعالية في نمذجة التأثيرات الفورية والمتأخرة ضمن مسار إزالة الضجيج.