dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models
تقدم الورقة البحثية dFlowGRPO، وهو إطار عمل موحد للتعلم المعزز يوسع تحسين أسلوب GRPO ليشمل نماذج التدفق المنفصلة العامة من خلال صياغة عملية إزالة الضجيج كعملية اتخاذ قرار ماركوف، مما يظهر أداءً فائقاً في توليد الصور من النصوص والفهم متعدد الوسائط مقارنة بالطرق الحالية.