Beyond Mode Collapse: Distribution Matching for Diverse Reasoning
تقدم هذه الورقة البحثية طريقة DMPO، وهي طريقة تحسين سياسة مطابقة التوزيع تخفف من حدة انهيار النمط في التعلم المعزز القائم على السياسة، وذلك عبر مواءمة السياسة مع توزيع مستهدف متناسب مع المكافأة، مما يحافظ على الاستكشاف ويحسن الأداء بشكل كبير عبر مهام استدلال متنوعة مثل التحسين المسائل الصعبة (NP-hard) والاستدلال الرياضي.