Reinforcement Learning with Discrete Diffusion Policies for Combinatorial Action Spaces
تقدم هذه الورقة إطار عمل جديد للتعلم التعزيزي يستخدم نماذج الانتشار المنفصلة المدربة عبر تقنية "النزول المرآتي للسياسة" (policy mirror descent) لتحقيق أداء مستقر ورائد عالمياً وكفاءة فائقة في استخراج العينات ضمن فضاءات العمل التوافقية المعقدة.