Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models
تقدم هذه الورقة البحثية TraFL، وهي طريقة ما بعد التدريب تعتمد على توازن المسار لنماذج اللغة الانتشارية، والتي تتغلب على نمط فشل "قفل المسار" الذي تعاني منه أساليب تعظيم المكافأة، وذلك من خلال محاذاة السياسة مع توزيع مستهدف مائل للمكافأة، مما يحقق مكاسب أداء متسقة عبر معايير الاستدلال الرياضي وتوليد الكود البرمجي.