Planner Aware Path Learning in Diffusion Language Models Training
Ce papier propose une nouvelle méthode d'apprentissage appelée PAPL, qui résout le décalage entre l'entraînement et l'inférence dans les modèles de diffusion discrets en intégrant les stratégies de planification via une nouvelle borne inférieure de vraisemblance (P-ELBO), entraînant des performances significativement améliorées dans la génération de texte, de protéines et de code.