Perturb the Thought, Not the Pixels: Latent-Space Rollout Diversification for Reinforcement Learning of Vision-Language Models
تقدم الورقة البحثية طريقة "التعلم المعزز بتباين الضجيج" (NC-GRPO)، وهي وسيلة تعمل على تنويع مخرجات التعلم المعزز للنماذج اللغوية البصرية عبر حقن ضجيج مُعاير في الفضاء الكامن بدلاً من البكسلات، مما يعزز بشكل كبير القدرة على الاستنتاج خارج النطاق والمتانة ضد الهلوسة مع الحفاظ على حد أدنى من بصمة التنفيذ.