Perturb the Thought, Not the Pixels: Latent-Space Rollout Diversification for Reinforcement Learning of Vision-Language Models
该论文介绍了一种噪声对比 GRPO(NC-GRPO)方法,该方法通过在潜空间而非像素层级注入校准噪声,来使视觉语言模型的强化学习展开多样化,从而在保持极低实现成本的同时,显著增强了其域外推理能力和幻觉鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一种计算机:它能观察一张图片并回答关于图片的问题,或者阅读用文字描述的数学题并将其解出。这些被称为视觉语言模型的系统正变得越来越强大,但它们仍然会犯错。有时它们出错是因为思考得不够仔细;有时它们则会自信地陈述一些根本不真实的事实,这种问题被称为“幻觉”。为了教会这些模型更好地思考,研究人员使用了一种称为“强化学习”的方法。在这个过程中,模型被要求针对同一个问题生成许多不同的尝试。如果其中一些尝试是正确的而另一些是错误的,模型就会学习倾向于成功的路径。然而,为了让这种学习奏效,不同的尝试必须在彼此之间产生差异。如果模型只是一遍又一遍地重复相同的思维过程,它就学不到任何新东西。
挑战在于如何迫使模型去探索不同的思考方式。传统上,研究人员试图通过改变计算机决策过程的“温度”,或者通过轻微扭曲输入图像(例如在照片中添加静电噪声)来制造变化。来自亚马逊网络服务(AWS)的研究人员提出的一项新研究表明,这些外部变化可能并不是多样化模型思维的最有效方式。相反,他们建议这种变化应该发生在模型自身对问题的内部表示之中,就在它开始处理问题的时刻。通过在模型开始生成答案之前,在其隐藏的心理状态中注入微量且受控的随机噪声,他们发现可以创造出一个更稳健、更准确的思考者。
研究人员开发了一种名为“噪声对比组相对策略优化”(Noise-Contrastive Group Relative Policy Optimization)的技术。要理解它的工作原理,请想象一群学生正在尝试解决同一个几何问题。在标准的训练课程中,每个学生可能会因为偶然因素而解题方式略有不同,但他们最初对问题的理解都是完全相同的。在这种新方法中,一半的学生会被给予一个略微不同的起点。研究人员提取模型的内部状态——即模型在“大脑”中编码问题的方式——并为其中一半的群体加入了一个微小的、随机的冲击。这个冲击不是对图像本身的改变,也不是对页面文字的改变。它是对模型内部视角的微妙偏移,就像是要求一名学生在开始动笔写之前,先从一个略微不同的角度去观察这个问题。
随后,模型会从这两组中生成答案:一组是从正常的、清晰的理解开始,另一组则是从这种略微偏移的、带有噪声的理解开始。关键的洞察力在于模型如何从结果中学习。如果带有噪声起点的这一组仍然能够在最初引入混乱的情况下找到正确答案,模型就会获得奖励。如果噪声导致模型偏离轨道并失败,那么这条路径就会受到惩罚。随着时间的推移,模型学会了寻找那些极其稳固的解决方案,即使在起始点略显不稳定时也能奏效。它不仅仅是在学习答案;它是在学习如何对自身思维过程中的微小扰动保持稳健。
实验结果非常引人注目。研究人员在一种经过几何问题训练的大型视觉语言模型上测试了这种方法。当他们将这种新方法与标准方法以及旧的扭曲图像技术进行比较时,新方法在处理困难的、未见过的数学问题时表现出了显著更好的结果。模型变得更擅长解决从未见过的题目,这种能力被称为“域外推理”。或许更令人惊讶的是,它还变得更擅长避免幻觉。虽然旧的扭曲图像的方法有助于模型更清晰地观察视觉细节,但有时却会让模型变得难以坚持事实。相比之下,新方法同时提高了模型的推理能力和诚实度。
研究还探讨了究竟是什么让这项技术奏效。研究人员测试了这种益处是来自于噪声的具体方向,还是仅仅来自于噪声的随机性。他们发现,方向并不重要。无论噪声是将模型的思维推向哪个方向,关键因素仅仅是每一次尝试都始于一个独特的、独立的视角。他们还发现,噪声的大小就像一个旋钮。少量的噪声可以在不损害其通用能力的情况下提高模型的推理能力,但过多的噪声则会开始降低其整体性能。这表明存在一个“甜点区”(sweet spot),在此区间内,模型可以成为更优秀的推理专家,而不会丧失其通用知识。
其中最重要的发现之一是,这种方法是通过改变模型的内部状态,而非改变图像或文本来起作用的。这意味着该技术有可能应用于任何处理信息的模型,而不局限于那些处理图像的模型。研究人员展示了该方法的效率,它仅需对运行模型的软件进行微小的改动,并且不会减慢生成答案的过程。通过专注于模型开始思考的那一刻,而非它接收到的数据,他们找到了一种让模型的推理更加可靠且不易出错的方法。
研究还探讨了这种方法是否适用于不同规模的模型。当他们对该模型的较小版本应用同样的技术时,这种益处消失了。较小的模型既没有变得更好,也没有变得更差;它仅仅没有任何变化。这表明该技术需要模型具备一定的复杂度才能发挥作用。它不是一种适用于任何计算机的魔术,而是一个专门帮助更大型、更强大的系统精炼其思维的工具。研究人员谨慎地指出,虽然结果令人鼓舞,但目前他们仅在这一类模型家族上进行了测试,仍需更多工作来验证其是否适用于其他模型。
最终,这项研究为我们如何训练人工智能提供了一种全新的思考方式。研究人员并没有试图让输入数据变得更多样,或者让决策过程变得更加混乱,而是发现通过精确的内部扰动可以引导出更稳定、更智能的结果。通过教会模型即使在起始点略有偏差时也能取得成功,他们创造了一个不太容易被自身不确定性所误导的系统。这种方法不仅让模型在数学方面变得更聪明,还让模型变得更加值得信赖,能够区分出稳固的答案与自信的猜测。随着这些系统越来越多地融入我们的日常生活,寻找让它们更加稳健且不易出错的方法至关重要,而这项研究为实现这一目标提供了一条清晰的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。