Improving Generalization Robustness of Multimodal RLVR
本文提出了提示词不变性强化学习验证(Prompt-Invariant RLVR, PIRL),这是一种鲁棒的后训练方法,它结合了动态三元奖励和嵌入空间一致性正则化器,以缓解多模态模型中标准 RLVR 的脆弱性,从而显著提高在语义等价但经过扰动的提示词上的泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个聪明但思维过于刻板的机器人如何解谜。你给它看一张猫的照片,并问:“这是什么动物?”机器人学会了完美地回答“猫”。但随后,你稍微改变了一下问题,问:“识别图像中的猫科动物。”突然间,机器人僵住了,或者给出了错误的答案。这就是**多模态大语言模型(MLLM)的世界——这些是能够同时看图并阅读文本的超智能 AI 系统。为了让这些机器人变得更聪明,科学家们使用了一种叫做带有可验证奖励的强化学习(RLVR)**的技术。这就像玩电子游戏,只有当机器人的答案符合一份严格的清单(比如特定的格式或正确的数字)时,它才能获得“积分”。其目标是训练机器人更好地进行推理并获得更多积分。但问题在于,如果机器人学会的是钻清单的空子而不是真正理解谜题,它就会变得非常脆弱。它可能在题目看起来与练习题完全一致时表现出色,但如果仅仅改变一下提问方式,它就会彻底失败。这在医疗诊断或法律建议等现实应用场景中是一个巨大的问题,因为一个会在你改变措辞时就崩溃的机器人是危险的。
现在有一项新研究试图解决这种“脆弱性”。由周鹏飞(Pengfei Zhou)及其同事领导的研究团队发现,标准的训练方法正在教会 AI 成为“格式主义者”。他们发现,当 AI 因为一个正确答案而获得奖励时,奖励系统往往会将两件事混淆:得出正确答案和遵循格式规则(例如将答案放在特定的方框内)。如果 AI 忘记把答案放在框里,即使答案是完美的,它也会得到零分。这会让 AI 感到困惑,使其过度关注“框”而不是数学或逻辑本身。此外,AI 只在极小且特定的问题风格集上进行练习。当它在现实世界中面对同类问题的另一种问法时,它就会陷入恐慌。
为了解决这个问题,该团队提出了一种名为提示词不变性 RLVR(PIRL)的新训练方法。他们引入了两个主要技巧。首先,他们给了 AI 一个“动态三元奖励”。AI 不再仅仅得到一个简单的“对/错”分数,而是现在可以得到一个三层级的评分:+1 代表格式正确的正确答案,0 代表内容正确但格式错误,-1 代表格式失败。这教会了 AI,即使格式很乱,答案的“内容”也同样重要。其次,他们为训练增加了一个“替身”。他们创建了一个对抗性智能体,该智能体不断以微妙的方式重写问题(例如改变措言或指令风格),同时保持原意不变。AI 被迫无论问题如何“打扮”,都必须给出相同的正确答案。这就像不是在教一个学生只做特定练习册上的数学题,而是教他在题目是手写体、印刷体还是口头表达时,都能解出同一道数学题。
结果令人振奋。当他们用这种新方法与旧标准(称为 GRPO)进行对比测试时,发现当问题被重新表述时(即“压力测试”),旧方法的表现显著下降。例如,在某些数学基准测试中,当提示词改变时,标准方法的准确率下降了约 3% 到 4%。相比之下,新的 PIRL 方法表现得非常稳定,其准确率下降仅为 1% 或更少。在医疗和法律问题等对可靠性要求极高的领域,PIRL 保持了比竞争对手更好的准确性。这项研究表明,通过将“答对”的奖励与“看起来对”的奖励分离,并利用更多样化的提问风格进行练习,我们可以构建出不仅聪明、而且稳健可靠的 AI,使其能够应对人类交流中那种杂乱且不可预测的真实情况。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。