← 最新论文
🤖 AI

Improving Generalization Robustness of Multimodal RLVR

本文提出了提示词不变性强化学习验证(Prompt-Invariant RLVR, PIRL),这是一种鲁棒的后训练方法,它结合了动态三元奖励和嵌入空间一致性正则化器,以缓解多模态模型中标准 RLVR 的脆弱性,从而显著提高在语义等价但经过扰动的提示词上的泛化能力。

原作者: Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个聪明但思维过于刻板的机器人如何解谜。你给它看一张猫的照片,并问:“这是什么动物?”机器人学会了完美地回答“猫”。但随后,你稍微改变了一下问题,问:“识别图像中的猫科动物。”突然间,机器人僵住了,或者给出了错误的答案。这就是**多模态大语言模型(MLLM)的世界——这些是能够同时看图并阅读文本的超智能 AI 系统。为了让这些机器人变得更聪明,科学家们使用了一种叫做带有可验证奖励的强化学习(RLVR)**的技术。这就像玩电子游戏,只有当机器人的答案符合一份严格的清单(比如特定的格式或正确的数字)时,它才能获得“积分”。其目标是训练机器人更好地进行推理并获得更多积分。但问题在于,如果机器人学会的是钻清单的空子而不是真正理解谜题,它就会变得非常脆弱。它可能在题目看起来与练习题完全一致时表现出色,但如果仅仅改变一下提问方式,它就会彻底失败。这在医疗诊断或法律建议等现实应用场景中是一个巨大的问题,因为一个会在你改变措辞时就崩溃的机器人是危险的。

现在有一项新研究试图解决这种“脆弱性”。由周鹏飞(Pengfei Zhou)及其同事领导的研究团队发现,标准的训练方法正在教会 AI 成为“格式主义者”。他们发现,当 AI 因为一个正确答案而获得奖励时,奖励系统往往会将两件事混淆:得出正确答案遵循格式规则(例如将答案放在特定的方框内)。如果 AI 忘记把答案放在框里,即使答案是完美的,它也会得到零分。这会让 AI 感到困惑,使其过度关注“框”而不是数学或逻辑本身。此外,AI 只在极小且特定的问题风格集上进行练习。当它在现实世界中面对同类问题的另一种问法时,它就会陷入恐慌。

为了解决这个问题,该团队提出了一种名为提示词不变性 RLVR(PIRL)的新训练方法。他们引入了两个主要技巧。首先,他们给了 AI 一个“动态三元奖励”。AI 不再仅仅得到一个简单的“对/错”分数,而是现在可以得到一个三层级的评分:+1 代表格式正确的正确答案,0 代表内容正确但格式错误,-1 代表格式失败。这教会了 AI,即使格式很乱,答案的“内容”也同样重要。其次,他们为训练增加了一个“替身”。他们创建了一个对抗性智能体,该智能体不断以微妙的方式重写问题(例如改变措言或指令风格),同时保持原意不变。AI 被迫无论问题如何“打扮”,都必须给出相同的正确答案。这就像不是在教一个学生只做特定练习册上的数学题,而是教他在题目是手写体、印刷体还是口头表达时,都能解出同一道数学题。

结果令人振奋。当他们用这种新方法与旧标准(称为 GRPO)进行对比测试时,发现当问题被重新表述时(即“压力测试”),旧方法的表现显著下降。例如,在某些数学基准测试中,当提示词改变时,标准方法的准确率下降了约 3% 到 4%。相比之下,新的 PIRL 方法表现得非常稳定,其准确率下降仅为 1% 或更少。在医疗和法律问题等对可靠性要求极高的领域,PIRL 保持了比竞争对手更好的准确性。这项研究表明,通过将“答对”的奖励与“看起来对”的奖励分离,并利用更多样化的提问风格进行练习,我们可以构建出不仅聪明、而且稳健可靠的 AI,使其能够应对人类交流中那种杂乱且不可预测的真实情况。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →