← 最新论文
🤖 machine learning

Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning

本文介绍了感知排名的校准(RAC),这是一种训练框架,它利用现有的基于群体的强化学习信号,强制在更优与更劣的推理路径之间、以及在干净与受损的输入之间建立置信度排序,从而在无需外部标注的情况下,同步提升多模态视觉语言模型的任务准确性与校准可靠性。

原作者: Peng Cui, Boyao Yang, Jun Zhu

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Peng Cui, Boyao Yang, Jun Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的机器人助手,它可以查看图片并回答有关图片的问题。你使用一种称为**强化学习(RL)**的方法训练了这个机器人。可以将这种训练想象成一款电子游戏,机器人只有在给出最终正确答案时才能获得“金星”。

问题:过度自信的谬误
该论文指出了这种训练方法的一个缺陷。由于机器人只关心获得“金星”(即正确答案),它学会成为一个自信的骗子

如果图片模糊、昏暗或存在奇怪的故障(作者称之为“损坏”的输入),机器人仍可能会猜测一个答案。如果它猜错了,但图片本身很混乱,旧的训练系统并不在意。机器人仍然会说:“我 100% 确定这就是答案!”尽管它是错的。这就像学生在灯光闪烁的房间里参加考试;如果他们猜错了答案,但说得非常肯定,旧系统并不会教导他们说:“嗯,灯光不好,我不太确定。”

这是危险的,因为如果机器人自信却错误,可能会导致后续做出糟糕的决策。

解决方案:RAC(排序感知校准)
作者提出了一种新的训练方法,称为RAC。RAC 不再仅仅询问“你答对了吗?”,而是通过比较提出两个更聪明的问题。这就像教练不仅根据得分给予反馈,还根据球员的表现方式给予反馈。

以下是机器人学习的两条新规则:

1. “更好的猜测”规则(排序感知组损失)

类比:想象机器人被要求解决一道数学题。机器人不是只给出一个答案,而是被要求同时生成五个不同的可能解

  • 旧方法:机器人仅因那个正确的答案获得奖励。其他四个被忽略。
  • RAC 方法:机器人被告知:“看看你的五个猜测。正确的那个必须比错误的那些具有更高的置信度分数。”

如果机器人说:“猜测 A 有 90% 的把握(且它是正确的)”,而“猜测 B 有 95% 的把握(但它是错误的)”,它就会受到惩罚。它必须学会说:“正确答案是我最有把握的那个。”这迫使机器人实际上更努力地思考,以区分好猜测和坏猜测,这意外地使其更聪明、更准确

2. “模糊照片”规则(干净 - 损坏成对损失)

类比:想象向机器人展示同一个问题两次。

  • 第一轮:你展示一张清晰的高清照片。
  • 第二轮:你展示完全相同的照片,但添加了静电、噪点或模糊(损坏)。

旧方法:机器人可能会说:“对于清晰的照片我有 90% 的把握”,“对于模糊的照片我也有 90% 的把握”。
RAC 方法:机器人被告知:“如果照片模糊,你的置信度必须下降。”

如果机器人说:“即使照片模糊,我仍有 90% 的把握”,它就会受到惩罚。它学会了证据越差 = 置信度越低。它学会了说:“照片很模糊,所以我只确定 60%。”这不一定能让答案变正确,但它能让机器人诚实地表达自己有多确定。

结果
作者在几个智能模型(如 Qwen 和 InternVL)上测试了这种方法,使用了六种不同类型的推理测试。他们发现:

  • 更高的准确率:因为机器人学会了对其猜测进行排序(规则 1),它实际上答对了更多的答案。
  • 更高的诚实度:因为机器人学会了在图片质量差时降低置信度(规则 2),它不再在不确定的时候假装确定。
  • 无额外成本:最好的部分是,他们不需要雇佣人类来标注“置信度”。他们只需利用机器人在训练过程中已经生成的数据来教授这些课程。

总结
RAC 教会机器人两件事:

  1. 成为更好的判断者:如果你有多个想法,要对正确的那个最有把握。
  2. 了解你的局限:如果你所查看的信息很混乱,就承认你不太确定。

这使得机器人不仅更聪明,而且更可靠、更值得信赖,尤其是在其周围的世界(图像)并不完美的情况下。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →