← 最新论文
💬 NLP

Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR

该论文介绍了 EASE(证据锚定空间注意力),这是一种通过利用标注的视觉证据来引导高奖励训练轨迹中的空间注意力,从而增强视觉语言模型中具有可验证奖励的强化学习(RLVR)的方法,旨在不增加推理阶段额外输入的情况下,提升在感知、推理和幻觉基准测试上的性能。

原作者: Ruina Hu, Chen Wang, Lai Wei, Jionghao Bai, Bin Yu, Weiran Huang, Kai Wang, Yue Wang

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruina Hu, Chen Wang, Lai Wei, Jionghao Bai, Bin Yu, Weiran Huang, Kai Wang, Yue Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对论文《Attend to Evidence》(EASE)的解释,使用了简单的语言和日常类比。

核心问题:“靠运气猜题”的学生

想象一名学生正在参加一场包含图片的难题考试。老师(计算机)只检查最终答案。

  • 问题: “这张照片里有几只长颈鹿?”
  • 学生的回答: “三只。”
  • 老师的反馈: “正确!+1 分。”

问题在于,老师并不知道学生是如何得出答案的。学生是真的在照片里数了长颈鹿吗?还是因为他们知道这类测试中长颈鹿很常见,所以随口猜了一个?或者他们甚至看错了图片的部分区域?

在 AI(特别是视觉语言模型)领域,这被称为仅结果奖励(Outcome-Only Reward)。AI 因为答对而获得分数,但它并没有学习在图像中哪里应该寻找答案。这会导致“幻觉”现象——即 AI 凭借文本模式进行自信的胡编乱造,而不是通过实际观察图像来获取信息。

解决方案:EASE(“聚光灯”老师)

作者创建了一种名为 EASE(证据锚定空间注意力)的新型训练方法。

把 EASE 想象成一位不仅评分最终答案,还会观察学生在解题时目光看向何处的老师。

  1. “小抄”(仅用于训练): 在训练期间,老师拥有一份特殊的“小抄”(标注框),精准地标出了照片中包含答案的部分。
    • 例子: 如果答案是“三只长颈鹿”,小抄会在每只长颈鹿周围画一个框。
  2. 聚光灯: AI 有一个心理上的“聚光灯”(注意力),它用这个聚光灯来扫描图像。EASE 教会 AI 将其聚光灯直接照射在小抄中的方框上。
  3. 黄金法则: 只有当学生答对问题时,老师才会给出这种“看这里”的建议。
    • 如果学生答错了,老师会说:“我们不知道你刚才在看哪里,所以先不进行猜测。”
    • 如果学生答对了,并且确实看向了正确的地点,老师会说:“做得好!你找到了证据。下次记得看向那里。”

它是如何运作的(隐喻)

想象你在教一只狗在草地上找球。

  • 旧方法(标准强化学习 RL): 你扔出球。狗到处乱跑、到处闻,最后找到了球。你给了它一个奖励。狗学到的是:“到处乱跑和乱闻能换来奖励。”它可能是靠运气找到球的,而不是通过寻找目标。
  • EASE 方法: 你有一张显示球具体位置的隐藏地图。当狗找到球时,你会核对地图。
    • 如果狗是在隐藏球的确切位置附近嗅闻,你会给它一个超级大奖并说:“好孩子,你找对了地方!”
    • 如果狗虽然找到了球,但却在草地的完全不同的地方嗅闻,你不会给它超级大奖。你要教会这只狗,仅仅找到球是不够的;它必须也看向正确的地方。

尝试之后的结果如何?

研究人员在几个智能 AI 模型(Qwen2.5 和 Qwen3)上测试了该方法。他们将这种新方法与旧的“靠运气猜题”方法进行了对比。

  • 数学和逻辑能力更强: AI 在涉及图片的数学问题和逻辑谜题方面表现得显著更好。它不再靠猜,而是开始真正分析视觉线索。
  • 幻觉更少: AI 编造虚假事实的情况减少了。它变得对自己的观察能力更加诚实。
  • 不会增加用户的工作量: 这是一个关键点。这种“小抄”(方框)仅在 AI 学习时使用。当你实际使用 AI 时,你只需给它一张图片和一个问题。它不需要方框也能工作,但因为它在训练中学会了仔细观察,所以表现得更好。

总结

EASE 教会了 AI 模型成为诚实的观察者。与其仅仅死记硬背正确答案,AI 学习将答案与支持该答案的具体视觉证据联系起来。这就像是教一名侦探在写报告之前先观察犯罪现场的线索,而不是仅仅凭直觉去猜测凶手。

核心要点: 通过在训练期间强制要求 AI “展示其思考过程”(即看向正确的地点),AI 在日后回答问题时会变得更加可靠且准确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →