← 最新论文
🤖 AI

ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models

该论文介绍了 ROSE,这是一个受控基准测试,它证明了多模态大语言模型在视觉计数与上下文约束动作之间存在显著的性能差距,揭示了尽管人类表现出色,但在将共享视觉证据转化为特定任务行为方面存在明显的瓶颈。

原作者: Yihao Wang, Zijian He, Jie Ren, Keze Wang

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yihao Wang, Zijian He, Jie Ren, Keze Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正盯着墙上一大片由 100 个外观完全相同的贴纸组成的巨大网格。突然,你发现其中有三个有点不同——也许其中一个倒过来了,或者有一个微小的划痕。

现在,想象一个机器人站在你身边。你向这个机器人提出了三个关于这面完全相同的墙的不同问题:

  1. 计数: “总共有多少个奇怪的贴纸?”
  2. 区域: “左上角有多少个奇怪的贴纸?”
  3. 动作: “指点出左上角每一个奇怪的贴纸。”

根据 ROSE 这篇论文,当今许多最聪明的 AI 模型在回答前两个问题时表现出色,但在处理第三个问题时却表现糟糕。它们可以完美地数出奇怪贴纸的数量,但当你要求它们根据特定规则去“物理性地指点”时,它们就会感到困惑,要么指错了地方,要么指到了区域之外的贴纸。

以下是该论文发现的详细拆解,使用了简单的类比:

1. 问题所在:“我能看见,但我无法执行”

研究人员称之为**“感知到行动的差距”(Perception-to-Action Gap)**。

把 AI 想象成一位非常聪明的图书管理员,她能瞬间告诉你书架上有多少本红色的书。但如果你要求她“去第三层书架,找到那些红色的书,然后把它们抽出来”,她可能会愣住。她知道要找什么,但她难以将这种知识转化为在新的规则下进行特定、精确的动作。

论文发现,即使是最好的 AI 模型(如 GPT-5.5 或 Gemini),在从仅仅是“计数”切换到“点击特定位置”时,性能都会显著下降。有些模型的准确率下降了近 45%,仅仅是因为任务从“告诉我数量”变成了“展示位置”。

2. 测试方法:“异类”网格游戏

为了证明这一点,团队构建了一个名为 ROSE 的基准测试。

  • 设置: 他们创建了数千张充满几乎完全相同的物品(例如看起来非常相似的汉字,或渲染风格略有不同的表情符号)的网格图像。
  • 转折: 在每张图像中,都有一个“多数派”物品(正常的那个)和几个“例外”(奇怪的那些)。
  • 挑战: AI 必须玩一个规则每次都在变化的比赛,但图片本身保持不变。
    • 第一轮: 数出所有奇怪的贴纸。
    • 第二轮: 只数特定方框内的奇怪贴纸。
    • 第三轮: 点击方框内的奇怪贴纸。
    • 第四轮: 点击方框外的奇怪贴纸。

这就像是在玩一个“找沃尔多”(Where's Waldo)的游戏,规则从“找沃尔多”变成“只在厨房里找沃尔多”,再变成“触摸厨房里的沃尔多”。图片没有变化,但 AI 接收到的指令变了。

3. 结果:“计数 vs. 点击”的差距

结果令人惊讶:

  • 人类: 几乎完美。如果给人类看网格并要求他们计数,然后再要求他们点击,他们可以完成这两项任务,准确率接近 100%。
  • AI 模型: 它们通常能正确计数(感知)。但当被要求点击特定位置时(行动),它们经常失败。
    • 例子: 一个模型可能正确地说:“总共有 3 个奇怪的贴纸。”但当被要求点击左上角的那些时,它可能会点击 3 个贴纸,其中一个实际上是在角落之外的,或者它可能会点错那 3 个。

论文表明,知道答案并不等于能够执行答案。 AI 会“卡”在全局图像上,而忘记应用局部规则(比如特定的方框或排除区域)。

4. 为什么会这样?

研究人员深入研究了 AI 失败的原因。这不仅仅是因为 AI 不擅长数学或看不见像素。

  • 这不是格式错误: AI 不仅仅是打错了字。它实际上是选择了错误的坐标。
  • 这是一个“上下文”问题: AI 难以将全局理解(“我看到了 3 个奇怪的东西”)重新校准为特定的上下文(“但我只想要蓝色方框里的那些”)。
  • “锚定”失败: 有时,AI 会被总数“锚定”。如果它看到总共有 3 个奇怪的东西,而你要求它找方框里的,它可能仍然会尝试点击 3 个东西,即使方框里只有 2 个。它无法放下最初的那个数字。

5. 核心启示

论文得出结论,虽然 AI 在“观察”和“描述”世界方面变得非常出色,但在面对规则变化时,它在通过“精准行动”来作用于世界方面仍然很吃力。

这就像一位司机,他能从一英里外一眼识别出红灯(感知),但当红灯亮起时,他却很难精准地踩下刹车,尤其是在有其他车辆或标志物干扰视线的情况下(行动)。

ROSE 基准测试是一个旨在衡量这种差距的新工具。它帮助研究人员意识到,要让 AI 在现实任务(如点击屏幕上的按钮或在房间里导航)中真正发挥作用,它需要更好地实现从“所见”到“针对当前情况做出精准动作”的转化。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →