NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning
该论文介绍了 NoRA,这是一个包含 1,420 个带注释视频剪辑的视觉第一视角基准测试,旨在通过显式的“事实-推理-动作”支持图谱,评估多模态系统生成并证明合理动作的能力,并揭示了当前的模型尽管通常能识别出看似合理的单个动作,但在构建完整的动作空间以及将动作正确绑定至可见证据方面仍存在困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是对论文 NORA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning(NORA:评估视觉第一视角规范性行动推理中的具身合理性)的解析,通过简单的概念和日常类比进行了拆解。
核心问题:知晓 vs. 执行
想象你正在教一个机器人在繁忙的公园里走路。
- 旧方法: 你给机器人展示三个选项:“A) 向左走”,“B) 向右走”,或 “C) 坐下”。机器人选择了 “B”。你检查 “B” 是否为“正确”答案。
- 本文对现状的批判: 这就像是在做选择题。但在现实生活中,没有人会递给你一份只有三个选项的菜单。你必须观察情境,弄清楚正在发生什么,构思出属于你自己的行动清单,然后从中选出最好的一个。
作者认为,目前的 AI 模型擅长从给定的菜单中挑选正确答案(就像在考试中靠猜来选答案的学生),但它们不擅长构思这个“菜单”本身,也无法解释为什么要选某道菜。
解决方案:NORA(“推理健身房”)
作者创建了一个新的测试系统,名为 NORA(规范性行动推理)。NORA 不再只是问 AI “我该做什么?”并检查答案是否符合预设的正确答案,而是要求 AI 同时完成三件事:
- 观察场景: 观看一段以第一视角拍摄的视频片段(类似于戴在头上的 GoPro 视角)。
- 构建菜单: 生成一份接下来可以采取的合理行动清单。
- 证明选择的合理性: 针对清单上的每一个行动,根据视频中实际可见的内容,解释其为何合理。
类比: 把 NORA 想象成一场烹饪比赛,而不是一场选择题考试。
- 旧测试: 评委给你三种食材,问你:“哪一个最好?”
- NORA: 评委向你展示一个厨房,台面上很乱,还有一个饥肠辘辘的客人。你必须:
- 识别台面上的食材(事实/Facts)。
- 想出几种你可以做的料理(候选行动/Candidate Actions)。
- 解释为什么“意面”是一个好选择,因为“客人饿了”且“我们有番茄”(理由/Reasons)。
- 至关重要的一点是: 如果你说“我要做牛排”,但台面上根本没有肉,那么即使“牛排”是个很棒的主意,你也失败了。
如何衡量成功:“支持图谱”(The Support Graph)
论文引入了一种特定的评分方式,称为具身合理性得分(Genced Reasonableness Score)。他们不仅看最终答案,还要看“支持图谱”。
想象一棵树:
- 根部(事实/Facts): 实际看到了什么?(例如:“有一个小孩在跑”,“地面是湿的”)。
- 树干(理由/Reasons): 这为什么重要?(例如:“小孩可能会滑倒”,“在湿草地上跑步很危险”)。
- 果实(行动/Actions): 我们应该做什么?(例如:“拦住小孩”,“走到干燥的草地上”)。
评分标准:
- 行动一致性(Action Alignment): AI 是否提出了一个好的“果实”列表?
- 事实具身性(Factual Grounding): “根部”是真的吗?(AI 是否凭空捏造了一个并不存在的孩子?)
- 支持绑定(Support Binding): “果实”是否连接到了正确的“根部”?(AI 说“拦住小孩”是因为“湿草地”,还是因为它看到了一个并不存在的“狗”?)
研究发现:“看似合理实则错误”的陷阱
研究人员使用这个新的“健身房”测试了 12 种不同的 AI 模型(包括 GPT-5 和 Gemini 等知名模型)。以下是他们的发现:
- 它们擅长描述房间: 大多数 AI 都能正确识别可见的事实(例如:“那里有一台割草机”)。
- 它们能勉强挑选“果实”: 它们通常能选出一个合理的行动(例如:“继续割草”)。
- 它们在“菜单”和“为什么”上栽了跟头:
- 缺失菜单: 它们难以生成一份完整的合理选项列表。它们经常遗漏人类会考虑的其他替代行动。
- 逻辑连接松散: 它们往往选出了一个好的行动,却挂钩了错误的理由。例如,它们可能会说“继续割草”是因为“天气很好”,而真正的理由(在视频中可见的)应该是“草很长,需要修剪”。
类比: 想象一个学生举手说:“答案是 42!”
- 旧测试: 如果 42 是正确答案,他就得了 A。
- NORA 测试: 老师问:“请写出你的计算过程。” 学生回答:“因为 6 乘以 7 等于 42。”
- 如果题目原本是“求 1764 的平方根”,这个学生虽然给出了答案 42,但由于他没有针对特定问题展示出正确的推理过程,他在测试中是不及格的。
- NORA 发现,目前的 AI 擅长大喊“42!”,但却很难展示出数学逻辑,以此证明为什么 42 是针对这段特定视频的最优选择。
三种“提示词”(Prompt)风格
为了测试 AI 的思考方式,研究人员用三种不同的方式提问(就像改变烹饪比赛的规则):
- 直接式(Direct): “直接告诉我该做什么。”(不允许解释)。
- 深思熟虑式(Deliberate): “边想边说。列出几个选项并解释它们,然后选出一个。”
- 结构化式(Structured): “填写这个特定表格:列出事实、列出理由、列出行动,然后选一个。”
结果: “结构化”方法(填写表格)有助于表现最好的 AI 模型发挥得更好。它迫使它们放慢速度,并将事实与其行动联系起来。然而,对于其他一些模型来说,强制要求它们填写表格反而让它们表现变差了,就好像这些死板的规则干扰了它们的思维。
总结
论文得出结论:虽然 AI 在“观察”和“挑选”方面正在进步,但它们在**经过证实的推理(Justified Reasoning)*方面仍面临挑战。它们通常能猜中正确的动作,但无法可靠地仅根据视频中看到的内容来解释为什么*这个动作是正确的。
NORA 是一个衡量这一差距的工具。它将问题从“AI 能否选出正确答案?”转向了“AI 能否构建一个逻辑严密、基于视觉事实且足以自圆其说的论据?” 目前来看,答案是:它们正在接近,但仍未看到全貌。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。