← 最新论文
💻 computer science

NICE FACT: Diagnosing and Calibrating VLMs in Quantitative Reasoning for Kinematic Physics

本文介绍了 NICE 和 FACT,这是一种用于评估和校准视觉 - 语言模型在运动学物理推理中置信度的双重诊断范式,揭示了当前最先进的模型尽管表现出高置信度,却往往无法正确识别视觉前提条件或应用物理定律。

原作者: Jian Lan, Zhicheng Liu, Xinpeng Wang, Yuhao Zhou, Haokun Chen, Jiancheng Lv, Barbara Plank, Thomas Seidl

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Jian Lan, Zhicheng Liu, Xinpeng Wang, Yuhao Zhou, Haokun Chen, Jiancheng Lv, Barbara Plank, Thomas Seidl

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和生动的类比对这篇论文的解释。

全局概览:“自信的傻瓜”问题

想象一下,你正在和一个对物理知识一窍不通却极度自信的学生一起参加物理考试。在一道正确答案为"6.6"的题目中,他猜了"6.9"。

因为 6.9 与 6.6 很接近,传统的评分系统(论文中称为MRA)会给他及格分。但这个系统无法知道他是如何得出这个答案的。他是真的做了计算,还是仅仅在瞎猜?

本文指出,当前的人工智能模型(称为视觉 - 语言模型或 VLMs)就像这个学生。它们有时能给出正确的数字,但它们往往只是“随机鹦鹉”——基于训练数据中的模式进行猜测,而非真正“看懂”视频或理解物理定律。

作者提出了一种评估这些 AI 模型的新方法,称为FACTNICE


第一部分:FACT(“为什么”的诊断)

FACT是一种诊断系统,它将 AI 的思维过程分解为四个具体领域,以查明其失败的原因。这就像机械师拆解汽车引擎以找出故障部件,而不仅仅是看速度表。

作者发现,这些 AI 模型在三种特定的“认知”方式上存在缺陷:

  1. 视觉保真度(“盲点”):

    • 类比: 想象你要计算一辆车的速度,但你不知道相机是拉近了还是推远了。
    • 发现: AI 经常无法识别解决问题所需的基本视觉线索。它没有意识到需要“比例参考”(如背景中的尺子),或者需要在多个帧之间追踪物体。它试图在没有必要“食材”的情况下进行数学计算。
  2. 物理定律理解(“错误公式”):

    • 类比: 一个学生知道“速度”这个词,但在解题时却使用了“加速度”的公式。
    • 发现: 即使 AI 看到了视频,它也经常选错物理公式。它并不真正“懂得”运动学定律;它只是猜测哪个公式听起来是对的。
  3. 时间定位(“迷失在时间中”的问题):

    • 类比: 观看一个球下落的视频,但 AI 认为球下落用了 1 秒,而实际上花了 3 秒。
    • 发现: AI 极不擅长理解事件何时发生。它无法准确地将特定事件与特定时间戳联系起来。如果不知道确切的时间,它所做的任何数学计算都基于幻觉。

第二部分:NICE(“信心”校准)

NICE是一种检查 AI 是否对其确信程度“诚实”的方法。

  • 问题: AI 通常过于自信。如果它猜了"6.9",它可能会说:“我有 100% 的把握这是答案。”但如果你问它关于"6.8"或"7.0"(非常接近正确答案的数字)的情况,它可能会说:“我有 0% 的把握。”
  • 隐喻: 想象一个飞镖玩家,偶然一次投中了靶心,就声称自己是大师,但一旦试图再次投中同一个点,却完全脱靶。他们缺乏“邻域意识”——他们不理解接近答案也是好的。
  • 解决方案(Nicon): 作者创建了一个名为Nicon的新工具来解决这个问题。它迫使 AI 意识到,接近真理的答案也是“好”的。它平滑了 AI 的信心,使其不再将所有赌注押在一个单一数字上,从而使 AI 更加可靠。

结果:他们发现了什么?

作者测试了 6 个最先进的人工智能模型(如 Qwen、Gemma 和 GLM)。以下是他们的发现:

  1. 它们是“盲人”: 这些模型经常无法看到解决问题所需的基本视觉要求。
  2. 它们是“鹦鹉”: 它们并不真正理解物理公式;它们只是模仿使用这些公式的模式。
  3. 它们是“时间盲人”: 它们在视频中准确追踪时间方面存在困难。
  4. 更大并不更好: 论文发现,仅仅让 AI 模型变得更大(增加更多的“脑力”或参数)并不能解决这些问题。一个巨大的模型和一个较小的模型一样困惑。

结论

论文得出结论,我们不能仅通过 AI 答对了多少答案(准确率)来衡量它们。我们需要衡量它们如何得出这些答案。

为了构建能够真正与物理世界互动(如机器人)的 AI,我们需要停止将它们视为仅输出数字的“黑盒”。相反,我们需要使用像FACTNICE这样的工具,迫使它们真正“看懂”视频、“理解”物理,并“知道”自己何时不确定。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →