← 最新论文
🤖 AI

MIRA-Math: A Benchmark for Minimal Information Requesting and Mathematical Reasoning

该论文介绍了 MIRA-Math,这是一个包含 2,310 个数学问题的确定性基准测试,其中求解器必须在严格的预算内识别并请求单个缺失的原子事实,然后再计算最终答案,从而能够对语言模型的信息寻求能力和推理能力进行分别评估。

原作者: Charbel Al Bateh, Samer Saab Jr

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Charbel Al Bateh, Samer Saab Jr

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试解决一个复杂的谜题,比如数独或数学题。通常情况下,当你参加考试或使用智能计算机程序时,你会得到完成整个画面所需的所有碎片。你只需要把它们正确地组合在一起即可。

但在现实世界中,信息往往是不完整的。你可能知道游戏的规则,但不知道分数是多少。或者你知道食谱,但不知道该加多少盐。

MIRA-Math 是一种全新的“测试”,旨在观察 AI 模型(比如我们今天使用的智能聊天机器人)是否能够处理这种特定情况:意识到自己不知道什么,并能为了完成任务而询问完全正确的那个信息碎片。

以下是论文通过简单的类比进行的解释:

1. “缺失食材”游戏

大多数针对 AI 的数学测试就像是给一位厨师一份完整的食谱和所有的食材,然后要求他们烤制蛋糕。测试的内容是:“你能烤出这个蛋糕吗?”

MIRA-Math 则不同。它给出的食谱是刻意不完整的

  • 设定: AI 看到一个数学问题,但其中一个关键数字或事实被隐藏了(就像缺失了一样食材)。
  • 目标: AI 必须意识到缺少了某些东西,用自然语言询问它,然后利用这个新事实来解决问题。
  • 难点: AI 有严格的“预算”。它只能提问几次。如果它问错了问题,或者问得太模糊,它就会失败。

2. “严厉的图书管理员”

为了使这项测试公平且精确,论文引入了一个特殊的角色:一个固定信息持有者(可以把它想象成一位非常严谨、按规矩办事的图书管理员)。

  • 图书管理员的任务: 这位图书管理员持有那一个缺失的事实。他们不会帮你解决问题。他们不会给你提示。他们也不会解释事情。
  • 规则:
    • 如果你问:“缺失的数字是什么?”(太模糊),图书管理员会说:“我没有那个。”
    • 如果你问:“变量 X 的值是多少?”(很精确),且图书管理员恰好拥有这个特定的事实,他们会将它交给你。
    • 如果你索要他们没有的东西,他们会说:“不。”

这种设定测试的是 AI 是否能在提问时保持精确,而不仅仅是数学水平高。

3. 两种类型的挑战

研究人员创建了 2,310 个不同的谜题,分为两类:

  • 类型 A(“固定槽位”): AI 知道缺失的部分在哪里
    • 类比: 想象一张表格,上面有一个空白行写着“出生日期:______”。AI 知道它需要询问出生日期。测试的重点是:它能否正确地询问日期,并利用该日期解决数学问题?
  • 类型 B(“隐藏槽位”): AI 必须找到缺失的部分在哪里。
    • 类比: 想象一张表格,其中十行中的一行是空白的,但并没有说明是哪一行。AI 必须观察整个表格,判断出:“哦,‘电话号码’这一行是空的,”然后询问那个特定的信息。这更难,因为 AI 必须先进行诊断。

4. 测试揭示了什么

研究人员测试了许多不同的 AI 模型(包括非常聪明的一些和规模较小的模型),并发现了一些令人惊讶的事情:

  • “询问”与“解决”是不同的技能: 仅仅因为一个 AI 擅长提出正确的问题,并不意味着它擅长随后的数学计算。
    • 例子: 一个 AI 提出了完美缺失的事实(像一位出色的侦探),但随后在进行计算时失败了(像一位糟糕的会计)。
    • 例子: 另一个 AI 完美地完成了数学计算,但却询问了错误的事实,导致它无法得到答案。
  • 练习并不总是有效: 研究人员尝试向 AI 展示如何提问的示例(类似于“小抄”或“4-shot prompting”)。有时这会有所帮助,但通常反而让 AI 表现得更差
    • 原因: AI 开始过于僵化地模仿这些示例。它不再观察当前具体的题目,而是机械地重复它在示例中看到的模式,即使当前的题目需要不同的提问方式。

5. 为什么这很重要

作者表示,这个基准测试就像是医生的诊断工具

  • 现有的测试告诉你在拥有所有笔记的情况下,一名学生能否解决问题。
  • MIRA-Math 则告诉你在识别自己的知识盲区并有效地进行沟通以填补空白方面,表现如何。

论文总结道,对于 AI 而言,要在信息往往不完整的现实世界中真正发挥作用,它需要掌握这项特定技能:明确知道自己要问什么,并能正确地使用得到的答案。

简而言之: MIRA-Math 不仅仅是在测试 AI 是否会做数学;它是在测试 AI 是否能够承认自己不知道什么,并能通过询问正确的问题来解决问题,而不是感到困惑或瞎猜。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →