← 最新论文
💬 NLP

MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation

本文介绍了 MTR-Bench,这是一个包含 40 项任务和 3,600 个实例的全面、全自动基准测试,旨在评估大语言模型的多轮交互推理能力,并揭示即使是最先进的模型在此类任务上也表现不佳。

原作者: Xiaoyuan Li, Keqin Bao, Yubo Ma, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoyuan Li, Keqin Bao, Yubo Ma, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在测试一款新型汽车引擎。到目前为止,你只在一条完美平整的高速公路上直线驾驶过它。引擎运行完美!但你尚未在颠簸的土路、交通拥堵中,或在尝试平行泊车时测试过它。在你亲眼目睹它如何应对驾驶中混乱、来回往复的现实之前,你无法真正判断它是否是一款“好”引擎。

这正是这篇论文MTR-Bench为人工智能(AI)所做的事情。

问题所在:“一次性”测试

目前,大多数针对人工智能(大型语言模型)的测试都如同那条笔直的高速公路。它们向 AI 提出一个问题,AI 给出一个答案。

  • 测试:"2 加 2 等于几?”
  • 答案:"4。”

但现实生活并非如此。现实中的问题解决是一场对话。它是“二十个问题”游戏、一场国际象棋对弈,或是寻找遗失物品时的过程:你需要问“它在厨房吗?”“不在。”“它在卧室吗?”“不在。”“它在床底下吗?”“在!”

作者们认为,当前的 AI 模型擅长应对这种“笔直高速公路”式的测试,但在需要多轮推理的游戏中往往表现不佳——即你需要记住之前的回答、调整策略,并持续进行直到解开谜题。

解决方案:MTR-Bench(“障碍赛”)

为了解决这一问题,研究人员构建了MTR-Bench,这是一个庞大且自动化的 AI“障碍赛”。他们不再只问一个问题,而是设置了一个游戏,让 AI 与计算机裁判反复对弈。

以下是他们的“障碍赛”运作方式,分为四类挑战:

  1. 侦探游戏(信息探查):

    • 类比:想象一个“猜猜是谁”的游戏,但计算机隐藏着一份秘密的间谍名单。你可以问:“这群三个人里有间谍吗?”计算机回答“是”或“否”。你必须提出聪明的问题,才能确切找出谁是间谍。
    • 挑战:如果你反复问同样的问题,你无法获胜。你必须利用答案来推断真相。
  2. 变形密码(动态适应):

    • 类比:想象你在猜测一个密码。你猜"1234",错了。但这里有个转折:每次你猜错,密码都会根据一个秘密数学规则改变。你必须猜测、观察结果、推断出规则,然后再次猜测。
    • 挑战:目标在不断移动。你不能仅仅死记硬背答案;你必须适应不断变化的规则。
  3. 盲人迷宫(状态操作):

    • 类比:你身处迷宫中,但地图是隐藏的。更糟糕的是,你控制器上的按钮可能被交换了!你按下“上”,角色却向“下”移动。你必须按下按钮,观察去向,并试图在到达出口的同时,推断出迷宫的隐藏规则。
    • 挑战:你必须在游玩的过程中学习这个世界的规则。
  4. 棋局对弈(策略博弈):

    • 类比:与计算机对手进行国际象棋或跳棋对弈。你走一步,计算机走一步,你必须提前规划三步,思考对手下一步会做什么。
    • 挑战:你需要长期规划,而不仅仅是快速反应。

结果:AI 仍在学习行走

研究人员在 20 种不同的 AI 模型上运行了这项测试,其中包括当今最智能的模型(如 o3-mini 和 R1)。以下是他们的发现:

  • “聪明”的模型仍在挣扎:即使是那些能一次性解决复杂数学问题的最先进 AI 模型,也常常在这些交互式游戏中陷入困境。它们会忘记两轮之前学到的内容,或者做出违规操作(例如试图穿墙而过)。
  • 难度至关重要:随着游戏难度增加(玩家更多、迷宫更大),AI 的性能显著下降。
  • 速度与智慧:有趣的是,答对最多问题的模型(o3-mini)并不是最快的。它花费了更多轮次来解开谜题,因为它在深入思考并检查自己的工作。那些“快速”的模型往往犯错,不得不从头开始。
  • 小模型迷失方向:较小的 AI 模型(“脑细胞”更少)基本上完全无法玩这些游戏。它们无法遵循规则或记住对话。

核心结论

该论文总结道,我们一直在错误的方向上测试 AI。我们测试的是它们背诵事实或解决单个数学问题的能力。但要构建真正有用、能在现实世界中帮助我们的 AI,我们需要测试它们的交互式推理能力——即随时间推移进行交谈、倾听、适应和规划的能力。

MTR-Bench是 AI 为这些现实世界对话进行训练的新健身房。目前的结果显示,即使是当今的“冠军”模型,在真正掌握这项游戏之前,仍有大量工作要做。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →