Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games
本文引入了一个包含 474 个可执行游戏的层级基准测试,通过要求大语言模型主动获取证据并更新信念,来评估其交互式推理能力,从而揭示了前沿模型在效率、上下文鲁棒性和元认知适应性方面存在的显著性能差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在玩一场寻找隐藏宝藏的解谜游戏。在当今大多数针对人工智能(AI)的测试中,游戏主持人会递给你一张已经标出了宝藏位置的地图,并问你:“宝藏在哪里?”这时,AI只需要阅读地图并说出答案即可。这就像是一个静态测试:AI一次性获得所有信息,然后一次性解决问题。
但在现实世界中,我们并不会一次性得到整张地图。我们必须通过提问、观察四周,并随着进程逐步拼凑信息。
这篇论文介绍了一种新的测试 AI 的方法,称为交互式推理(Interactive Reasoning)。研究人员没有给 AI 一张完整的地图,而是创建了一个“黑盒”游戏。AI 只知道游戏的规则。它必须:
- 向游戏提出具体的问题(例如,“钥匙是在地毯下面吗?”)。
- 倾听答案。
- 根据所学到的信息更新自己的信念。
- 决定何时掌握了足够的信息从而可以猜测最终答案。
“游戏板”
为了确保 AI 不仅仅是在记忆事实或利用其通用知识(例如知道“猫有尾巴”),研究人员使用简单的抽象构建模块来构建这些游戏:
- 集合(一组物品)、
- 序列(列表)、
- 树(分支结构)以及
- 图(连接网络)。
他们利用这些模块创建了 474 个不同的游戏,涵盖了从简单的谜题到非常困难的谜题。这确保了测试衡量的是 AI 的逻辑能力,而非其对维基百科文章的记忆力。
“压力测试”
研究人员不仅观察 AI 是否能解决谜题,还增加了两个特殊的“压力测试”,以观察 AI 思维的鲁棒性(稳健性)如何:
1. “干扰项”测试(上下文鲁棒性)
想象你正在解一个谜题,但游戏主持人突然开始谈论天气,或者将“红钥匙”描述为“深红色的、闪亮的物体”,而不是简单的“红钥匙”。
- 测试内容: 他们加入了额外的、无用的词汇,或者更改了事物的名称(例如,在医院的故事中将“节点”称为“患者”),但并未改变实际的逻辑。
- 结果: 许多 AI 感到困惑。它们难以忽略这些“噪音”并专注于核心逻辑,这表明它们很容易受到事物描述方式的影响,而不是关注事物本身的本质。
2. “变心”测试(元认知适应性)
想象你正在解一个谜题,你 90% 确定答案。突然,游戏主持人说:“等等,我刚才说错了。钥匙其实是蓝色的,不是红色的。”
- 测试内容: AI 必须撤回之前的结论,更新自己的思维,并根据新信息重新开始。
- 结果: 这对 AI 来说非常困难。当证据发生变化时,许多模型无法正确更新其信念。它们会继续基于旧的(错误的)信息来尝试解决谜题,就像一个拒绝承认自己走错路的人一样。
研究发现
研究人员测试了几种当今最智能的 AI 模型。以下是他们的发现:
- 它们可以玩,但不高效: 一些 AI 能够解决游戏,但它们需要进行大量的提问(轮次)。另一些则很快,但会出错。表现最好的模型既准确又高效。
- 逻辑类型很重要: AI 擅长演绎推理(如果 A 为真,那么 B 必然为真)。但在归纳推理(猜测模式)和溯因推理(寻找最佳解释)方面表现要差得多。
- “集合”问题: 涉及简单“集合”物品的游戏竟然比复杂的“树”或“图”还要难。看来 AI 在大脑中追踪无序组群的能力较弱。
- “必要性”差距: 当被要求识别哪些信息是解决谜题真正必要的(哪些只是多余的)时,AI 经常丢弃错误的片段。它们可以在证据就在眼前时使用证据,但却无法判断哪些证据是真正核心且不可或缺的。
总结
这篇论文表明,虽然现代 AI 在逐步解决谜题方面正在进步,但在灵活性方面仍面临挑战。它擅长遵循一条直线逻辑,但如果你改变了场景、增加了噪音,或者在途中纠正了一个错误,AI 往往会陷入停滞或陷入混乱。这就像一位非常聪明的侦探,如果线索完美,他能破案;但如果证人改变了说法,他就会溃不成军。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。