← 最新论文
🤖 AI

LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?

LLM-WikiRace 基准测试通过要求大语言模型在维基百科超链接中进行导航,来评估其规划与推理能力,结果表明虽然前沿模型在简单难度上达到了超越人类的表现,但由于在长程规划和从失败中恢复方面的局限性,它们在面对困难难度时仍然表现得十分吃力。

原作者: Juliusz Ziomek, William Bankes, Lorenz Wolf, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Juliusz Ziomek, William Bankes, Lorenz Wolf, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在玩一场“维基百科兔子洞”游戏。你的起点是关于香蕉的页面,目标是通过点击文章中的蓝色超链接到达法拉利的页面。你不能使用地图,你也看不到整个互联网,而且你的点击次数(步数)是有限的。如果你点错了链接太多次,你就会陷入循环或耗尽步数并输掉比赛。

这就是 LLM-WikiRace,一个由研究人员创建的新测试,旨在观察人工智能(AI)在处理现实世界问题时究竟有多聪明。

以下是该论文的研究结果,使用了简单的类比进行说明:

1. 测试:没有地图的迷宫

大多数 AI 测试要求计算机解决数学问题或编写代码。这个测试则不同。它要求 AI 在一个由人类知识构成的巨大、隐形的迷 Maze(迷宫)中进行导航。

  • 设置: AI 会看到当前页面、目标页面以及 50 个可以点击的候选链接。
  • 挑战: AI 必须猜出哪个链接能让它离目标更近。它看不到“最短路径”(就像没有 GPS 那样);它必须利用其内部对世界运作方式的记忆来制定计划。

2. 结果:擅长走路,不擅长奔跑

研究人员测试了许多著名的 AI 模型(如 Gemini、GPT-5 和 Claude)。

  • 简单关卡: 当目标很近(仅需 3 或 4 次点击)时,顶尖的 AI 就像经验丰富的徒步旅行者。它们的成功率约为 90% 到 96%。它们非常了解相关知识。
  • 困难关卡: 当目标很远(需要 7 或 8 次点击)时,AI 会迷失方向。即使是最聪明的模型(Gemini 3.1),在这些游戏中的成功率也仅为 29%
  • 启示: 论文声称,虽然这些 AI 的大脑中拥有庞大的事实库,但它们很难利用这些事实来进行长期规划。它们擅长知道事物“是什么”,但不擅长思考如何从 A 点到达 B 点(当路径很长时)。

3. “规划差距”:知晓 vs. 执行

研究人员发现了一个有趣的现象,称为**“规划差距”(Planning Gap)**。

  • 想象两个正在参加考试的学生。两名学生掌握的历史事实(世界知识)完全相同。
  • 学生 A(标准 AI)只是死记硬背事实。
  • 学生 B(“推理型” AI)经过训练,能够循序渐进地思考问题。
  • 结果: 尽管两人掌握的知识量一样,但学生 B 的得分比学生 A 高出多达 20%
  • 教训: 仅仅拥有知识是不够的。你需要一个特殊的“推理引擎”将这些知识转化为获胜策略。

4. 致命缺陷:陷入循环

最令人惊讶的发现是 AI 是如何失败的。

  • 循环: 当 AI 犯错时,它不会说:“好吧,这条路行不通,让我们尝试另一种方法”,而是经常在同一个链接上反复点击。
  • 比喻: 这就像一个人在森林里绕圈走。他们意识到:“噢不,我以前来过这里”,但他们并没有转身离开,而是继续在同一个圈子里徘徊,直到时间耗尽。
  • 数据: 在最难的游戏中,顶尖模型有 86% 的时间陷入了循环。一旦陷入循环,它们几乎无法逃脱。它们不擅长“重新规划”。

5. 训练有帮助,但效果有限

研究人员尝试通过提供练习回合(微调)来“教”一个较小的 AI 模型如何玩这个游戏。

  • 结果: 该模型在简单游戏中表现得好得多(成功率从 22% 提升到 67%)。
  • 局限性: 然而,这种训练对困难游戏毫无帮助。在最难的关卡中,该模型的成功率仍然是 0%。
  • 结论: 你不能仅仅通过简单的练习来“教” AI 解决这些难题;这种底层长期规划能力的缺失似乎是无法通过这种方式弥补的。

总结

LLM-WikiRace 是一个简单但残酷的测试。它表明,虽然今天的超级智能 AI 头脑中装着一部巨大的百科全书,但当旅程漫长时,它们在其中导航的能力仍然很差。如果出口就在门边,它们能找到出口;但如果必须穿过迷宫,它们往往会感到困惑、重复错误并最终放弃。

论文得出结论:为了让 AI 真正掌握复杂任务,它们需要变得更擅长提前规划以及在情况出错时改变主意,而不仅仅是掌握更多的知识。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →