LoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty Ceiling
为了克服现有人工编写搜索基准测试的难度天花板,本文引入了 LoHoSearch,这是一个基于知识图谱的自动化基准测试,包含跨 11 个领域的 544 个复杂、长程问题,显著挑战了当前最先进的搜索智能体,将其准确率降低至 34.74%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:“简单模式”陷阱
想象一下,你正在玩一款电子游戏,目标是寻找一个特定的隐藏宝藏。在过去的一年里,研究人员一直在使用一个名为 BrowseComp 的游戏来测试 AI “搜索智能体”(即能够浏览互联网的机器人)。
起初,这个游戏很难。但由于题目是由人类设计的,他们不小心把题目设计得太简单了。人类倾向于选择著名的事物(比如“埃菲尔铁塔”或“泰勒·斯威夫特”),并用显而易见的线索将它们联系起来。这就像是在一扇贴着“宝藏”标签的门后藏起了宝藏。
因为线索过于明显,最优秀的 AI 机器人很快就学会了解决 90% 的谜题。这导致游戏失去了区分“聪明机器人”与“极聪明机器人”的能力。由于人类设计师并不拥有能够看清整个互联网中还有多少其他“宝藏”符合这些线索的完美地图,因此这种难度达到了一个人类无法突破的“天花板”。
解决方案:构建一张“超级地图”
本文的作者们决定不再依赖人类的直觉猜测。相反,他们基于**知识图谱(Knowledge Graph)**构建了一个庞大的自动化系统。
你可以把这个知识图谱想象成一张覆盖整个互联网(具体为维基百科)的巨大数字地图,其中包含超过 700 万个实体(人、地点、事物)以及它们之间的相互联系。
与其由人类挑选问题,计算机利用这张地图来进行以下操作:
- 寻找“困难”路径: 它会寻找那些存在成千上万种可能答案,而非仅有一两个著名答案的连接点。
- 构建复杂迷宫: 它会创建需要机器人检查许多死胡同才能找到正确路径的问题。
- 验证答案: 它通过数学方法证明只有唯一一个特定的答案符合线索,从而确保谜题的公平性。
新的游戏:LoHoSearch
其结果是一个名为 LoHoSearch(长程搜索)的新基准测试。它包含了跨越 11 个不同主题(如音乐、体育和电影)的 544 个棘手问题。
以下是这个新游戏如何改变规则的:
- 搜索空间巨大: 在旧游戏中,如果线索是“谁唱了这首歌?”,可能只有 5 位著名的歌手。而在 LoHoSearch 中,线索可能是“谁在特定年份、特定流派中唱了这首冷门歌曲?”,其中可能涉及数百名歌手。机器人必须检查所有可能的对象。
- 迷宫错综复杂: 这些问题不仅仅是一条直线。它们更像是一个扭曲的网络,你需要交叉验证那些会循环回溯的线索。你不能靠猜测,必须进行深度思考。
结果:机器人撞上了墙
研究人员在这一新游戏上测试了世界上最聪明的 AI 模型。结果令人震惊:
- 旧游戏: 顶尖模型的得分超过 90%。
- 新游戏: 即便是最强的模型(GPT-5.5)也仅获得了 34.7% 的得分。
这就像是机器人在国际象棋中从“大师”跌落到了连学习新规则都感到吃力的水平。
为什么现有的技巧不起作用
当机器人在困难的谜题面前受阻时,它们通常会尝试一种叫做**“上下文管理(Context Management)”**的策略。想象一位侦探写下了 100 页笔记,如果笔记本快满了,侦探会尝试总结笔记或丢弃旧页面以腾出空间记录新内容。
研究人员在 LoHoSearch 上测试了这些策略。
- 在旧的简单游戏中,这些技巧帮助机器人的表现提升了 14%。
- 在新的困难游戏中,这些技巧仅帮助提升了 6.8%。
这表明,问题不仅仅在于记忆力,更在于“迷宫”本身如此复杂,“搜索空间”如此巨大,以至于机器人们目前的“大脑”还无法处理所需的长链条推理过程。
总结
LoHoSearch 证明了我们不能仅仅通过编写稍微难一点的人类问题来解决问题。为了真正测试 AI 是否变得更聪明,我们需要使用计算机生成的地图来创造在数学上保证具有挑战性的谜题。
这个新的基准测试充当了一个“压力测试”,揭示了当前 AI 的极限。它表明,虽然 AI 擅长寻找简单的答案,但当它必须在一个庞大且复杂的复杂信息网中寻找单一的隐藏真相时,它仍然面临着巨大的挑战。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。