← 最新论文
💬 NLP

Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains

Relay-Bench 是一个全方位的纯文本基准测试,旨在通过呈现需要在一个提示词内整合编程、数学和网络搜索等多种技能的非饱和复合问题,来评估大语言模型在多领域推理链上的能力,其中领先模型 GPT-5.5 (xHigh) 取得了 43.3% 的得分。

原作者: Liam Swayne

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Liam Swayne

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:你最喜欢的智能助手不仅仅是一个问答机器人或代码处理机,而是一个真正的多任务处理大师。在人工智能这一飞速发展的领域中,研究人员不断地构建“基准测试”(benchmarks)——这本质上就是标准化的考试——来观察这些数字大脑究竟有多聪明。长期以来,这些测试就像学校里的独立学科:一场数学考试,一场历史考试,还有一场编程考试。但现实生活并非如此运作。当你要求一个人规划一次旅行时,他们不仅仅是在计算距离;他们还会查看天气、阅读评论、预订酒店,甚至可能给朋友写一封有趣的邮件,所有这些都在一次行动中完成。本文深入探讨了人工智能研究中的一个特定领域,即“推理链”(reasoning chains),其目标是观察一个模型是否可以在不掉链子的情况下,同时处理多种不同类型的任务。大家最关心的大问题是:这些人工智能模型能否处理现实世界中那些混乱、复杂且多步骤的问题,还是会在事情变得过于繁杂时感到困惑并放弃?

于是有了 Relay-Bench,这是一个全新的、极具挑战性的测试,旨在观察人工智能模型是否能够进行一场思维的“接力赛”。该测试的创造者并没有要求模型解决一道数学题或写一首诗,而是将一系列不同的任务串联在一起——比如解开一个数学谜题、在网上寻找一个特定的事实、编写一段代码,以及解码一段秘密信息——并将它们全部放入一个单一的、巨大的提示词(prompt)中。把它想象成一个电子游戏关卡:你必须跳过一个深坑,解开一个谜题以打开一扇门,然后击败一个头目,而且整个过程不能按下“重置”键。研究人员构建了 31 个这类复杂的挑战,其中一些挑战内容极其冗长且充斥着虚假信息,读起来就像为了找一个数字而不得不读完一部小说。他们还加入了一个“秘密代码”层,即指令中的每一个单词都被替换成了一个奇怪的三字母代码,迫使人工智能在开始解决问题之前必须先解码信息。

当他们让当时最顶尖的三款人工智能模型(GPT-5.5、Gemini 3.1 Pro 和 Claude Opus 4.7)通过这场严酷的考验时,结果令人有些震惊。即使是最聪明的模型 GPT-5.5,也只答对了大约 43.3% 的问题。这还不到一半!其他模型的得分甚至更低,其中一个模型仅达到了 16.7%。论文指出,虽然这些人工智能模型在处理单一任务方面已经做得非常出色,但当被要求将多种不同的技能串联在一起时,尤其是当指令令人困惑或任务非常漫长时,它们会表现得非常吃力。事实上,这项测试非常困难,许多模型干脆直接放弃,或者陷入循环,无法完成这场比赛。

研究人员还发现,这些模型有时会产生“幻觉”(hallucinate),这是一个高级说法,意指当它们不知道答案时会编造答案。其中一个模型 Claude Opus 4.7 非常谨慎;它拒绝回答许多经过编码的问题,这很可能是因为它的安全过滤器过于严格。另一个模型 Gemini 3.1 则尝试更多地进行猜测,但最终导致了更多的错误答案。这项研究强调,当前的人工智能模型距离我们所期望的全能专家还有很长的路要走。它们就像是那些能考满分数学试卷,但如果你要求他们在做数学题的同时还要翻译一首诗并搜索一份食谱时就会陷入恐慌的天才学生。作者认为,可能还需要一到两年的时间,人工智能模型才能足够优秀,从而能够稳定地通过这种“接力赛”式的测试,并警告说,随着模型变得越来越聪明,这些测试也需要变得更加困难才能跟上步伐。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →