← 最新论文
💻 computer science

QuoteBench: How Matched Scores Can Hide Command-Path Failures

该论文引入了 QuoteBench,这是一个基准测试,旨在证明大语言模型(LLM)编程智能体中匹配的执行分数往往掩盖了由执行路径序列化和解析引起的显著指令生成失败,从而揭示了模型的排名和性能在很大程度上取决于特定的部署配置,而非其内在能力。

原作者: Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在建造一个机器人厨师。你给它一个用普通英语编写的食谱,它应该将其转化为一套精确的指令,供厨房机器执行烹饪。在人工智能的世界里,这些“机器人”就是大语言模型(LLM),而“厨房机器”则是运行代码的计算机系统。长期以来,科学家们一直在通过测试最终的菜肴是否美味来测试这些机器人。如果机器人说“切洋葱”,而计算机确实切了洋葱,大家都会欢呼雀跃。

但有一个棘手的部分:信息是如何从机器人传递到机器的。有时,信息会经过一个翻译器、一个包装器或一个中间人,在机器看到句子之前对其进行重写。这就像寄信。如果你写下“别忘了盐!”,而中间人读了它,因为标点符号感到困惑,并意外地将其改成了“别忘了盐!”(意思发生了变化),机器可能会加入过多的盐。问题在于,如果你只检查最终的菜肴,你可能会认为机器人非常完美,尽管中间人搞砸了指令。这个问题是在问:这个机器人写指令的能力是真的好,还是仅仅因为中间人没有搞砸指令而走运了?

这就是 QuoteBench 出场的地方。研究人员创建了一个特殊的测试,以观察人工智能模型是否能在不被“引号”(quoting)规则绊倒的情况下,编写 Bash 命令(这是一种类似于计算机用于管理文件和文件夹的具体技术指令)。在计算机语言中,引号和特殊符号就像交通标志;如果你错过了一个,车就会撞车。团队发现,许多人工智能模型在纸面上看起来表现惊人,但当它们的指令必须经过一个“中间人”(如远程服务器或容器)重新读取时,就会表现得一塌糊涂。

这里有一个转折:研究人员发现,测试这些人工智能的标准方式隐藏着一个巨大的问题。他们将人工智能编写的完全相同的指令通过两条不同的路径运行。在第一条路径中,指令直接发送到计算机。在第二条路径中,指令经过了一个“中间人”,该中间人增加了一层额外的读取过程(例如将指令放入双引号内)。

当他们这样做时,结果令人震惊。对于一些顶尖的人工智能模型来说,成功率大幅下降了——在 55.4% 到 73.2% 之间——仅仅是因为指令必须经过那个额外的层级。这就像一个机器人厨师,当你直接把刀递给它时,它可以完美地切洋葱;但如果你要求它通过扩音器喊出指令,它就会忘记如何握刀。

然而,故事变得更有趣了。研究人员发现,如果他们提前告诉人工智能:“嘿,你的指令将会经过一个中间人,”最聪明的模型实际上可以修复自己的错误。它们会重写指令以变得格外小心。这样做时,它们恢复了 30.4% 到 60.7% 的损失分数。

这导致了一个令人困惑的情况。如果你只看最终得分,一个模型可能看起来近乎完美,却掩盖了它因为中间人而损失了 64.3% 的潜在成功率,随后又因为学会了适应而夺回了 60.7% 的事实。论文称之为仅为 −3.6 分 的“匹配差距”(matched gap)。这看起来是一个微小的差异,但实际上是失败与恢复之间巨大的过山车,而标准测试完全忽略了这一点。

论文指出,我们不能仅仅通过一个单一的“成功得分”来评判人工智能。那个得分就像是一份考试成绩,它没有告诉你学生是否使用了未经授权的帮助,或者老师是否提供了帮助。研究人员表明,取决于你如何设置测试(即“命令路径”),判断哪个人工智能“最好”的排名可能会完全反转。例如,一个模型在直接测试中可能是明显的赢家,但在指令必须经过远程服务器时,可能会落后。

简而言之,这篇论文证明了我们测试人工智能的方式是存在缺陷的,因为它忽略了指令所经历的旅程。仅仅知道人工智能能够编写一条命令是不够的;我们需要知道这条命令是否能顺利抵达计算机。研究人员建议,任何构建或购买这些人工智能工具的人都需要停止仅仅关注简单的得分,而开始询问:“指令是如何到达那里的?是否有中间人?人工智能预先知道这件事吗?”因为如果没有这些答案,高分可能只是一个幻觉。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →