AlloBench: Measuring Online Tool Allocation Capability in LLM Agents
AlloBench 论文引入了一个配对基准测试,证明了虽然前沿大语言模型智能体在抽象文本场景中能够近乎最优地分配工具,但它们在将这种策略能力迁移到实际的代码构建任务时却表现出持续的失败,从而揭示了在线工具分配能力中的一个显著边界。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位飞船船长,燃料供应非常有限。你正穿行于一片小行星带,其中一些小行星只是漂浮的岩石,但另一些则是不断出现的金矿。你的任务是决定:是现在就消耗珍贵的燃料去制造一个巨大的磁铁来捕捉黄金,还是等待并观察黄金是否会持续出现?如果你过早制造磁铁,你可能会把燃料浪费在一块一次性的岩石上;如果你等待太久,你可能会错过那些会重复出现的金矿。这就是“AI智能体”(AI Agents)的日常挣扎——这些聪明的计算机程序试图通过制作工具(如编写代码或创建快捷方式)来帮助我们。科学家们提出的重大问题是:这些AI智能体能否学会像聪明的投资者那样,利用自己的“燃料”(时间和计算能力)进行投资,还是它们只会因为看到任何问题就手忙脚乱地制造工具,即便那是在浪费资源?
这篇论文介绍了一个名为 AlloBench 的新测试,旨在观察世界上最聪明的AI模型是否能做出这些精明的投资决策。研究人员设置了一个游戏,AI必须解决由60个不同数学谜题组成的流。其中一些谜题是“热门”的(出现次数很多),而另一些是“陷阱”(只出现一次)。AI有一个严格的预算:它只能为其中的 3 种谜题类型构建一个可重用的工具(脚本)。如果它为陷阱构建了工具,它就会浪费一个插槽,导致以后无法为热门谜题构建工具。目标是等待、观察模式,然后在确定某个谜题值得投入时才构建工具。
结果有点像在看一位天才学生在数学考试中拿了满分,却在将逻辑应用于现实生活时失败了。当研究人员要求AI以一种简单、抽象的方式来玩这个游戏——比如将彩色球分类到桶里时,顶尖的模型(包括 Claude Haiku、Claude Opus 和 GPT-5)表现得非常出色。它们耐心等待,观察颜色的重复,并在确定值得投入时才构建“桶”。它们的表现就像完美的投资者。
然而,一旦研究人员将游戏改为更具现实意义的任务——要求AI实际编写计算机代码来解决谜题时——AI的大脑似乎短路了。尽管谜题完全相同,但模型不再等待。它们没有检查某个谜题类型是否是“热门”重复项,而是立即为看到的第一个谜题编写了脚本。它们在最初的三个问题上就耗尽了全部3个工具的预算,即使那些问题是永远不会再出现的稀有“陷阱”。
论文发现,这种失败专门发生在AI被迫输出代码时。就好像AI有一个“立即执行”的开关,在它必须输入代码时就会卡住,导致它忘记了思考未来。研究人员尝试训练一个较小的开源AI,让它在抽象游戏中成为更好的投资者,它学会了完美地等待。但当他们要求同一个经过训练的AI编写代码时,它忘记了所学的一切,又变回了那种会立即浪费工具的行为。
简而言之,这篇论文表明,虽然现代AI智能体在抽象规划方面非常聪明,但它们目前很难将这种耐心转化为编写软件的复杂现实任务。它们在理论上知道何时该构建工具,但编写代码这一行为本身似乎让它们变得冲动,导致它们过快地耗尽了资源。这表明,要让AI真正成为构建软件的得力伙伴,我们需要弄清楚如何阻止它们在检查是否真的值得付出努力之前,就急于编写代码。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。