← 最新论文
🤖 AI

Lomekwi: Resource-Bounded Tool Discovery in LLM Agents

本文提出了一个受认知科学启发的框架,将工具发现分解为好奇心、识别和效率,并通过对组合博弈和真实任务环境的分析,揭示了识别能力随模型规模增大而反向缩放的现象。

原作者: Roshan Klein-Seetharaman, Daniel Wang, Andrew Xu

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Roshan Klein-Seetharaman, Daniel Wang, Andrew Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观察一个机器人在一个新世界中学习生存。长期以来,科学家们一直在通过递给机器人一个工具箱并问道:“你能用这把锤子修好墙吗?”或者“你能用这把扳手拧紧那个螺栓吗?”来测试这些机器人。如果机器人修好了墙,我们就说它是聪明的。但这就像是在测试一名厨师时,只问他们能否使用刚递到手边的刀,却从未观察过他们是否会主动想到去拿一把刀。在现实世界中,在野外环境中,聪明不仅仅是使用你已经知道的工具;而是当你看到一堆随机的废料时,能意识到:“嘿,如果我把这两样东西拼在一起,我就能造出一个工具!”这篇论文深入探讨了这一缺失的环节:发现的时刻。它提出了一个简单但棘手的问题:随着机器人(特别是人工智能语言模型)变得越来越大、越来越聪明,它们是真的变得更擅长“发明”自己的工具了,还是仅仅变得更擅长使用那些被告知要使用的工具了?

这项研究的研究人员与来自耶鲁大学和 Sea12 Technologies 的团队合作,决定不再仅仅测量机器人是否赢得了比赛。相反,他们将游戏分解为三个不同的步骤,就像发明过程中的食谱一样。首先是好奇心:机器人是否甚至会寻找它需要的零件?第二是识别能力:一旦拥有了零件,它是否能意识到:“噢,我可以把这些组合起来做成一台机器”?第三是效率:一旦制造出机器,它是否真的能利用它来获胜?他们构建了一个名为“Lomekwi”的特殊数字游乐场(以人类历史上首次使用石器的真实地点命名)来测试这一点。在这个游戏中,机器人必须打开锁着的门。它可以尝试暴力破解每一扇门直到找到钥匙(这是一个缓慢、枯燥的过程),也可以寻找特定的碎片,将它们组合成一台机器,并利用这台机器瞬间打开门。

这里出现了一些奇怪且违反直觉的情况。你可能会预期规模更大、功能更强大的 AI 模型会在所有方面都表现得最好:寻找零件、意识到如何制造机器以及使用机器。但论文表明发生了一些令人惊讶的事情。虽然最大的模型擅长“苦干”(通过手动解决问题)并且一旦拥有工具后效率极高,但它们似乎失去了识别能力。这就像是最聪明的模型对自己在通过蛮力解决问题方面的能力过于自信,以至于它们不再寻找捷径。它们忽略了那个可以制造出来的精巧机器,因为它们心想:“我自己就能搞定。”

事实上,研究人员发现,随着模型的规模变大,它们在发现制造工具的机会方面反而变得更差了。在一项实验中,一个较小的模型比一个庞大的、超级智能的模型更有可能发现工具的配方。大模型太忙于尝试用自己的“肌肉”来解决谜题,以至于错过了“大脑”方案。然而,论文也指出这可能是一个更大模式的一部分。当研究人员给大模型一点提示,暗示可能存在某种工具时,大模型突然“醒”了过来并开始重新寻找,这表明它们并非没有能力,只是过于自信了。

那么,这一切意味着什么?事实证明,“工具使用者”和“工具发明者”是两种完全不同的技能。一个模型可以成为使用递到手边的工具的天才,但在意识到自己需要工具这件事上却是个彻头彻尾的失败者。论文指出,随着 AI 规模的扩大,我们可能会看到这种创造性的发现火花有所下降,这并不是因为 AI 变笨了,而是因为它对自己无需帮助就能通过苦干解决问题的能力过于笃定了。这提醒了我们,有时候,你能做的最聪明的事就是停止试图独自完成一切,转而寻找一个工具来帮助你。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →