Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?
该论文介绍了 Skill-Use,这是一个评估 LLM 智能体是否能够在隔离环境中独立识别并正确应用结构化技能的基准测试,研究揭示了可靠的技能使用仍然是一个重大挑战,且在很大程度上取决于特定的智能体框架,而非模型本身固有的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一名超级聪明、极具创造力的实习生,他既能写代码,又能分析数据,还能起草邮件。你给了他一大堆“技能书”。每本书都是一个特定工作的配方,比如“如何修复损坏的服务器”或“如何撰写法律合同”。但问题在于,你并不会一次性把整本书交给他。相反,你只向他展示书名和封底上的一段简短介绍。如果他认为这本书相关,他就必须申请获取,找到完整的指令,然后必须完全按照这些指令操作,不得跳过任何步骤,也不得做任何被禁止的事情。这就是 AI “智能体”(agents)尝试使用“技能”的世界。曾几何时,人们希望只要给这些 AI 实习生合适的书,他们就能瞬间变成完美的员工。但没人真正知道 AI 是否真的能搞清楚该抓取哪本书,还是只会凭直觉瞎猜。
来自腾讯混元及数所顶尖大学的研究团队决定对这个想法进行测试。他们构建了一个名为 SKILL-USE 的巨大游乐场,这是一个旨在测试 AI 智能体是否真的能“察言观色”并正确使用这些技能书的基准测试。他们不仅仅问:“AI 完成任务了吗?”他们还提出了三个更难的问题:触发(Trigger)(AI 是否知道该去拿那本正确的书?)、合规(Compliance)(它是否严格按照步骤执行配方?)以及边界(Boundary)(它是否避开了书中列出的所有禁忌行为?)。他们测试了 177 个不同的现实世界任务,涵盖了从修复软件漏洞到编写业务报告的各种场景,并使用了 79 份真实的技能文档和目前最顶尖的 8 个 AI 模型。
结果却让人清醒。研究人员发现,即使是最优秀的 AI 配置,其“技能使用”(Skill-Use)得分也仅为 0.613 左右(分值为 0 到 1)。这意味着可靠的技能使用仍遥不可及。最大的问题不在于 AI 在拿到书后无法遵循规则,而在于 AI 经常根本不知道该去拿那本书。这就像是拥有一个能完美遵循食谱的天才厨师,但他总是会忘记去打开冰箱拿食材。此外,研究人员发现,AI 的表现并不单纯取决于模型的“聪明程度”;它在很大程度上取决于其外部的“框架”或软件封装。改变这个封装就像是改变厨房的布局:有时同一个厨师会变得出类拔萃,而有时却会跌跌撞撞。
简而言之,这篇论文表明,仅仅给 AI 智能体一个技能库并不会自动让他们变成更好的员工。“拥有技能”与“使用技能”之间存在着巨大的鸿沟。AI 经常无法识别何时适用某种技能,或者在面对过多选择时会被错误的技能分散注意力。虽然 AI 在避免违规动作方面正在进步,但在忠实遵循复杂程序方面仍然很吃力。作者总结道,我们不能假设这些智能体会神奇地学会使用它们的工具;我们需要构建能够帮助它们识别“何时”使用技能以及“如何”坚持计划的系统,因为目前,这正是这个谜题中最难的部分。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。