Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents
本文提出了“技能即伪代码”(SaP),这是一种自动方法,可将自由形式的 Markdown 技能库转换为具有确定性验证的强类型伪代码,通过提供清晰的类型签名和具体的调用模板,使大语言模型智能体在 ALFWorld 基准测试中实现显著更高的成功率和更低的令牌消耗。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明但字面理解的机器人如何做家务,比如打扫房子或整理厨房。你给机器人一本用普通英语(Markdown 格式)写成的巨大且杂乱无章的说明书。
问题:“困惑循环”
每当机器人需要执行某项任务时,它都必须通读冗长的段落文本,以弄清楚两件事:
- 任务是什么(例如,“移动杯子”)。
- 如何精确地向房屋计算机系统表述(例如,系统只接受命令
move mug to shelf,而不接受put mug on shelf)。
由于指令被埋藏在段落中,机器人经常猜错。它尝试“放置”杯子,房屋系统回应“无反应”,机器人便陷入困惑。随后它重新查阅说明书,再次猜错,从而陷入失败的循环。这浪费了时间,并导致机器人耗尽能量(或在 AI 术语中称为“令牌”)。
解决方案:“技能即伪代码”(SaP)
本文作者创建了一个名为**技能即伪代码(Skill-as-Pseudocode, SaP)**的系统。你可以将其视为一种“翻译器”,它将杂乱的人类说明书重写为机器人专用的整洁、结构化的速查表。
以下是该翻译器的工作原理,使用一个简单的类比:
1. 侦探(发现模式)
想象一位图书管理员翻阅数百本不同的说明书。他们注意到许多说明书以不同方式表达了相同的内容。
- 手册 A 说: “去厨房,拿起盐,把它放进橱柜。”
- 手册 B 说: “在柜台上找到盐,并将其移到碗柜。”
管理员意识到这些实际上是相同的底层动作。他们将这些相似的指令归入一个“簇”。
2. 架构师(起草蓝图)
对于每一组相似的指令,系统会要求人工智能起草一份类型化契约。
- 这不是段落,而是一份看起来像计算机函数的契约:
move_object(from: "counter", to: "cabinet")。 - 它清晰地列出:需要哪些输入?之后会发生什么?规则是什么?
3. 安全检查员(四项检查)
在系统允许机器人使用这份新蓝图之前,严格的安全检查员会执行四项具体检查,以确保翻译完美无缺:
- 覆盖性: 我们是否遗漏了原文中的任何重要细节?
- 绑定: 我们是否确切知道如何从原句中获取“盐”或“杯子”?
- 替换: 如果我们用这份新蓝图替换旧段落,说明书的其余部分是否仍然通顺?
- 风险: 这条新指令是否会意外指示机器人执行危险操作(例如删除文件或打破窗户)?
如果蓝图通过所有四项检查,它便会获得批准。如果哪怕有一项未通过,它就会被丢弃,以防止机器人陷入困惑。
4. 交付(“捆绑包”)
当机器人需要执行任务时,它不会收到那份旧而杂乱的说明书。相反,它会收到一个包含三部分的捆绑包,并按完美顺序呈现:
- “操作指南”模板: 机器人必须输入给房屋计算机的确切措辞(例如
move {object} to {target})。 - “是什么”签名: 对该技能功能的清晰总结。
- 上下文: 其余指令,现已清理完毕,以免与新模板产生矛盾。
结果
研究人员在名为ALFWorld的游戏中测试了该方法,在该游戏中,AI 代理需要解决家庭谜题。
- 旧方法(技能图): 机器人阅读杂乱的说明书,猜错,陷入循环,经常失败。
- 新方法(SaP): 机器人获得了整洁的“速查表”。它立即知道该做什么以及如何表述。
结果:
- 使用新方法,机器人解决了134 个游戏中的 82 个,而旧方法仅解决了47 个。
- 它还使用了少 22% 的内存,并减少了 14% 的 AI 大脑调用次数,因为它在陷入困境时无需反复重读说明书。
简而言之:
本文表明,如果你不再向 AI 代理提供冗长杂乱的段落,而是提供结构化且经过验证的“类代码”指令,它们就不会再感到困惑,不再犯错,并能更快地完成任务。该系统就像一个严谨的编辑,将人类散文转化为机器人可用的蓝图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。