Bootstrapping Cognitive Agents with a Large Language Model
本文提出了一个利用大语言模型的噪声通用知识来引导可解释认知架构构建的框架,并通过具身厨房任务证明了这种混合方法在实现领域特定知识验证与更新的同时,比仅依赖大语言模型具有更高的效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人在厨房里做饭。你有两个截然不同的工具可以帮助你:
- “超级阅读者”(大语言模型): 这就像是一个读过互联网上所有书籍、网站和食谱的机器人。它知道“西红柿通常放在冰箱里”,也知道“你需要一把刀来切苹果”。然而,它的知识有点杂乱。它有时会编造事实(幻觉),会对具体细节感到困惑,而且每次移动手臂都要向它寻求建议,成本非常高。
- “严厉的图书管理员”(认知架构): 这就像是一个拥有极其有序、循序渐进规则手册的机器人。它非常可靠且易于理解。如果你告诉它“规则1:如果冰箱门开了,就往里面看”,它就会严格执行。但是,它的书本最初是空白的。你必须为每一种情况手动编写每一条规则,这需要耗费大量的人力。
论文的核心思想:
作者 Feiyu (Gavin) Zhu 和 Reid Simmons 来自卡内基梅隆大学,他们决定将这两者结合起来。他们创建了一个系统,让**“超级阅读者”为“严厉的图书管理员”**编写初始规则,然后由图书管理员接管。
可以这样理解:
- 引导阶段(Bootstrapping Phase): 你问“超级阅读者”:“如何找到鸡蛋?”“超级阅读者”说:“嗯,鸡蛋通常在冰箱或橱柜里。”然后机器人在厨房里尝试这样做。如果成功了,机器人就会将其记录为自己规则书中一条永久性的、严格的规则:“如果我需要鸡蛋,先检查冰箱。”
- 学习阶段: 机器人会持续这样做。它尝试切西红柿。如果它卡住了,它会向“超级阅读者”寻求提示。“超级阅读者”会建议一个策略,然后机器人将这个策略转化为一条永久性的规则。
- 结果: 最终,机器人拥有了自己的完整规则书。它不再需要为了每一次动作都去向昂贵的“超级阅读者”求助。它只需遵循自己的规则即可。
为什么这比只使用“超级阅读者”更好?
论文在模拟厨房中测试了该系统,任务包括“寻找西红柿”、“切苹果”和“清理柜台”。
- 成本与速度: 针对每一个动作(比如“向左移动”、“抓起刀”、“切割”)都询问“超级阅读者”,就像盖房子时每一步都要请顾问一样。这既慢又费钱(计算资源)。新系统只在学习规则时调用几次“顾问”,然后就开始独立盖房子。论文发现,这种方法使用的“Token”(AI 计算的货币)显著少于直接询问 AI 每一个动作的方法。
- 可靠性: “超级阅读者”有时会犯傻。它可能会把一个马克杯误认为是一个杯子,从而停止寻找马克杯。然而,“严厉的图书管理员”会遵循其经过验证的规则。如果规则说“检查水槽”,它就会检查水槽,即使“超级阅读者”曾经猜错过。
- 泛化能力: 一旦机器人学会了规则“如果我需要寻找某样东西,就检查它通常存放的地方”,它就可以将此规则应用于任何物体(鸡蛋、刀具、杯子),而无需再次学习。
它是如何处理错误的?
该系统内置了一个“评论家”。如果机器人尝试一条规则并陷入死循环(例如,反复拿起一个物体又在原地放下),它会意识到出了问题。它会要求“超级阅读者”修复这条规则,使其变得更加具体(例如,“只有当物体不在目标位置时,才拿起它”)。
底线:
这篇论文表明,你不需要在“聪明但嘈杂的 AI”和“笨拙但可靠的机器人”之间做选择。通过利用聪明的 AI 来为可靠的机器人编写初始说明书,你得到的是一个既聪明、运行成本低,又易于理解的系统。机器人从 AI 的“嘈杂”知识中学习,但通过自身的逻辑大脑进行过滤,从而创造出一套清晰、高效的任务执行指令。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。