HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents
HaReCAP 是 ReCAP 框架的一个低侵入性扩展,通过将频繁成功的叶节点决策编译为离线反射规则,以绕过对常规动作的冗余递归上下文处理,从而减少长时程具身任务中的 Token 消耗和 LLM 调用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人,任务是在繁忙的厨房里准备一道复杂的菜肴。它不能仅仅被告知“做晚餐”;它必须将这个目标分解为一系列较小的步骤,例如:找到洋葱、切洋葱、加热平底锅等等。为了实现这一目标,现代人工智能使用大语言模型,这些模型充当机器人的大脑。这些模型擅长推理和规划,但在与物理世界交互时面临着一个特定的挑战。它们必须不断地将高层思维转化为机器人软件能够理解的精确、有效的指令。如果机器人想到“拿起洋葱”,系统必须将其转换为精确的指令,如“使用机器人1从板1拿起洋葱1”。每当机器人执行一个基本动作时,这个翻译步骤都是必要的。
长期以来,研究人员一直在开发各种方法来帮助这些 AI 智能体处理长任务,而不至于产生混乱或忘记目标。一种成功的方法被称为“递归规划”(recursive planning),其工作原理类似于一名经理委派任务。AI 将一个大目标分解为更小的子目标,处理第一个子目标,然后返回给“经理”以根据刚刚发生的情况更新计划。这种循环允许 AI 在变化的环境中处理复杂的、多步骤的任务。然而,这个过程有一个隐藏的代价。每当 AI 完成一个子任务的最后一步以执行一个简单的动作时,它都必须再次请求其强大的大脑将其想法转化为指令。尽管这个想法很简单,但大脑必须重新阅读整个对话的历史记录和当前情况,以确保指令是正确的。这种重复造成了计算能力和时间的巨大浪费,尤其是在需要数百个步骤的任务中。
一个研究团队识别出这种重复性的翻译是效率低下的主要来源,并提出了一个名为 HaReCAP 的解决方案。他们的工作聚焦于过程的“最后一英里”:即 AI 决定执行一个特定原子动作的时刻。研究人员并没有让系统每次都请求大语言模型来进行这种翻译,而是教会了系统如何识别何时情况足够熟悉且安全,从而可以跳过繁重的思考。他们分析了数千次成功完成任务的尝试。从这些成功案例中,他们提取出了一个简单的规则库。这些规则本质上是快捷方式,类似于说:“当任务是从特定地点拿起特定物体,且机器人被允许这样做时,动作始终是 X。”
该系统通过在请求主 AI 大脑寻求帮助之前先检查这些快捷方式来运作。当机器人到达一个叶层级(leaf-level)子任务——即其计划中的一个小而最终的步骤——时,系统首先查看其规则库中是否有匹配当前情况的规则。如果规则完美契合且对于采取哪种动作不存在歧义,系统会立即执行该动作,而无需调用大语言模型。研究人员称之为“习惯性动作落地”(habitual-action grounding)。这类似于人类在不需要有意识地思考转动门把手的机械原理的情况下,会自动伸手去抓门把手,前提是门是开着的。如果情况是全新的、复杂的,或者规则不完全契合,系统会安全地退回到原始方法,请求大语言模型进行规划并将动作进行翻译。这确保了 AI 永远不会失去处理困难问题的推理能力,但它避免了为简单的、常规的步骤进行不必要的过度思考。
研究人员在两个不同的模拟环境中测试了这种方法:一个是机器人必须准备餐食的厨房环境,另一个是机器人必须整理物品的家庭环境。他们使用了一个强大的语言模型来运行任务,并将标准方法与他们的新型快捷系统进行了对比。结果显示,快捷系统并未改变成功率;机器人完成的任务数量与之前一样多。然而,效率的提升是显著的。在厨房环境中,该系统使计算机需要处理的数据量平均减少了近 15%。在家庭环境中,这种减少更为显著,达到了 20% 以上。这意味着 AI 智能体可以在使用显著更少的计算能力和时间的情况下,完成同样数量的成功任务。
至关重要的是,研究人员发现这种改进并不局限于单一类型的机器人大脑或特定的任务类型。他们使用不同规模的模型进行了测试,并在不同的环境中进行了测试,结果显示节省效果保持一致。这项研究表明,运行这些先进 AI 智能体的大部分成本并非来自复杂的规划本身,而是来自将简单的想法反复、常规地转化为动作的过程。通过将这些频繁的决策提炼成一个小型且可审计的规则库,研究人员创造了一种低风险且易于集成的方案。该系统仍然完全具备处理突发变化和复杂推理的能力,但它不再为每一个简单的步骤而重复造轮子。这种方法为提高长程 AI 智能体的速度和效率提供了一种实用的途径,且不会牺牲其可靠性和智能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。