← 最新论文
💬 NLP

Unified Context Evolution for LLM Agents

本文介绍了统一上下文演化(Unified Context Evolution, UCE),这是一个无梯度框架,通过将经验外部化为由可演化上下文单元(Evolvable Context Units)组成的动态、类型化的库,并对其进行选择性的生成、评分和剪枝,从而增强大语言模型(LLM)智能体的性能,并实现跨不同基座模型的性能提升与迁移。

原作者: Zixuan Zhu, Yitong Hu, Yong Dai, Junfeng Fang, Chunyang Jiang, Senkang Hu, Yuzhi Zhao

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Zixuan Zhu, Yitong Hu, Yong Dai, Junfeng Fang, Chunyang Jiang, Senkang Hu, Yuzhi Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明但健忘的机器人如何解谜。每当你给它一个新谜题时,它都会从头开始,仿佛从未见过谜题一样。即使它在解决“谜题 #1”时发现了一个巧妙的窍门,这个知识也会在它面对“谜题 #2”的那一刻消失殆尽。

论文《统一上下文演进》(Unified Context Evolution)为解决这个“失忆”问题提出了一个方案。它引入了一个名为 UCE(统一上下文演进)的系统,这个系统就像是一个不断增长且有组织的笔记本。它并不需要重新训练机器人的大脑(这既昂贵又困难),而是在每一轮游戏结束后更新机器人的“小抄”。

以下是其工作原理的拆解,通过简单的概念进行说明:

1. 问题所在:“重置按钮”

目前的 AI 智能体大多像是在参加考试的学生。它们接收问题,思考,然后回答。考试结束后,它们会忘记一切。如果它们犯了错或者找到了捷径,这些信息都会丢失。

  • 论文观点: 现有方法要么试图重新训练机器人的大脑(成本高昂),要么将经验丢进一个杂乱无章的堆积物中(令人困惑)。

2. 解决方案:“四抽屉文件柜”

UCE 用一个由 可演进上下文单元(ECUs) 组成的结构化库取代了杂乱的堆积物。你可以把这个库想象成一个文件柜,里面有四个特定的抽屉,每个抽屉都存放着不同类型的知识:

  • 抽屉 1:记忆(“事实”)

    • 内容: 关于世界运作方式的硬事实。
    • 类比: “你知道吗,在这个厨房里,你只需要把杯子放进水槽,不需要打开水龙头就能清洗杯子。”
    • 用途: 为了避免在不需要的步骤上浪费时间。
  • 抽屉 2:策略(“如果-那么”规则)

    • 内容: 当情况出错时的决策规则。
    • 类比: “如果你尝试购买某物并收到错误消息,不要一直点击‘购买’;先回到主页面。”
    • 用途: 用于从错误中恢复或应对棘手情况。
  • 抽屉 3:工作流(“食谱”)

    • 内容: 针对特定类型任务的标准分步计划。
    • 类比: “加热马克杯:1. 找到马克杯。2. 放入微波炉。3. 开启加热。4. 将其放入杯托。”
    • 用途: 为机器人提供可以遵循的骨架计划。
  • 抽屉 4:技能(“通用工具”)

    • 内容:不同类型的任务中都能使用的微型、可复用的动作。
    • 类比: “如何打开一个封闭的盒子”或“如何搜索列表”。
    • 用途: 处理出现在许多不同场景中的特定子步骤。

3. 过程:图书馆是如何“演进”的

该系统不仅仅是在填充文件柜,它还通过一个循环进行智能管理:

  1. 玩耍与观察: 机器人尝试解决任务。有些成功了,有些失败了。
  2. 评分笔记: 系统查看结果。如果一条“笔记”(ECU)帮助机器人取得了成功,它就会获得高分。如果它导致了混乱,则得分较低。
  3. 图书管理员(调度): 一个智能调度器会查看图书馆并询问:“我们缺少什么?”
    • 示例: “我们有很多关于清洁的优秀食谱(Workflows),但我们没有处理机器人卡住时的‘如果-那么’规则(Strategies)。让我们下次专注于编写新的策略吧。”
  4. 编写与修剪: 系统根据机器人的近期经验生成新的笔记。同时,它也会扔掉那些很久没派上用场的旧笔记。
  5. 注入: 在机器人开始下一次任务之前,它会阅读来自四个抽屉的最佳笔记,并将它们加入到自己的指令中。

4. 结果:无需更换大脑即可变得更聪明

研究人员在两个环境中测试了该系统:

  • ALFWorld(虚拟房屋): 一个需要清洁、加热或移动物体的机器人。
  • WebShop(在线购物): 一个需要寻找并购买特定产品的机器人。

结果:

  • ALFWorld: 成功率从 75.4% 跃升至 96.3%。机器人学会了不需要开关水龙头就能清洗物品,并且知道需要检查特定的抽屉来寻找物品。
  • WebShop: 得分从 45.1% 提高到 61.3%。机器人学会了在子标签页(如“特性”)内点击“立即购买”是无效的,它需要先回到主页面。

5. 核心要点

这篇论文最重要的部分是,机器人的大脑(AI 模型)从未改变。 研究人员并没有重新训练 AI。相反,他们只是改进了提供给机器人的上下文(即指令和笔记)。

这就像是拿一个已经很聪明但健忘的学生,给他一本组织有序、包含技巧和窍门的笔记本,然后看着他在下一场考试中取得优异成绩。学生本身并没有变得更聪明,而是他们的资源变得更好了。

简而言之: UCE 通过将其过去的经验组织成一个智能、自更新的关于事实、规则、食谱和技能的库,将一个健忘的 AI 转变为一个累积学习者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →