← 最新论文
💬 NLP

Neural Procedural Memory: Empowering LLM Agents with Implicit Activation Steering

本文介绍了神经程序记忆(Neural Procedural Memory, NPM),这是一个无需训练的框架,它通过利用从历史经验中蒸馏出的隐式激活转向向量来取代显式的文本指令,从而增强自主大语言模型智能体,进而通过直接激活任务相关的神经机制来实现稳健且一致的任务执行。

原作者: Chengfeng Zhao, Yuqiao Tan, Shizhu He, Yequan Wang, Jun Zhao, Kang Liu

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Chengfeng Zhao, Yuqiao Tan, Shizhu He, Yequan Wang, Jun Zhao, Kang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:“教科书”与“肌肉记忆”之间的鸿沟

想象一下,你正在教一个机器人如何烹饪一道复杂的菜肴。

  • 陈述性记忆(事实手册): 你告诉机器人,“用户对花生过敏。”机器人读取了这条信息,记住了它,并完美地避开了花生。这对于处理事实类信息非常有效。
  • 程序性记忆(技能): 你告诉机器人,“先切洋葱。然后,加热平底锅。接着,加入油。”

论文指出,当我们以文本形式给机器人这些逐步进行的指令时,它们往往会失败。它们读了文本,点头表示理解,然后却忘记了按正确的顺序执行步骤。它们可能会切好了洋葱,却忘了开火,或者可能会陷入反复切同一个洋葱的死循环中。

作者称之为**“文本-行动脱节”(Text-Action Disconnect)**。这就像是在阅读一本关于如何骑自行车的说明书。你可以完美理解其中的文字,但这并不意味着你的双腿知道如何踩踏板。文本对于教授机器人完成任务所需的“感觉”来说太笨拙了。

解决方案:神经程序记忆 (Neural Procedural Memory, NPM)

与其每次都给机器人一本冗长的文字手册,作者提出了神经程序记忆 (NPM)

不要把 NPM 看作一本书,而要把它看作一次肌肉记忆注射

  1. 训练(从错误中学习):
    系统会观察机器人过去的尝试。它会寻找机器人失败(例如陷入循环)和成功的情况。

    • 类比: 想象一位舞蹈教练在观察学生。教练不仅仅是说“迈出左脚”。相反,教练会分析学生笨拙踉跄与优雅旋转之间的差异。他们能识别出导致这种差异的极其细微的平衡变化。
  2. 提取(将经验转化为向量):
    系统将这些“失败”与“成功”之间的差异转化为一个数学箭头(称为转向向量/Steering Vector)。

    • 类比: 这个箭头不是一个句子;它是一个特定的“推力”。它就像一个 GPS 信号,不会说“500 英尺后左转”,而是现在就轻轻地将汽车方向盘向左推一点,以保持车辆行驶在道路上。
  3. 应用(无形的推动):
    当机器人面对新任务时,系统会寻找一个相似的过去场景,抓取那个“推力”(向量),并将其直接注入机器人的大脑(其内部激活空间)中。

    • 类比: 机器人不再需要阅读“不要掉落碗”的告示,而是突然感觉到一种强烈的内在冲动,去稳稳地端住碗。它不需要阅读规则;规则现在已成为它的本能。

工作原理:两种类型的“推力”

论文使用了一种巧妙的两步策略来创造这些推力:

  • 间轨迹(Inter-Trajectory,宏观层面): 对比整个成功的旅程与整个失败的旅程。
    • 类比: 对比一名跑完全程的马拉松选手与一名中途放弃的选手。这里的“推力”有助于规划并让机器人时刻铭记大目标。
  • 内轨迹(Intra-Trajectory,微观层面): 观察单次失败尝试,并找到出错的具体时刻(例如,机器人绕圈走)。
    • 类比: 在跑步者即将绊倒的一瞬间抓住他,并给他一个微小的推力以恢复平衡。这里的“推力”用于修复局部错误并阻止循环。

实验结果:阅读 vs. 感知

研究人员在四个不同的“世界”(如虚拟房屋、购物网站和科学实验室)中进行了测试。

  • 文本指令: 机器人阅读规则。在长任务中,它们经常感到困惑或忘记步骤。
  • NPM(推力): 机器人不需要阅读额外的文本。它只需获得内在的“推力”。
    • 结果: 机器人的表现与阅读文本的机器人一样出色,但没有了冗长指令带来的干扰。
    • 最佳组合: 当他们同时使用两者时(用文本进行大局规划 + 用 NPM 进行肌肉记忆),机器人的成功率最高。这就像是有教练在大声讲解比赛策略(文本),同时你的身体本能地知道如何执行战术(NPM)。

为什么这很重要

  • 无需重新训练: 你不需要从头开始重新教机器人。你只需要即时提供这些“推力”。
  • 速度更快: 阅读长篇文本指令会减慢机器人的速度。注入数学推力是瞬时完成的。
  • 更像人类: 它模仿了人类学习技能的方式。我们不会在每次系鞋带时都背诵一遍教科书;我们之所以能“做到”,是因为大脑激活了正确的模式。

简而言之: 论文表明,要让 AI 智能体做得更好,我们不应仅仅给它们更多的文本去阅读。相反,我们应该给它们以“肌肉记忆”的形式,通过无形的数学推力来直接引导它们的行动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →