← 最新论文
💻 computer science

Harnessing LLM Agents with Skill Programs

本文介绍了 HASP,这是一个模块化框架,它将建议性文本技能转化为可执行的程序函数(PFs),以主动干预大语言模型(LLM)代理循环,从而通过推理时引导、训练后监督或自我改进,显著提升其在网页搜索、数学推理和编程等复杂任务上的性能。

原作者: Hongjun Liu, Yifei Ming, Shafiq Joty, Chen Zhao

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongjun Liu, Yifei Ming, Shafiq Joty, Chen Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明但有时笨手笨脚的机器人助手。你让它解决一个复杂的谜题,比如在互联网上查找特定事实或编写一段代码。机器人竭尽全力,却不断重复同样的错误:它过早放弃、搜索错误的目标,或被发音相似的名字搞糊涂。

通常,当我们试图修复这个问题时,只是给机器人一份书面指令清单(像手册一样),写着“记得检查你的工作!”或“不要猜测!”但机器人经常忽略这些笔记,因为它们只是被动文本。它不知道确切何时停下来倾听,也不知道如何改变自己的行为。

HASP(利用技能程序驾驭大语言模型智能体)是一个改变游戏规则的新框架。研究人员不再给机器人一本被动的手册,而是给它一套可执行的“技能程序”(PFs)。不要把这些想成一本书,而要想象成一个智能安全 harness副驾驶,它直接坐在机器人的大脑旁边。

以下是其工作原理,使用简单的类比:

1. 从“被动建议”到“主动护栏”

  • 旧方法(文本技能): 想象一位驾驶教练坐在后座大喊:“你应该减速!”司机可能听到,可能忽略,也可能没意识到确切何时该踩刹车。这仅仅是建议。
  • HASP 方法(程序函数): 现在,想象汽车配备了智能安全 harness。如果汽车开始漂向悬崖(即“易失败状态”),harness 不会仅仅喊出建议。它会物理介入。它可能会轻轻将方向盘转回中心,或直接向司机的视野中注入警告信号。
  • 在论文中: 这些“技能程序”是监控机器人每一步的小段代码。如果机器人即将犯错(例如在未阅读证据的情况下确定答案),技能程序会介入。它可以重写机器人的行动(将糟糕的搜索查询改为好的查询),或者注入提示(告诉机器人:“等等,你还没阅读文档!”)。

2. 使用 harness 的三种方式

论文展示了这种"harness"可以像训练学生一样以三种不同方式使用:

  • 模式 A:即时修复(推理时干预)

    • 类比: 你在机器人工作期间给它戴上 harness。harness 实时捕捉错误并立即修复。机器人无需学习任何新东西;harness 直接承担繁重工作。
    • 结果: 即使没有额外训练,机器人也能立刻更好地解决问题。
  • 模式 B:学习指南(训练后)

    • 类比: 在 harness 修复了机器人的错误后,研究人员录制“修正后”的路径视频,将其作为课程展示给机器人。机器人研究这些示例,学会下次自己做出正确选择。
    • 结果: 机器人将技能内化。它开始表现得好像 harness 是其自身大脑的一部分,随时间推移需要更少的帮助。
  • 模式 C:自我提升的库(进化)

    • 类比: 如果机器人遇到 harness 从未见过的新类型错误,系统会暂停。它会请求一位“导师”(一个非常智能的 AI)专门为该错误编写新的技能程序。在将这项新技能添加到工具箱之前,导师会检查它以确保其安全且有用。
    • 结果: 机器人的技能工具箱随时间变得更聪明,从自身失败中学习,而无需人类编写每一条规则。

3. 为何它如此有效

论文在三项艰巨任务上测试了该方法:

  • 网络搜索: 寻找需要连接多条信息的答案(像侦探破案)。
  • 数学: 解决复杂方程。
  • 编程: 编写计算机程序。

结果:

  • 这种"harness"方法击败了研究人员比较的几乎所有其他方法。
  • 对于网络搜索,仅使用 harness(不训练机器人)相比标准方法将性能提高了25%
  • 当他们让机器人从 harness 中学习(训练后)时,效果变得更好。
  • 关键在于,该系统是模块化的。它像瑞士军刀;你可以只使用工具,也可以用工具教导机器人,或者让机器人构建新工具。

总结

HASP 将“可复用的经验”从一个模糊的概念转变为具体、可执行的工具。与其指望机器人记住一条规则,HASP 赋予机器人一套自动安全检查,在错误发生的瞬间捕捉它们、修复它们,并帮助机器人学会在未来避免它们。这之间的区别,就像给学生一本教科书, versus 给他们一位坐在身旁的导师,在他们做功课的同时纠正他们的作业。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →