✨ 要点🔬 技术摘要
想象一下,你有一个非常聪明但有时笨手笨脚的机器人助手。你让它解决一个复杂的谜题,比如在互联网上查找特定事实或编写一段代码。机器人竭尽全力,却不断重复同样的错误:它过早放弃、搜索错误的目标,或被发音相似的名字搞糊涂。
通常,当我们试图修复这个问题时,只是给机器人一份书面指令清单(像手册一样),写着“记得检查你的工作!”或“不要猜测!”但机器人经常忽略这些笔记,因为它们只是被动文本。它不知道确切 何时停下来倾听,也不知道如何 改变自己的行为。
HASP (利用技能程序驾驭大语言模型智能体)是一个改变游戏规则的新框架。研究人员不再给机器人一本被动的手册,而是给它一套可执行的“技能程序”(PFs) 。不要把这些想成一本书,而要想象成一个智能安全 harness 或副驾驶 ,它直接坐在机器人的大脑旁边。
以下是其工作原理,使用简单的类比:
1. 从“被动建议”到“主动护栏”
旧方法(文本技能): 想象一位驾驶教练坐在后座大喊:“你应该减速!”司机可能听到,可能忽略,也可能没意识到确切 何时该踩刹车。这仅仅是建议。
HASP 方法(程序函数): 现在,想象汽车配备了智能安全 harness 。如果汽车开始漂向悬崖(即“易失败状态”),harness 不会仅仅喊出建议。它会物理介入 。它可能会轻轻将方向盘转回中心,或直接向司机的视野中注入警告信号。
在论文中: 这些“技能程序”是监控机器人每一步的小段代码。如果机器人即将犯错(例如在未阅读证据的情况下确定答案),技能程序会介入 。它可以重写机器人的行动 (将糟糕的搜索查询改为好的查询),或者注入提示 (告诉机器人:“等等,你还没阅读文档!”)。
2. 使用 harness 的三种方式
论文展示了这种"harness"可以像训练学生一样以三种不同方式使用:
模式 A:即时修复(推理时干预)
类比: 你在机器人工作期间 给它戴上 harness。harness 实时捕捉错误并立即修复。机器人无需学习任何新东西;harness 直接承担繁重工作。
结果: 即使没有额外训练,机器人也能立刻更好地解决问题。
模式 B:学习指南(训练后)
类比: 在 harness 修复了机器人的错误后,研究人员录制“修正后”的路径视频,将其作为课程展示给机器人。机器人研究这些示例,学会下次自己做出正确选择。
结果: 机器人将技能内化。它开始表现得好像 harness 是其自身大脑的一部分,随时间推移需要更少的帮助。
模式 C:自我提升的库(进化)
类比: 如果机器人遇到 harness 从未见过的新类型 错误,系统会暂停。它会请求一位“导师”(一个非常智能的 AI)专门为该错误编写新的技能程序 。在将这项新技能添加到工具箱之前,导师会检查它以确保其安全且有用。
结果: 机器人的技能工具箱随时间变得更聪明,从自身失败中学习,而无需人类编写每一条规则。
3. 为何它如此有效
论文在三项艰巨任务上测试了该方法:
网络搜索: 寻找需要连接多条信息的答案(像侦探破案)。
数学: 解决复杂方程。
编程: 编写计算机程序。
结果:
这种"harness"方法击败了研究人员比较的几乎所有其他方法。
对于网络搜索,仅使用 harness(不训练机器人)相比标准方法将性能提高了25% 。
当他们让机器人从 harness 中学习(训练后)时,效果变得更好。
关键在于,该系统是模块化的 。它像瑞士军刀;你可以只使用工具,也可以用工具教导机器人,或者让机器人构建新工具。
总结
HASP 将“可复用的经验”从一个模糊的概念转变为具体、可执行的工具 。与其指望机器人记住一条规则,HASP 赋予机器人一套自动安全检查 ,在错误发生的瞬间捕捉它们、修复它们,并帮助机器人学会在未来避免它们。这之间的区别,就像给学生一本教科书, versus 给他们一位坐在身旁的导师,在他们做功课的同时纠正他们的作业。
技术摘要:利用技能程序驾驭大语言模型智能体(HASP)
1. 问题陈述
尽管大语言模型(LLM)智能体在规划与与环境交互方面已展现出日益增强的能力,但它们频繁表现出重复性的失败模式,例如在验证前终止、固守脆弱的中间结论,或重复无成效的操作。现有的缓解这些失败的方法通常依赖于源自过往经验的文本技能 。这些技能通常被注入提示词中或用作咨询指导。然而,本文指出,文本技能存在三个核心局限性:
咨询性质 :它们表达了智能体原则上应该 做什么,但缺乏明确的机制来说明何时 激活或在策略循环中如何 干预。
控制力弱 :在实践中,它们常被模型忽略,无法可靠地改变智能体的行为。
缺乏可执行性 :语言表述的可复用经验与能够显式控制智能体动作的可复用经验之间存在鸿沟。
核心挑战在于通过将被动的文本教训转化为主动的、可执行的机制,从而弥合这一鸿沟,使其能够直接干预智能体的决策过程。
2. 方法论:HASP 框架
作者提出了HASP(利用技能程序驾驭大语言模型智能体) ,这是一个将技能从被动文本升级为**程序函数(PFs)**的框架。PF 被定义为一种可复用的、可执行的状态 - 动作干预函数。
核心组件
程序函数(PFs) :与自然语言提醒不同,PF 是具有两个不同接口的可执行 Python 模块:
should_activate(state, action):一个确定性谓词,用于判断该技能是否与当前状态和提议的动作相关。
intervene(state, action, teacher):返回结构化的干预结果,可以是:
Modify_Action(修改动作) :重写或优化下一个动作(例如,缩短过度受限的搜索查询)。
Inject_Context(注入上下文) :向智能体的观察结果中追加纠正性文本(例如,关于实体混淆的警告)。
NOOP(无操作) :不进行更改,但记录审计日志。
技能库 :经过验证的 PF 集合。新的候选 PF 从失败案例中生成,经过语法和接口验证,并由教师模型审查后方可入库。
驾驭层(The Harness) :一个包裹基础智能体策略(π θ \pi_\theta π θ )的外部控制层。在每一步,驾驭层检索相关的 PF,评估其激活谓词,执行有效的干预,并将修订后的动作或注入的上下文反馈回循环中。
三种运行模式
HASP 设计为高度模块化,支持三种不同的范式:
推理时干预 :PF 作为运行时可执行的护栏。它们根据智能体的状态自主触发,以修改动作或注入上下文,而无需更新模型权重。当存在多个候选 PF 时,可选的辅助教师可协助选择最合适的 PF。
训练后(内化) :PF 执行生成包含原始动作、PF 修复及结果的结构化记录。这些记录使用四个信号进行评分:时机 (何时)、模式 (如何)、正确性 (质量)和结果 (有效性)。这些分数通过以下方式指导训练后优化:
监督微调(SFT) :基于修正后的动作进行训练。
拒绝采样(RS) :选择与 PF 引导的修正相匹配并实现任务成功的轨迹。
同策略蒸馏(OPD) :在 PF 干预过的智能体自身状态上对学生模型进行训练。
自我改进进化 :系统在当前检查点下重新审视残余失败,将重复出现的失败 - 修复模式总结为候选 PF,并在经过严格的可执行性验证和教师审查后更新外部技能库。这闭环了执行、学习与库增长之间的关系。
3. 主要贡献
本文概述了三项主要贡献:
作为可执行状态 - 动作函数的技能 :将可复用的智能体经验转化为可执行的程序函数,按需触发并显式干预,超越了被动的文本技能。
模块化智能体驾驭框架 :提出了 HASP,支持在仅推理、训练后和自我改进范式中可控的 PF 触发与干预。
强大的实证表现 :在网页搜索推理、数学推理和编码任务中,展示了相对于竞争性基线的显著提升。
4. 实验结果
作者在 HotpotQA、2Wiki 和 MuSiQue (网页搜索)、AIME24、AMC23 和 GameOf24 (数学)以及 HumanEval、MBPP 和 BigCodeBench (编码)上评估了 HASP。骨干模型为 Qwen2.5-7B-Instruct 。
关键发现
推理时增益 :即使不进行模型更新,仅靠 PF 干预也显著优于基线。
在网页搜索推理中,仅 PF 干预将平均准确率提升至 51.0% (而仅提示词技能为 20.5%,多循环 ReAct 基线为 31.2%)。
添加辅助教师进行 PF 选择后,网页搜索准确率进一步提升至 56.2% 。
在编码任务中,仅 PF 达到了 63.4% 的 pass@1,经教师选择后提升至 68.7% 。
训练后内化 :基于 PF 的监督使模型能够在不进行完整强化学习的情况下内化行为。
在网页搜索中,同策略蒸馏(OPD) 达到了 62.5% ,在固定库下 拒绝采样(RS) 达到了 59.3% 。
这些结果与标准 SFT 和基于技能的训练方案相当或更优。
闭环进化 :技能库的受控进化进一步提升了性能。
HASP-Evolve + RS 在网页搜索上达到了 60.3% ,在数学推理上达到了 45.4% 。
在编码任务中,达到了 69.9% 的 pass@1,比纯 SFT 高出 12.4%,并与基于 GRPO 的方法保持竞争力。
机制分析 :
干预类型 :65.1% 的干预是动作级修改(例如重写查询),34.9% 是上下文注入。
信号重要性 :消融研究表明,所有四个监督信号(时机、模式、正确性、结果)都是必要的。移除“模式”导致了最大的下降(-15.5%),表明干预如何 应用与何时 应用同样关键。
过滤的必要性 :严格过滤(可执行性验证 + 教师审查)至关重要。未经过滤的进化导致性能急剧下降(-24.0%),证实了库污染会损害智能体性能。
5. 意义与主张
本文将 HASP 定位为改进大语言模型智能体的互补路径。作者主张:
稳定优于发现 :PF 有助于显现并稳定模型通常能够执行但无法可靠应用的有用策略。这与更适合发现全新策略的 RL 式探索形成对比。
显式控制 :通过将技能转化为可执行代码,HASP 提供了对智能体行为的显式、可审计的控制,解决了基于提示词技能的“咨询”弱点。
模块化 :该框架将技能定义与训练目标解耦,允许相同的 PF 用于运行时干预、监督训练或自我改进。
作者对局限性保持谦逊,指出 PF 主要有助于吸收现有策略而非发现新策略,该框架依赖于清晰的验证信号(限制了其在开放任务中的适用性),且自我改进需要严格过滤以防止库退化。他们总结道,虽然更广泛的 RL 式探索可能仍需要用于新策略的发现,但 PF 为在复杂、长视野任务中优化和稳定智能体行为提供了一种稳健的机制。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。