技术摘要:Co-Harness:为 LLM Agent 实现编织(Harness)与模型权重的协同演进
1. 问题陈述
用于自动化 AI 研究的后训练(Post-training)智能体传统上涉及优化模型参数,但将运行时系统——即“编织”(Harness)——视为一个固定的、静态的脚手架。该编织包含了提示词(Prompts)、工具、技能、中间件、内存策略以及重试逻辑。目前的流水线存在一个根本性的不匹配:模型通过基于静态编织生成的轨迹进行监督微调(SFT)或强化学习(RL)进行更新,然而编织本身从未根据训练过程中观察到的失败进行优化。
这种不对称性导致了一个瓶颈:次优的脚手架(例如:模糊的提示词、错误的工具 Schema、缺失的重试钩子或内存溢出)阻碍了高质量训练轨迹的生成。因此,模型无法学习如何克服这些环境限制,而固定的编织成为了智能体性能的上限,尤其是在复杂的工具集成推理(TIR)场景中,单个 Schema 错误就可能导致整个多轮会话中断。
2. 方法论:Co-Harness 框架
作者提出了 Co-Harness,这是一个通过交替过程共同优化智能体编织 (ϕ) 和模型参数 (θ) 的双环框架。其核心假设是:更好的编织能产生更清晰、信息量更大的轨迹,从而训练出更强的模型;而更强的模型反过来又能暴露此前不可见的更高阶编织瓶颈,从而实现进一步的脚手架改进。
该框架在每一轮 t 中执行两个交替的循环:
A. Co-Harness 循环(编织优化)
在此阶段,保持模型 θt 固定,同时对编织 ϕt 进行演进。
- 失败收集: 智能体在 (θt,ϕt) 条件下执行任务,收集一组失败的轨迹 Ft−。
- HarnessCritic 分析: 一个基于 LLM 的组件——HarnessCritic (C)——会对这些失败进行分析。它将每个失败归因于编织配置中的结构化根因(例如:提示词歧义、工具 Schema 错误、缺失技能、中间件不匹配或内存溢出)。
- 差异生成与验证: HarnessCritic 提出对编织进行局部修补(差异/diff)。这些补丁通过运行“试运行”(rollout)测试进行验证,以确保它们在改善目标失败模式的同时,不会导致已持有行为的退化。
- 注册表更新: 经过验证的补丁被提交至版本化的编织注册表中,从而将活跃配置更新为 ϕt∗。
B. 模型对齐循环(模型优化)
在此阶段,保持演进后的编织 ϕt∗ 固定,同时更新模型。
- 高质量轨迹收集: 当前模型 θt 在改进后的编织 ϕt∗ 下运行,以生成新的高质量轨迹数据集 Dt。
- 监督微调 (SFT): 模型在 Dt 上进行微调,以内化由改进后的脚手架所启发的行为,从而得到更新后的模型 θt+1。
- 迭代: 新模型 θt+1 和演进后的编织 ϕt∗ 成为下一轮的起点,届时更强的模型可能会揭示出新的、更复杂的编织局限性。
失败归因分类法
HarnessCritic 将失败分为五个可操作的编织维度和一个弃权标签:
- 提示词歧义 (P): 指令说明不足或目标冲突。
- 工具 Schema 错误 (T): 无效的工具调用、错误的参数 Schema 或后端不匹配。
- 技能缺失 (S): 缺乏可重用的例程或分解原语。
- 中间件不匹配 ($Mid$): 存在缺陷的循环协议、钩子行为或上下文管理逻辑。
- 内存溢出 (M): 持久状态溢出、陈旧内存或检索失败。
- 智能体错误: 失败是由模型自身的推理能力而非编织引起的案例。
3. 核心贡献
- 联合优化公式化: 本文将智能体后训练形式化为一个针对模型权重和运行时编织的联合优化问题,超越了将提示词和工具视为固定基础设施的范式。
- HarnessCritic: 引入了一种基于失败驱动的过程,能够对错误进行结构化归因,并提出经过验证的局部差异(diff)用于修复。
- 复合增益机制: 证明了交替进行编织演进和模型对齐可以创造一个正反馈循环:脚手架的改进带来了更好的训练数据,进而产生了能够利用更复杂脚手架的更强模型。
4. 实验结果
该框架在数学基准测试(AIME 2024, AIME 2025, HMMT 2025)上,针对两种模型规模(Qwen3-8B 和 Qwen3-32B)进行了工具集成推理(TIR)任务的评估。
- 性能提升: 与基准线(仅对编织进行一次演进而不进行模型 SFT)相比,两轮 Co-Harness 协同演进在各基准测试和模型规模上平均实现了 +20.4 个百分点 (pp) 的准确率提升。
- 在难度最高的基准测试(HMMT 2025)中,Qwen3-32B 模型观察到了最大的增益,提升了 +27.2 pp。
- 该系统比精心设计的静态编织配置平均高出 +24.7 pp。
- 自主案例研究: 在 AIME 2024 上进行的 200+ 小时自主运行中,系统:
- 从初始系统崩溃(vllm KV cache 错误)中恢复。
- 通过全局批处理推理,将推理效率提高了 8.7 倍(将墙钟时间从 3.78 小时缩短至 1.11 小时)。
- 发现了一种集成策略(对多样化种子进行多数投票),在时间预算内实现了最佳准确率(63.3%),且全程无需人工干预。
- 鲁棒性: 系统能够成功检测并回滚退化行为(例如:与模型内部推理相冲突的特定领域提示词),利用其版本控制的注册表进行操作。
5. 意义与主张
论文认为 Co-Harness 解决了当前智能体开发中的一个关键局限:模型训练与其生成训练数据的环境之间的脱节。通过将编织视为一个可学习的变量而非静态脚手架,Co-Harness 实现了复合自我改进。
作者主张,这种方法实现了“正反馈螺旋”:
- 更好的编织产生了更清晰的工具使用和更少的避免性崩溃。
- 这些更清晰的轨迹训练出了更强的模型。
- 更强的模型可以利用此前无法使用的更丰富、更复杂的编织配置。
这与以往的工作形成对比,以往工作要么针对固定编织优化模型(标准 SFT/RL),要么针对固定模型优化编织(推理时搜索)。Co-Harness 被呈现为第一个对两者进行协同演进的框架,表明脚手架与模型权重之间的相互依赖性是超越固定编织后训练、提升智能体能力的主要维度。
作者注明的局限性: 该方法需要一个能力出众的 Critic LLM、足够的失败轨迹量用于冷启动,以及进行多轮 SFT 所需的大量计算资源。此外,对于需要复杂反事实推理的失败模式,归因准确度可能会下降,且编织的结构性重构仍需人类负责。