JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
本文介绍了 JIT-Agent,一种可训练的模型,它能够实时自动合成并演进特定任务的智能体控制台(agent harness),显著提升了各种基础模型的性能,并将控制台智能确立为智能体能力的一个可扩展且正交的维度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:通过即时架构演进实现架构智能的规模化
1. 问题陈述
LLM 智能体的能力不仅由基础模型的权重决定,还由其**智能体架构(Agent Harness)**共同定义——即由记忆管理、规划策略、动作协议以及工具/技能编排组成的运行脚手架。虽然强大的模型在不合适的架构下可能会失败,但一个鲁棒的架构只有在模型能够理解并遵循它时,才能释放其潜力。
目前的架构优化方法主要依赖于预时优化(Ahead-of-Time, AOT)方法。这些系统将架构视为一种持久的产物,通过经验流进行优化,以实现对未来任务的泛化。然而,AOT 方法难以应对实例依赖性(Instance-dependency):不同的任务(例如,宽搜索型任务 vs. 终止型任务 vs. 深度研究型任务)需要截然不同的架构先验。针对异构需求优化单一的 AOT 架构是非常繁琐的,这需要庞大的设计空间和轨迹积累,且往往无法匹配新问题的特定结构。本文认为,架构设计应当从一项手动、静态的工程任务转向一种**即时(Just-in-Time, JIT)**能力,即通过一个经过训练的元智能体(Meta-agent)实时合成特定于任务的架构。
2. 方法论:JIT-Agent
作者提出了 JIT-Agent,这是一个紧凑的元智能体,旨在为任意现成的(off-the-shelf)智能体 LLM 合成、修复并演进任务自适应架构。
2.1 形式化:四模块协议
为了使架构生成具有可行性和结构化,论文将智能体架构形式化为一个可组合、机器可生成的产物,受固定的四模块协议 管理:
- 记忆 (): 将历史记录压缩为已实现历史的一个视图 ()。
- 规划 (): 将视图转换为局部指令 ()。
- 能力编排 (): 根据指令选择并排序相关的工具/技能 ()。
- 动作 (): 消耗组装后的上下文以更新控制器状态并发出下一个动作 ()。
这种分解将异构程序转化为符合协议空间的、可比较的坐标()。作者引入了 HarnessFactory,这是一个统一的代码库,在这一通用接口下实现了 13 种具有代表性的当代脚手架(如 ReAct、Plan-and-Execute、递归智能体等),用作种子库 ()。
2.2 训练流水线
JIT-Agent 通过三个阶段的流水线进行训练,以实现架构智能(Harness Intelligence)(即自适应性、可靠性和可演进性):
第一阶段:任务条件定制化
- 目标: 教导模型将任务规范和少量参考上下文映射到符合协议的架构。
- 方法: 使用一个冻结的更强的教师模型来合成任务自适应架构。训练数据包括针对有效生成的监督微调(SFT)和偏好学习。偏好目标()通过帕累托式偏好规则进行优化,旨在寻找能在不降低效率(延迟或成本)的前提下提升任务奖励的架构。
第二阶段:架构修复
- 目标: 通过学习从合成失败中恢复,确保可靠性。
- 方法: 将失败的生成(编译器错误、接口不匹配、运行时异常)转换为有界的修复轨迹。教师模型提出结构化的修订 () 以修复架构。模型通过模仿这些修复转换进行训练,学习利用执行反馈在短步长内(最多 2 轮)恢复协议有效的执行。
第三阶段:演进型组解耦策略优化(Evo-GDPO)
- 目标: 实现在线演进,使模型能够提出超越当前存档前沿(Archive Frontier)的架构。
- 方法: 在训练期间,模型提出一组候选架构。这些架构会针对当前库中的现有最佳架构(Incumbent)进行评估。奖励信号被解耦为三个通道:
- 奖励: 主要信号;候选架构必须匹配或超过现有架构的奖励。
- 延迟与成本: 仅在奖励得以保持时激活的效率信号。
- 策略使用由归一化、聚合优势驱动的 PPO 式目标进行更新,奖励那些在保持效率的同时超越前沿的尝试。架构库 () 进行保守更新,仅保留那些推动前沿发展的设计。
2.3 推理架构
JIT-Agent 支持两种推理模式:
- 静态推理(Static Inference): 并行生成 个架构,选择其一并执行。适用于在不增加环境展开次数的情况下最大化候选多样性。
- 流式推理(Streaming Inference): 专为任务流设计。模型从不断演进的库中检索参考资料,生成架构,执行架构,并根据反馈更新库。这使得经验可以在任务间转移,而无需在部署期间更新模型参数。
3. 关键结果
论文在涵盖深度研究、日常工作、规划和工作空间任务的九个基准测试上对 JIT-Agent 进行了评估,使用的骨干模型包括 GLM-5.2、DeepSeek-V4-Flash、Qwen3.6 和 Mimo-V2.5。
性能提升: 使用 JIT 生成的架构取代默认脚手架可带来持续的改进。
- GLM-5.2: 在九个基准测试中平均提升了 7.7 分。显著增益包括在 DeepPlanning-Travel 上提升 20.2,以及在 OdysseyBench 上提升 4.3。
- DeepSeek-V4-Flash: 平均提升了 8.8 分。它在 DeepSearchQA 上超越了 GPT-5.6 (+9.1)。
- 泛化能力: JIT-Agent 提升了所有测试模型家族(DeepSeek、Qwen、Mimo)及其变体(Flash/Pro)的性能,表明该能力可以跨模型权重迁移。
与固定架构的竞争力:
- JIT 生成的架构在性能上足以媲美成熟的运行时,如 OpenCode 和 Claude Code。
- 在 DeepSeek-V4-Flash 上,JIT-Agent 在 DeepSearchQA 上比最强的固定架构(NanoBot)高出 4.7 分,在 xBench-DS 上高出 4.0 分。
成本效率:
- JIT-Agent 在所有受控设置中实现了最低的 Token 消耗和 API 成本。
- 与最便宜的固定架构相比,它在提高性能的同时,将单案例成本降低了 14.9–54.1%(平均 36.0%)。例如,在 DeepSeek-V4-Flash 的 xBench-DS 测试中,Token 使用量从 527K 降至 212K,而性能从 78.0 上升至 82.0。
- 帕累托前沿分析显示,JIT-Agent 将运行点向左上方(更高性能、更低成本)移动,证明其收益并非源于更长的轨迹,而是源于更好的编排。
测试时演进:
- 流式 JIT(通过任务流更新架构库)在累计准确率上始终优于 静态 JIT(独立生成),证明了从执行反馈中学习的价值。
4. 意义与主张
论文声称确立了**架构智能(Harness Intelligence)**作为一个新的、可训练且可迁移的维度,它是智能体能力的组成部分,且与模型规模扩展是正交的。
- 范式转变: 该工作将架构工程从“预时优化”(优化静态产物)转向“即时合成”(实时合成特定任务的脚手架)。
- 模型即架构(Model-as-a-Harness): 它证明了经过训练的元智能体可以生成操作性脚手架,使较弱或更高效的骨干模型能够媲美甚至超越带有固定架构的更强模型。
- 可扩展性: 通过将架构形式化为可组合的协议并训练生成器来演进它,论文提出了一条通过优化执行环境本身而非仅仅通过模型参数规模来扩展智能体能力路径。
- 未来方向: 作者将其视为迈向**模型-架构协同设计(Model-Harness Co-Design)**的一步,在未来,基础模型最终可能内化构建、修订和演进自身执行系统的能力。
论文总结道,架构智能不仅仅是一个实现细节,它是智能体性能的一阶决定因素,能够回收那些原本需要昂贵的骨干模型规模化才能获得的实质性能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。