← 最新论文
🤖 AI

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

本文介绍了 Long-Horizon-Terminal-Bench,这是一个包含 46 个复杂的、耗时数小时的终端任务的新基准测试,通过密集且细粒度的奖励评分,旨在更好地评估并揭示当前 AI 智能体在长程规划和迭代问题解决方面的显著局限性。

原作者: Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, LeoweiLiang

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, LeoweiLiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:Long-Horizon-Terminal-Bench

问题陈述

基于大语言模型(LLM)构建的当前 AI Agent 在处理短程、范围明确的终端任务(例如修复特定的代码问题或执行几个 shell 命令)方面已展现出熟练度。然而,现有的终端基准测试(如 Terminal-Bench 和 SWE-Bench)主要侧重于这些短时程问题,其评估通常在几分钟内完成,且仅根据二元的“通过/失败”结果进行评分。这种评估范式造成了两个关键差距:

  1. 低估难度: 短时程无法捕捉现实世界工作流的复杂性,这些工作流需要数百个步骤、数小时的持续规划以及迭代调试。
  2. 稀疏的奖励信号: 二元评分忽略了中间进度。一个完成了复杂工作流 90% 但在最后一步失败的 Agent,其得分与立即失败的 Agent 相同,这掩盖了 Agent 的实际能力,并使得诊断具体的失败模式(例如过早停止 vs. 超时)变得困难。

方法论

作者引入了 Long-Horizon-Terminal-Bench (LHTB),该基准测试旨在通过密集的过程化奖励评分,对长时程、特定领域的终端任务进行压力测试。

任务构建

  • 范围: 该基准测试包含 46 个任务,涵盖九个类别,包括实验复现、软件工程、多模态分析、交互式游戏和科学计算。
  • 格式: 任务遵循 Terminal-Bench 的形式:一个容器化的 Docker 环境,包含自然语言指令、相关文件/工具以及一个预设解(oracle solution)。Agent 完全通过终端进行交互。
  • 复杂度: 任务经过专门设计,要求执行数百个步骤,执行时间从数十分钟到数小时不等。任务涉及读取/修改代码、运行长脚本以及检查部分输出。
  • 难度校准: 任务通过创建“刻意损坏”的仅限终端的项目来构建。为了防止过拟合,公开检查非常精简(仅验证 CLI 行为和简单示例),而大部分奖励来自于隐藏的压力测试用例(例如嵌套的清单文件、模式变化、注入的噪声),这些用例要求具备鲁棒且泛化能力强的解决方案。

评分机制:密集奖励

与二元评估不同,LHTB 采用了基于子任务的评分方案

  • 每个任务被分解为具有语义意义的子任务 (s1,,sKs_1, \dots, s_K)。
  • 一个确定性的评分器根据客观证据(文件、输出、测试结果)为每个子任务分配归一化分数 rk[0,1]r_k \in [0, 1]
  • 最终奖励 RR 是加权平均值:R=wkrkwkR = \frac{\sum w_k r_k}{\sum w_k}
  • 这允许部分得分,即使 Agent 未能达到最终目标,也能捕捉到它完成了多少进度。

评估设置

  • 模型: 对 15 种前沿模型进行了评估(包括 GPT-5.5, DeepSeek V4 Pro, Kimi K2.7 Code 等)。
  • 框架: 大多数模型使用了 Terminus-2 Agent 框架,通过单个长时程终端会话进行交互。
  • 约束: 任务具有 90 分钟的墙钟时间(wall-clock)超时限制。
  • 指标: Pass@1(在阈值 R0.9,0.95,1.0R \ge 0.9, 0.95, 1.0 下)、平均归一化奖励、每项任务的 episode 数、执行时间和估计成本。

关键结果

评估表明,长时程执行仍然是即使对于最先进的模型而言也是一个显著的瓶颈。

  • 低成功率: 即便是最强的模型 GPT-5.5,在 R0.95R \ge 0.95 的阈值下也仅实现了 15.2% 的通过率,在完美完成(R=1.0R=1.0)时的通过率仅为 10.9%。所有 15 个模型的平均通过率在 R0.95R \ge 0.95 时仅为 4.3%
  • 资源消耗: 任务需求极高,平均每个运行过程需要 231 个 episode990 万个 token 以及 85.3 分钟 的执行时间。
  • 成本效率: 成本效率存在巨大差异。GPT-5.5 最贵(约 $21/任务)但也最有效。Hy3 锚定了低成本的前沿(约 $2.5/任务)并取得了中等程度的成功。许多模型在投入高额成本的同时几乎没有成功,这表明单纯增加推理支出并不能解决长时程失败问题。
  • 失败模式:
    • 超时: 79% 未解决的运行由于 90 分钟预算耗尽而终止,此时 Agent 仍在工作中,且通常处于较低的平均奖励水平(0.10–0.35)。
    • 错误完成(False Finishes): 很大一部分“提前退出”(Agent 自发停止)发生在较高的奖励水平(R0.75R \ge 0.75)处,即 Agent 错误地判断任务已完成。这凸显了在自我验证和停止准则方面的弱点。
    • 二元 vs. 密集: 在严格的二元评分(R1.0R \ge 1.0)下,15 个模型中有 10 个一个任务都没解决。密集评分显示,62.8% 的运行取得了实质性的部分进展,从而将“接近成功”的模型与那些立即失败的模型区分开来。

意义与主张

论文声称,Long-Horizon-Terminal-Bench 对于超越仅基于结果评估的局限性是必要的。其主要贡献在于:

  1. 揭示隐藏的进展: 密集奖励暴露了二元评分所掩盖的“差一点就成功”的情况和部分进度,提供了对 Agent 能力更细致的观察。
  2. 识别瓶颈: 结果表明,当前 Agent 的主要限制不在于局部推理的正确性(这是短时程基准测试所衡量的),而在于可靠的长时程完成能力。Agent 在时间预算管理、长轨迹状态维持以及校准停止决策方面表现挣扎。
  3. 基准测试现实性: 通过要求数百个步骤和数小时的执行,LHTB 为自主 Agent 提供了比以往基准测试更真实的压力测试,展示了巨大的提升空间。
  4. 未来工作的资源: 作者发布了该基准测试和评估框架,以支持开发能够在扩展时程内进行可靠规划、验证和执行的 Agent。

作者总结道,虽然目前的 Agent 可以正确执行局部步骤,但它们缺乏在实际、现实的工作流所需的长时程内保持进度并验证完成情况的鲁棒性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →