🤖 AI
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
本文介绍了 Long-Horizon-Terminal-Bench,这是一个包含 46 个复杂的、耗时数小时的终端任务的新基准测试,通过密集且细粒度的奖励评分,旨在更好地评估并揭示当前 AI 智能体在长程规划和迭代问题解决方面的显著局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:Long-Horizon-Terminal-Bench
问题陈述
基于大语言模型(LLM)构建的当前 AI Agent 在处理短程、范围明确的终端任务(例如修复特定的代码问题或执行几个 shell 命令)方面已展现出熟练度。然而,现有的终端基准测试(如 Terminal-Bench 和 SWE-Bench)主要侧重于这些短时程问题,其评估通常在几分钟内完成,且仅根据二元的“通过/失败”结果进行评分。这种评估范式造成了两个关键差距:
- 低估难度: 短时程无法捕捉现实世界工作流的复杂性,这些工作流需要数百个步骤、数小时的持续规划以及迭代调试。
- 稀疏的奖励信号: 二元评分忽略了中间进度。一个完成了复杂工作流 90% 但在最后一步失败的 Agent,其得分与立即失败的 Agent 相同,这掩盖了 Agent 的实际能力,并使得诊断具体的失败模式(例如过早停止 vs. 超时)变得困难。
方法论
作者引入了 Long-Horizon-Terminal-Bench (LHTB),该基准测试旨在通过密集的过程化奖励评分,对长时程、特定领域的终端任务进行压力测试。
任务构建
- 范围: 该基准测试包含 46 个任务,涵盖九个类别,包括实验复现、软件工程、多模态分析、交互式游戏和科学计算。
- 格式: 任务遵循 Terminal-Bench 的形式:一个容器化的 Docker 环境,包含自然语言指令、相关文件/工具以及一个预设解(oracle solution)。Agent 完全通过终端进行交互。
- 复杂度: 任务经过专门设计,要求执行数百个步骤,执行时间从数十分钟到数小时不等。任务涉及读取/修改代码、运行长脚本以及检查部分输出。
- 难度校准: 任务通过创建“刻意损坏”的仅限终端的项目来构建。为了防止过拟合,公开检查非常精简(仅验证 CLI 行为和简单示例),而大部分奖励来自于隐藏的压力测试用例(例如嵌套的清单文件、模式变化、注入的噪声),这些用例要求具备鲁棒且泛化能力强的解决方案。
评分机制:密集奖励
与二元评估不同,LHTB 采用了基于子任务的评分方案:
- 每个任务被分解为具有语义意义的子任务 ()。
- 一个确定性的评分器根据客观证据(文件、输出、测试结果)为每个子任务分配归一化分数 。
- 最终奖励 是加权平均值:。
- 这允许部分得分,即使 Agent 未能达到最终目标,也能捕捉到它完成了多少进度。
评估设置
- 模型: 对 15 种前沿模型进行了评估(包括 GPT-5.5, DeepSeek V4 Pro, Kimi K2.7 Code 等)。
- 框架: 大多数模型使用了 Terminus-2 Agent 框架,通过单个长时程终端会话进行交互。
- 约束: 任务具有 90 分钟的墙钟时间(wall-clock)超时限制。
- 指标: Pass@1(在阈值 下)、平均归一化奖励、每项任务的 episode 数、执行时间和估计成本。
关键结果
评估表明,长时程执行仍然是即使对于最先进的模型而言也是一个显著的瓶颈。
- 低成功率: 即便是最强的模型 GPT-5.5,在 的阈值下也仅实现了 15.2% 的通过率,在完美完成()时的通过率仅为 10.9%。所有 15 个模型的平均通过率在 时仅为 4.3%。
- 资源消耗: 任务需求极高,平均每个运行过程需要 231 个 episode、990 万个 token 以及 85.3 分钟 的执行时间。
- 成本效率: 成本效率存在巨大差异。GPT-5.5 最贵(约 $21/任务)但也最有效。Hy3 锚定了低成本的前沿(约 $2.5/任务)并取得了中等程度的成功。许多模型在投入高额成本的同时几乎没有成功,这表明单纯增加推理支出并不能解决长时程失败问题。
- 失败模式:
- 超时: 79% 未解决的运行由于 90 分钟预算耗尽而终止,此时 Agent 仍在工作中,且通常处于较低的平均奖励水平(0.10–0.35)。
- 错误完成(False Finishes): 很大一部分“提前退出”(Agent 自发停止)发生在较高的奖励水平()处,即 Agent 错误地判断任务已完成。这凸显了在自我验证和停止准则方面的弱点。
- 二元 vs. 密集: 在严格的二元评分()下,15 个模型中有 10 个一个任务都没解决。密集评分显示,62.8% 的运行取得了实质性的部分进展,从而将“接近成功”的模型与那些立即失败的模型区分开来。
意义与主张
论文声称,Long-Horizon-Terminal-Bench 对于超越仅基于结果评估的局限性是必要的。其主要贡献在于:
- 揭示隐藏的进展: 密集奖励暴露了二元评分所掩盖的“差一点就成功”的情况和部分进度,提供了对 Agent 能力更细致的观察。
- 识别瓶颈: 结果表明,当前 Agent 的主要限制不在于局部推理的正确性(这是短时程基准测试所衡量的),而在于可靠的长时程完成能力。Agent 在时间预算管理、长轨迹状态维持以及校准停止决策方面表现挣扎。
- 基准测试现实性: 通过要求数百个步骤和数小时的执行,LHTB 为自主 Agent 提供了比以往基准测试更真实的压力测试,展示了巨大的提升空间。
- 未来工作的资源: 作者发布了该基准测试和评估框架,以支持开发能够在扩展时程内进行可靠规划、验证和执行的 Agent。
作者总结道,虽然目前的 Agent 可以正确执行局部步骤,但它们缺乏在实际、现实的工作流所需的长时程内保持进度并验证完成情况的鲁棒性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。