← 最新论文
💬 NLP

Tmax: A simple recipe for terminal agents

本文介绍了 Tmax,这是一种简单而强大的开源方案,用于训练终端智能体,它利用一种新颖的数据生成分类法来创建大规模数据集,使一个 9B 参数的模型仅通过基于结果的强化学习,便能在 Terminal-Bench 2.0 上达到最先进的性能。

原作者: Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心概览:教机器人使用电脑

想象一下,你有一个非常聪明的机器人(大语言模型),它会写代码,也能回答问题。但目前来看,它就像一个从未被允许接触键盘或使用电脑终端的天才学生——它知道关于计算机的“知识”,却不知道如何通过实际操作来完成任务。

TMAX 项目是一个简单且有效的“训练营”,旨在教这些机器人如何使用电脑终端(即输入命令的黑色屏幕)来解决复杂的现实世界问题。

问题所在:“健身房”太简单了

在本文发表之前,研究人员尝试使用现有的数据集来训练这些机器人。作者将这些旧数据集比作一个只有轻量哑铃的健身房

  • 问题在于: 这些任务太简单了(比如“列出文件”或“移动文件”)。现代机器人可以瞬间解决这些问题,因此它们并没有学到任何新东西。
  • 差距: 现实世界的任务更难。它们涉及搭建服务器、调试复杂代码以及运行长序列的命令。之前的训练数据无法涵盖这种“重体力活”。

解决方案:打造定制化的“障碍跑道”(TMAX-15K)

为了解决这个问题,作者构建了一个庞大的新数据集,名为 TMAX-15K。你可以把它想象成为机器人设计的一条高科技定制障碍跑道。

他们并没有手动编写每一个任务(那太慢了),而是构建了一个配方生成器

  1. 随机组合: 他们创建了一个系统,随机组合不同的“原料”:
    • 领域(Domain): 是关于网络安全、数据科学,还是文件管理?
    • 人格(Persona): 机器人是在扮演黑客、系统管理员,还是数据分析师?
    • 难度(Difficulty): 是一个 3 步的任务,还是一个 30 步的马拉松?
    • 工具(Tools): 机器人需要处理音频文件、图像,还是复杂的代码?
  2. “老师”: 他们使用了一个超级聪明的 AI(Gemini-1.5-Pro)来生成这些任务的具体指令和“标准答案”。
  3. 结果: 他们创造了 14,600 个独特的任务。至关重要的是,他们确保了难度恰到好处——既不过于简单,也不可能完成。这就像一款会自动调整难度的视频游戏,让玩家始终处于挑战之中,却不会被卡住。

训练方法:在实践中学习(强化学习)

有了障碍跑道后,他们需要一种训练机器人的方法。他们使用了被称为**强化学习(Reinforcement Learning, RL)**的方法。

  • 类比: 想象一只正在学习接球的狗。你不需要向它解释抛球的物理学原理。你只需要把球扔出去,如果它把球叼回来了,你就给它一点奖励(零食);如果失败了,就没有零食。
  • TMAX 配方:
    • 机器人在终端中尝试解决任务。
    • 如果成功,它会获得“奖励”。
    • 如果失败,它什么也得不到。
    • 机器人一遍又一遍地尝试,慢慢摸索出输入命令以获取奖励的最佳方式。

核心创新: 作者发现标准的训练方法并不稳定(机器人会“忘记”已学到的内容或崩溃)。他们调整了数学计算(使用了一种称为 DPPO 的方法并保持计算精度),就像为颠簸的路面安装了避震器,从而让训练过程保持稳定。

实验结果:小模型,大胜利

这篇论文中最令人惊讶的部分在于他们训练的机器人规模。

  • 黑马选手: 他们训练的模型仅有 90 亿参数(在 AI 世界中这被视为“小型”模型)。
  • 胜利: 这个名为 TMAX-9B 的小模型击败了几乎所有其他的“开源”(公开可用)模型,甚至包括一些规模是它 3 到 4 倍的模型。
  • 对比: 它的表现几乎可以媲美大型科技公司使用的顶尖“闭源”模型(如 Claude Haiku)。

为什么这很重要?
通常,要让模型擅长困难任务,你需要一个更大、更昂贵的“大脑”。TMAX 表明,通过正确的训练数据好的配方,一个较小的、更便宜的“大脑”也可以超越许多庞大的模型。

训练效果是否具有普适性?(泛化能力)

作者提出了一个问题:“机器人只是死记硬背了我们特定测试的答案,还是真正学会了一项技能?”

  • 测试: 他们将训练好的机器人放入不同的环境(不同的“健身房设置”)中,并给它不同类型的难题(例如修复软件漏洞或解决数学谜题)。
  • 结果: 机器人在各个方面都变得更强了。它不仅仅学会了通过特定的测试,它还学会了如何更有效地思考和使用工具。这就像教学生如何学习的方法;一旦掌握了方法,他们就能通过任何考试,而不仅仅是练习过的那个。

总结

TMAX 论文是一份关于如何教 AI Agent 使用电脑的“指南”。

  1. 他们利用智能生成器,构建了一个庞大、多样且具有挑战性的数据集(TMAX-15K)。
  2. 他们使用了一种稳定的训练方法,教导小型模型如何驾驭这个数据集。
  3. 结果: 一个开源的小型模型成为了此类任务中的佼佼者,证明了比起单纯扩大模型规模,更好的训练数据更为重要。

作者已经免费发布了所有的代码、数据和模型,希望这能成为未来研究人员构建更聪明终端 Agent 的标准“配方”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →