← 最新の論文
💬 NLP

Tmax: A simple recipe for terminal agents

本論文は、新たなデータ生成タクソノミーを活用して大規模なデータセットを作成することで、90億パラメータのモデルが結果ベースの強化学習のみを用いてTerminal-Bench 2.0において最先端の性能を達成することを可能にする、ターミナルエージェント訓練のためのシンプルかつ強力なオープンソースのレシピであるTmaxを紹介する。

原著者: Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi

公開日 2026-06-23
📖 1 分で読めます☕ さくっと読める

原著者: Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

全体像:ロボットにコンピュータの使い方を教える

非常にスマートなロボット(大規模言語モデル)がいると想像してみてください。そのロボットはコードを書いたり質問に答えたりすることができます。しかし、今の状態は、まるで「キーボードに触れたことも、コンピュータの端末(ターミナル)を使ったこともない天才的な学生」のようなものです。コンピュータについて知識は持っていますが、目的を達成するために実際にコンピュータをどう「使う」のかを知りません。

TMAXプロジェクトは、これらのロボットに、複雑で現実世界の問題を解決するためにコンピュータのターミナル(コマンドを入力する黒い画面)をどのように使うかを教えるために設計された、シンプルで効果的な「トレーニングキャンプ」です。

問題点:「ジム」が簡単すぎた

この論文以前、研究者たちは既存のデータセットを使用してこれらのロボットを訓練しようとしてきました。著者らは、これらの古いデータセットを**「軽いダンベルしかないジム」**に例えています。

  • 問題点: タスクが単純すぎました(「ファイル一覧を表示する」や「ファイルを移動する」など)。現代のロボットにはあまりにも簡単すぎて、新しいことを何も学習できなかったのです。
  • ギャップ: 現実世界のタスクはもっと困難です。サーバーのセットアップ、複雑なコードのデバッグ、そして長い一連のコマンドの実行などが含まれます。従来の訓練データには、この「重い負荷(ヘビーリフティング)」をカバーするものがありませんでした。

解決策:カスタム「障害物コース」の構築 (TMAX-15K)

これを解決するために、著者らはTMAX-15Kと呼ばれる大規模な新しいデータセットを構築しました。これは、ロボットのために設計されたカスタムでハイテクな「障害物コース」だと考えてください。

すべてのタスクを手作業で書き出す(それには膨大な時間がかかるため)代わりに、彼らは**「レシピ生成器」**を作りました。

  1. 組み合わせ(ミックス・アンド・マッチ): 彼らは、異なる「材料」をランダムに組み合わせるシステムを作成しました。
    • ドメイン(領域): セキュリティ、データサイエンス、ファイル管理のどれか?
    • ペルソナ(役割): ロボットはハッカー、システム管理者、あるいはデータアナリストとして振る舞うのか?
    • 難易度: 3ステップの簡単なタスクか、それとも30ステップのマラソンか?
    • ツール: ロボットは音声ファイル、画像、あるいは複雑なコードを扱う必要があるか?
  2. 「先生」: 彼らは超高性能なAI(Gemini-1.5-Pro)を使用して、これらのタスクの具体的な指示と「解答集」を生成しました。
  3. 結果: 彼らは14,600個のユニークなタスクを作り出しました。決定的なのは、難易度が適切に調整されていることです。簡単すぎず、かつ不可能でもない。プレイヤーが常に挑戦し続けられ、かつ行き詰まることもないビデオゲームのような設計です。

学習方法:実践による学習(強化学習)

障害物コースができたら、次にロボットを訓練する方法が必要です。彼らは**強化学習(Reinforcement Learning: RL)**と呼ばれる手法を用いました。

  • 比喩: 犬が「取ってこい」を学習している様子を想像してください。ボールを投げる物理学を説明することはありません。ただボールを投げ、犬が持って帰ってきたら「おやつ(報酬)」を与えます。失敗したらおやつはあげません。
  • TMAXのレシピ:
    • ロボットはターミナル内でタスクを解決しようと試みます。
    • 成功すると、「報酬」が得られます。
    • 失敗すると、何も得られません。
    • ロボットは何度も繰り返し挑戦し、報酬を得るための最適なコマンドの打ち方を徐々に理解していきます。

重要な革新: 著者らは、標準的な訓練方法では不安定であること(ロボットが学んだことを「忘れて」しまったり、クラッシュしたりすること)を発見しました。彼らは、数学的な手法を微調整(DPPOを使用し、計算の精度を維持)することで、凹凸のある道を走る際の「ショックアブソーバー(緩衝装置)」のように、訓練を安定させました。

結果:小さなモデルによる大きな勝利

この論文で最も驚くべき部分は、訓練されたロボットのサイズです。

  • アンダードッグ(格下): 彼らが訓練したのは、わずか90億パラメータ(AIの世界では「小型」とされる)のモデルです。
  • 勝利: この小型モデル(TMAX-9B)は、3〜4倍大きいモデルを含む、ほぼすべての「オープン(公開)」モデルを打ち破りました。
  • 比較: それは、大手テック企業が使用しているトップクラスの非公開モデル(Claude Haikuなど)に匹近しい性能を発揮しました。

なぜこれが大きなニュースなのか?
通常、難しいタスクをこなすには、より大きな、より高価な「脳」が必要です。しかしTMAXは、適切な訓練データ優れたレシピがあれば、より小さな、より安価な「脳」が、より大きなモデルを凌駕できることを示しました。

学習は定着したのか?(汎化性能)

著者らは、「ロボットは特定のテストの答えを単に暗記しただけなのか、それとも実際にスキルを習得したのか?」と問いかけました。

  • テスト: 訓練されたロボットを異なる環境(異なる「ジムの設定」)に置き、異なる種類の問題(ソフトウェアのバグ修正や数学パズルなど)を与えました。
  • 結果: ロボットは「すべて」において向上しました。単に特定のテストに合格するために学んだのではなく、考え方やツールの使い方のエッセンスを学んだのです。それは、学生に「勉強法」を教えるようなものです。一度その「方法」を学べば、練習した試験だけでなく、あらゆる試験に合格できるようになります。

まとめ

TMAXの論文は、AIエージェントにコンピュータを使わせるための「ハウツーガイド」です。

  1. 大規模で多様、かつ難易度の高いデータセット(TMAX-15K)を、スマートな生成器を用いて構築した。
  2. 小型のモデルにこのデータセットをナビゲートさせるため、安定した訓練手法を用いた。
  3. 結果として、小型のオープンソースモデルが、コンピュータのターミナル操作において同種の中で最高レベルに達した。これは、「モデルを大きくすることよりも、優れた訓練データの方が重要である」ということを証明している。

著者らは、将来の研究者がより賢いターミナルエージェントを構築するための「標準的なレシピ」となることを願い、すべてのコード、データ、およびモデルを無料で公開しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →