← 最新の論文
💬 NLP

Endless Terminals: Scaling RL Environments for Terminal Agents

この論文は、人間の注釈なしに手続き的に生成された「Endless Terminals」と呼ばれる大規模なターミナルタスクパイプラインを導入し、複雑なエージェント機構なしの単純な強化学習(PPO)でも、モデルのターミナル操作能力を大幅に向上させ、既存の人間作成ベンチマークでも他手法を上回る性能を発揮できることを実証しています。

原著者: Kanishk Gandhi, Shivam Garg, Noah D. Goodman, Dimitris Papailiopoulos

公開日 2026-02-17
📖 1 分で読めます☕ さくっと読める

原著者: Kanishk Gandhi, Shivam Garg, Noah D. Goodman, Dimitris Papailiopoulos

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

「無限のターミナル」:AI が独学でパソコン操作をマスターする物語

この論文は、**「AI がパソコンの黒い画面(ターミナル)で命令を実行するスキルを、人間の手を借りずに、無限に練習できる環境で身につける方法」**について書かれたものです。

まるで、AI に「料理のレシピ本」を渡すのではなく、**「無限に食材と調理器具が揃ったキッチン」**を与えて、失敗しながらも自ら料理を覚えるようにしたような話です。


1. 問題:AI は「練習場所」が足りない

これまでの AI の学習では、人間が「この問題を解いて」「このコードを書いて」という課題(ベンチマーク)をたくさん用意して、AI にテストさせていました。
しかし、パソコン操作のような複雑なタスクを教えるには、
「練習用の環境」が圧倒的に不足していました。

  • 人間が作る課題は高価で数が少ない: 100 問作るのがやっとで、AI が成長するには足りません。
  • 既存の課題は「テスト用」: 練習用ではなく、評価用として作られたものが多く、AI が試行錯誤して学ぶのには向いていません。

**「もっとたくさん、自動的に作れる練習場が必要だ!」**というのがこの研究のスタート地点です。

2. 解決策:「Endless Terminals(無限のターミナル)」

研究者たちは、人間の手を介さずに**「無限に課題を作り続ける自動工場」**を作りました。これを「Endless Terminals」と呼びます。

この工場は、4 つの工程(フェーズ)で動いています。まるで**「料理教室のシミュレーター」**のようなイメージです。

  1. 課題の発明(レシピ作成):
    AI に「ファイル整理」「ログ分析」「データベース操作」などのテーマをランダムに選びさせ、「〇〇という状態にしてください」という課題文と、正解のデータ(隠し情報)を自動生成します。

    • 例:「サーバーのログからエラーを抜き出して、CSV ファイルにまとめてください」
  2. 環境の準備(キッチンのセットアップ):
    その課題を解くために必要なパソコンの環境(コンテナ)を自動で作ります。そして、「本当に必要なファイルがあるか?」という事前テストを自動で走らせ、環境が整っているか確認します。

    • もし環境が壊れていたら、AI が自分で直して作り直します。
  3. 正解のチェック(味見テスト):
    AI が課題を解いた後、「本当に正しい結果が出たか?」を確認する最終テストを自動生成します。

    • 「エラー数が 0 になっているか?」「ファイルが正しく保存されているか?」をチェックします。
  4. 難易度のフィルター(先生による採点):
    最強の AI(o3 というモデル)に 16 回挑戦させて、「誰にも解けない問題」や「問題文がおかしい問題」は捨てます。

    • 「少なくとも 1 回でも解けた問題」だけを、練習用の教材として採用します。

このプロセスで、**3,255 個の「解ける課題」**が自動的に生まれました。

3. 学習方法:シンプルでガツガツと

この「無限の練習場」で、AI は**「PPO(強化学習)」**という方法で学びます。

  • シンプルなルール: 人間のような複雑なツールや、他の AI との連携は使いません。ただひたすら「命令を出して、結果を見て、また命令を出す」を繰り返します。
  • 報酬の仕組み: 課題が正解したら「ご褒美(1 点)」、間違ったら「0 点」。中間の点数はありません。
  • 結果: 最初は 4% しか解けなかった AI が、練習を積むと**18%、53%、59%**まで劇的に上達しました。

4. 驚きの結果:未知のテストでも勝つ

この「自動生成された練習場」で学んだ AI は、**人間が作った難易度の高いテスト(TerminalBench 2.0)**でも、他の AI よりも良い成績を残しました。

  • 重要なのは「練習量」: 複雑な仕組みや特別なツールを使わなくても、「練習する環境(課題数)」をスケール(拡大)させれば、単純な学習方法でも劇的に成長することが証明されました。

5. 失敗から学んだこと

AI が失敗した原因を分析すると、主に 2 つのパターンがありました。

  1. ループ地獄(39%): 間違った命令を何度も繰り返してしまうこと。
    • 成功した AI は、失敗したら「別の方法」を試しましたが、失敗した AI は同じことを繰り返していました。
  2. 時間切れ(26%): 16 回(トレーニング時)の試行回数を使い果たしてしまうこと。

また、**「ソフトウェア工学(プログラミング)」の分野では上手にできましたが、「数学」や「機械学習」**の分野では全くできませんでした。これは、練習場(自動生成システム)が、まだこれらの分野の課題を十分に作れていないためです。

まとめ:何がすごいのか?

この研究は、**「AI を賢くするには、より良いアルゴリズム(頭脳)を作るよりも、まず『練習できる環境』を無限に増やすことが重要だ」**というメッセージを伝えています。

まるで、**「天才的なスポーツ選手を育てるには、特別なトレーニング器具よりも、毎日練習できる広大なグラウンドが必要」**という話です。

「Endless Terminals」は、AI がパソコン操作を独学でマスターするための、無限に広がる練習場を提供した画期的な一歩と言えます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →