Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
本論文は、現在のAIエージェントにおける長期的な計画立案および反復的な問題解決における重大な限界をより適切に評価し、露呈させるために、高密度かつ微細な報酬格付けを備えた46個の複雑な数時間に及ぶターミナルタスクで構成される新しいベンチマーク、Long-Horizon-Terminal-Benchを導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約:Long-Horizon-Terminal-Bench
問題提起
大規模言語モデル(LLM)に基づいた現在のAIエージェントは、短期的で範囲の限定されたターミナルタスク(例:特定のコードの問題修正や、数回のシェルコマンド発行)においては習熟度を示している。しかし、既存のターミナルベンチマーク(Terminal-BenchやSWE-Benchなど)は、主にこうした短期間の課題に焦点を当てており、通常は数分以内の評価内で、かつ「合格/不合格」というバイナリな結果のみで採点される。この評価パラダイムは、以下の2つの決定的なギャップを生み出している:
- 難易度の過小評価: 短いホライゾン(期間)では、数百のステップ、数時間にわたる持続的なプランニング、そして反復的なデバッグを必要とする現実世界のワークフローの複雑さを捉えることができない。
- 報酬信号の希薄さ: バイナリによる採点は、中間段階の進捗を無視する。複雑なワークフローの90%を完了したものの、最終ステップで失敗したエージェントは、即座に失敗したエージェントと同じスコアを受け取ることになり、エージェントの実際の能力を覆い隠し、(早期停止かタイムアウトかといった)具体的な失敗モードの診断を困難にする。
メソドロジー
著者らは、高密度なプロセスベースの報酬採点を用いて、長期間のドメイン特化型ターミナルタスクにおけるエージェントのストレス・テストを行うために設計された**Long-Horizon-Terminal-Bench (LHTB)**を導入する。
タスク構築
- 範囲: 本ベンチマークは、実験の再現、ソフトウェアエンジニアリング、マルチモーダル分析、インタラクティブゲーム、科学計算を含む9つのカテゴリにわたる46のタスクで構成されている。
- フォーマット: タスクはTerminal-Benchの定式化に従う。すなわち、自然言語による指示、関連するファイル/ツール、およびオラクル・ソリューションを備えたコンテナ化されたDocker環境である。エージェントは完全にターミナルを介して相互作用する。
- 複雑性: タスクは、数百のステップと、数十分から数時間に及ぶ実行時間を明示的に必要とするよう設計されている。これには、コードの読み取り/修正、長いスクリプトの実行、および部分的な出力の検査が含まれる。
- 難易度の較正: タスクは、「意図的に壊された」ターミナル専用プロジェクトを作成することで構築された。オーバーフィッティングを防ぐため、公開チェックは最小限(CLIの挙動と単純な例の検証のみ)とし、報酬の大部分は、堅牢で汎用的な解決策を必要とする隠れたストレスケース(例:ネストされたマニフェスト、スキーマのバリエーション、注入されたノイズ)から導出される。
採点メカニズム:高密度報酬
バイナリ評価とは異なり、LHTBはサブタスクベースの採点スキームを採用している:
- 各タスクは、意味のあるサブタスク()に分解される。
- 決定論的なグレーダーが、客観的な証拠(ファイル、出力、テスト結果)に基づき、各サブタスクに対して正規化されたスコア を割り当てる。
- 最終的な報酬 は、加重平均となる:。
- これにより、エージェントが最終目標に到達できなくても、どの程度まで進捗したかを捉える部分点が可能になる。
評価セットアップ
- モデル: 15の最先端モデル(GPT-5.5、DeepSeek V4 Pro、Kimi K2.7 Codeなどを含む)が評価された。
- ハーネス: ほとんどのモデルにおいて、単一の長期間ターミナルセッションを介して相互作用するTerminus-2エージェント・ハーネスが使用された。
- 制約: タスクには90分間のウォールクロック・タイムアウトが設定されている。
- 指標: Pass@1(閾値 において)、平均正規化報酬、タスクあたりのエピソード数、実行時間、および推定コスト。
主な結果
評価の結果、長期間の実行は、最も高度なモデルにとっても依然として重大なボトルネックであることが明らかになった。
- 低い成功率: 最も強力なモデルであるGPT-5.5でさえ、 の閾値におけるパス率はわずか**15.2%であり、 の完全達成においては10.9%であった。15モデル全体の平均パス率は、 においてわずか4.3%**であった。
- リソース消費量: タスクは極めて負荷が高く、1実行あたり平均231エピソード、990万トークン、85.3分の実行時間を要した。
- コスト効率: コスト効率には大きな開きがある。GPT-5.5は最も高価(1タスクあたり約$21)だが、最も効果的である。Hy3は、中程度の成功を伴いつつ、低コストのフロントライン(1タスクあたり約$2.5)を担っている。多くのモデルは、成功がほとんどないにもかかわらず高いコストを費やしており、推論への支出を増やすだけでは長期間の失敗を解決できないことを示している。
- 失敗モード:
- タイムアウト: 未解決の実行の79%は、エージェントがまだ作業中であるにもかかわらず、90分の予算が終了したことによるものであり、多くの場合、平均報酬は低かった(0.10–0.35)。
- 誤った終了(False Finishes): 「早期退出」(エージェントが自発的に停止すること)の大部分は、エージェントがタスクが完了したと誤判定した高い報酬レベル()で発生した。これは、自己検証および停止基準の弱点を浮き彫りにしている。
- バイナリ vs 密度: 厳格なバイナリ採点()の下では、15モデル中10モデルがゼロのタスクを解決した。高密度な採点を用いることで、62.8%の実行が意味のある部分的な進捗を見せたことが判明し、「惜しい」モデルと「即座に失敗した」モデルを区別することができた。
意義と主張
本論文は、結果のみの評価の限界を超えるために、Long-Horizon-Terminal-Benchが必要であると主張している。その主な貢献は以下の通りである:
- 隠れた進捗の可視化: 高密度な報酬は、バイナリ採点では隠されてしまう「惜しい失敗」や部分的な進捗を露呈させ、エージェントの能力に関するより微細な視点を提供する。
- ボトルネックの特定: 結果は、現在のエージェントの主な限界は、局所的な推論の正確さ(短いベンチマークが測定するもの)ではなく、信頼できる長期間の完了にあることを示唆している。エージェントは、時間の管理、長い軌道における状態の維持、および停止決定の較正に苦慮している。
- 現実のベンチマーク: 数百のステップと数時間の実行を要求することにより、LHTBは従来のベンチマークよりも現実的なストレス・テストを提供し、大幅な改善の余地があることを示している。
- 将来の研究のためのリソース: 著者らは、拡張されたホライゾンにおいて計画、検証、および実行を確実に遂行できるエージェントの開発を支援するために、ベンチマークと評価ハーネスを公開する。
著者らは、現在のエージェントは局所的なステップを正しく実行できる一方で、実用的で現実世界のワークフローに求められる長期間の進捗を維持し、完了を検証するための堅牢性を欠いていると結論付けている。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。