← 最新の論文
🤖 AI

StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling

本論文は、耐久性のある状態、チェックされた遷移、およびバージョン管理されたランブックを通じてハーネス・スケーリングを活用することで、Terminal-Bench 2.1における長期的なエージェントの精度を95.3%へと大幅に向上させつつ、ベースラインモデルと比較して推論コストを劇的に削減する、エージェント・ネイティブなランタイムであるStateMを導入する。

原著者: Ziheng Qin, Yaxin Lu, Zhangyang Atlas Wang, Kai Wang

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Ziheng Qin, Yaxin Lu, Zhangyang Atlas Wang, Kai Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の急速に進化する分野において、ある執拗な謎が生じている。個々の複雑なステップを解決できる高度なコンピュータプログラムが、なぜ長期間にわたる多段階の仕事を完了させようとすると失敗してしまうのか、という謎である。完璧な部屋を設計できることはあっても、基礎を築くのを忘れてしまう優れた建築家や、完璧な切開を行うことはできても、作業の途中で患者のバイタルサインを見失ってしまう熟練の外科医を想像してみてほしい。これら「ロングホライゾン・エージェント(長期視野を持つエージェント)」として知られるシステムは、知能が欠如しているからではなく、プロセスの中での現在地を見失うがゆえに躓くことが多い。彼らは、すでに何を行ったかを忘れたり、必要なチェックを飛ばしたり、あるいは最終目標が真に達成される前に作業を止めてしまったりする。長年、標準的な解決策は、より強力なモデルであればこうしたミスを犯さないだろうという期待のもと、より大きく、より賢い「脳」を構築することであった。しかし、新たな一連の探究は、問題は脳そのものではなく、むしろその脳が働く「環境」にあるのではないかと示唆している。

研究者たちは、異なる問いを投げかけ始めた。この失敗のうち、どれほどが、エージェントの注意を引きつけ、進捗を追跡し、仕事を完遂させるためのシステムの失敗によるものなのだろうか?著者たちが「ハーネス・スケーリング(器具の規模拡大)」と呼ぶこのアプローチは、既存の有能なモデル自体を変更することなく、その周囲にあるツールやルールを改善することで、モデルをはるかに信頼性の高いものにできると提案している。エージェントにすべてを自力で記憶させようとする代わりに、この手法では、エージェントと人間の監督者の双方が読み書きし、更新できる共有の外部ノートを与える。このノートは、エージェントが現在どこにいるのか、次に何をすることを約束したのか、そして前へ進むためにどのような証明が必要なのかを記録する、耐久性のある記録として機能する。実行プロセスを明確なチェックポイントを伴う一連の独立したフェーズとして扱うことで、システムはエージェントがコースから外れたり、仕事を中途半端な状態で放置したりしないように保証する。

Ziheng Qin氏とその同僚たちを中心とする研究チームは、このアイデアをテストするために、「StateM」と呼ばれる軽量なシステムを構築した。彼らは、人間がターミナルに指示を入力するのと同様に、コマンドラインを通じて動作する標準的なコンピュータ・エージェントで動作するように設計した。彼らの発明の核心は、「ランブック(業務手順書)」と呼ばれるシンプルで読みやすい文書である。この文書は、エージェントにとっての地図であり、契約でもある。それは、計画、構築、検証、引き継ぎといった特定のステージ(状態)へと大きなタスクを分解する。エージェントが新しいステージに入ると、システムは指示をリフレッシュし、そのステージを離れる前に達成すべき事項を正確に提示する。決定的なのは、エージェントは単にステージの完了を宣言することはできず、必ず検証チェックに合格しなければならないという点である。もしエージェントがステップをスキップしたり、チェックに失敗したりした場合、システムはそれを停止させ、先に進む前にエラーを修正することを強制する。これにより、エージェントと人間が作業を検査し、意思決定を監査し、共にルールを更新できる共有スペースが創出される。

このアプローチが機能するかどうかを確認するため、チームは「Terminal-Bench」として知られる89の厳格かつ複雑なコンピュータ・タスクを用いてテストを行った。彼らはGPT-5.5という強力なモデルを使用し、この新しいシステムを適用した。結果は驚くべきものだった。モデルの内部コードを変更したり、新しいデータで再学習させたりすることなく、システムはモデルの成功率を83.1パーセントから92.1パーセントへと向上させた。この利得は非常に大きく、この古いモデルと、より新しい高度なバージョンのソフトウェアとの間のギャップを事実上埋めるものであった。研究者たちは、全く同じルール(ランブック)を、調整を加えることなく、さらに新しいモデルであるGPT-5.6に適用した。システムはさらに優れた性能を発揮し、数百回の試行を通じて95.3パーセントの生の精度を達成した。それは89のタスクすべてに対して少なくとも一度は解決に成功しており、あるモデルのために開発されたルールが、新しいモデルへとシームレスに転移できることを実証した。

また、この研究は、より安価で異なる種類の人工知能モデルでもこのような恩恵が得られるかどうかについても調査した。彼らが同じ原理をDeepSeek-V4 Flashというモデルに適用した際、初期の結果は、正確なルールが完全に適合しなかったため、芳しくなかった。しかし、この新しいモデルに合わせて特定の慣行を適応させるために、38ドル未満という少額の費用を投じたところ、パフォーマンスを82.7パーセントから88.1パーセントへと引き上げることができた。適応と最終テストを含む、この結果を証明するための総コストは約52ドルであった。対照的に、同様の高レベルな結果を得るための最も高価な公開提出物のコストは、600ドル近くに達していた。これは、単に最も強力なモデルを購入するよりも、より優れた実行システムに投資する方がはるかに費用対効果が高い可能性を示唆している。

研究者たちはまた、予算の承認や機械の操作といった、ビジネス・ワークフローに関わる別のタスクセットでもシステムをテストした。ここでの結果は、ルールが仕事の性質と一致している場合に最も効果的であることを示した。厳格な規則遵守と明確な引き継ぎを必要とするタスクでは、システムは劇的な改善をもたらし、時には成功率を倍増させた。しかし、構造が大きく異なるタスクにおいては、ルールが硬直的すぎたり、プロセスの誤った部分に適用されたりした場合、システムが状況を悪化させることもあった。このことは、あらゆる状況に対して膨大なリストのルールを持つことではなく、エラーが発生しやすい特定の境界を特定し、そこでだけチェックを強制することが重要であるという教訓を研究者に与えた。

結局のところ、この研究は、人工知能の信頼性は、モデルがいかに賢いかと同じくらい、その仕事をどのように管理するかに依存していることを示唆している。研究者たちは、有能なエージェントが失敗する主な理由として、意思決定の瞬間に適切な知識を欠いていること、過去の試行から学んだ教訓を忘れること、あるいは既に知っている手順に従うことに失敗することの3つを特定した。彼らのシステムは、現在のフェーズに関する新鮮で明確な記録を保持し、再利用可能な文書に教訓を保存し、ステップを完了したことを証明させることで、これらの問題に対処している。これらの知見は、複雑な問題を解決するために、必ずしも次世代の超知能モデルを待つ必要はないことを示している。むしろ、既存のモデルを導くためのより良いシステムを構築することで、有能だが不安定なエージェントを、堅牢で仕事を完遂できるマシンへと変えることができる。進むべき道は、単に脳を大きくすることではなく、その脳を仕事へと運びきるための、より優れた「体」を構築することにある。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →