Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning
Argusは、専門化されたロールによって管理される持続的かつ自己進化的な状態を活用し、ミッションの軌道を自律的に検証、回復、および洗練させることで、多様なベンチマークにおいて優れた長期推論性能を実現する、汎用的な固定ウェイトのエージェンティック・ランタイムである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
長期的な探偵:なぜAIには「記憶」と「コーチ」が必要なのか
想像してみてください。あなたは、ゼロから動くロボットを作る方法を解明したり、筋の通った小説を書いたりといった、数日間にわたる大規模で複雑な謎解きに挑んでいるとします。もしあなたが数年前のコンピュータプログラムだったなら、指示を読み、推測を行い、そして次に挑戦する前に、今やったことを即座にすべて忘れてしまうという動きをしていたかもしれません。これは、初期の多くのAI「エージェント」がどのように機能していたかを表しています。彼らは、一つの手がかりを解いた直後に完全な記憶喪失に陥り、行き詰まるたびに調査を最初からやり直さなければならない探偵のようなものでした。彼らは読むスピードは速かったのですが、長期的な視点で自分の間違いから学ぶことは非常に苦手でした。
「ロングホライゾン(長期的)推論」という分野は、この問題を解決することに焦点を当てています。それは次のように問いかけます。「どうすればAIが数日間、あるいは数週間にわたって計画を維持し、昨日何を試したかを覚え、進むべき方向が間違っていると気づいた時に戦略を変更できるのか?」 ここでの鍵となる考え方は、賢さとは単に「大きな脳(強力なモデル)」を持つことではなく、「優れたノート(永続的な記憶)」と、「行き詰まった時に自分自身に嘘をつくのを防ぐ厳格なコーチ(検証)」を持つことである、という点です。この論文は、単に同じ場所をぐるぐる回るのではなく、時間をかけて自らの手法を進化させ、再学習を必要とせずに困難な問題を解決する方法を構築するための課題に取り組んでいます。
Argusとの出会い:軌道修正を学ぶAI
Argusをご紹介しましょう。これは新しい種類のAI「ランタイム」(AIの脳を動かすオペレーティングシステムやエンジンのようなものと考えてください)です。Microsoftおよび複数のトップ大学のチームによるArgusの開発者たちは、AIが真に困難で長期的なプロジェクトに取り組むためには、ただ盲目的に突き進むだけでは不十分であることに気づきました。もしAIが巨大なソフトウェアのコードベースのバグを修正しようとしたり、複雑な数学の定理を証明しようとしたりしている場合、何時間も無駄な道を進み続けてしまう可能性があります。通常のAIは、ただ突き進み続け、時間とエネルギーを浪費してしまうかもしれません。しかし、Argusは違います。Argusは**「ピボット(軌道修正)」**するように設計されているのです。
Argusを、一人の人間が孤独に作業しているのではなく、共有オフィスで働く高度に組織化されたリサーチチームだと考えてみてください。このチームには4つの明確な役割があり、彼らは決して仕事を混同しません。
- マネージャー(管理者): 全体像を把握しているボスです。日々の計画が変わったとしても、チームが本来の目標(例:「ロボットを作る」)に集中し続けるように管理します。
- プランナー(計画者): 戦略家であり、大きな目標をその日の実行可能な小さなタスクへと分解します。
- エンジニア(技術者): 実際にコードを書いたり、実験を行ったり、計算を行ったりする実務担当者です。
- レビュアー(査読者): 厳格な品質管理検査官です。エンジニアが構築したものを見て、「これは良い」「これは修正が必要だ」、あるいは「止まれ、この道は行き止まりだ」と判断するのが仕事です。
Argusの魔法は、**「失敗をデータとして扱う」ことにあります。エンジニアが試した手法が失敗に終わったとき、レビュアーは単に「おっと」と言うだけではありません。彼らは「なぜ」失敗したのかを正確に記録します。この記録は、永続的な「プロジェクト・ステート(プロジェクトの状態)」、つまりチームの共有ノートに保存されます。後にチームが同じ行き止まりの道に進もうとしたとき、システムは「おい、昨日これを試したがうまくいかなかった」と記憶し、新しいアイデアへと軌道修正(ピボット)します。これは「検証ガイド付きの持続性(verification-guided persistence)」**と呼ばれます。システムは、新しい情報が実際に真実であり、有用であるとレビュアーが検証した場合にのみ、「学習(メモリの更新)」を行います。
彼らが発見したこと:コード修正と論文執筆における向上
チームは、この「記憶を持つチーム」というアプローチが実際に機能するかどうかを確認するため、極めて困難な課題を用いてArgusをテストしました。
1. コード修正テスト(SWE-Bench Pro)
彼らはArgusに対し、731個の実世界のソフトウェアバグの修正を与えました。これは、プログラマーに整理されていない壊れたコードベースを渡し、人間の助けなしに修正を求めるようなものです。
- 結果: Argusは約**78%**のバグを正常に修正しました。
- 比較: 標準的なAIツール(Direct Copilot)は、そのうちの**59%**しか修正できませんでした。
- コスト: Argusは標準的なツールよりも約1.41倍多くのコンピュータ「トークン」(思考の基本単位)を使用しました。
- 教訓: Argusは、思考量は少し多かったものの、大幅に精度が高まりました。これは、作業をチェックし、過去のミスを記憶するために時間をかけることが報われることを証明しています。
2. 「賢くなる」テスト(自己進化)
ここが最も興味深い部分です。研究者たちは、Argusが時間の経過とともにどのように変化するかを観察しました。彼らはAIの脳(モデルの重み)を変更していません。代わりに、システムがスキルと記憶の「ノート」を構築していく過程を見守りました。
- 結果: システムがより多くのタスクを実行し、検証済みのスキルでノートを埋めていくにつれ、システムはより速く、より安価になりました。テストの後半段階では、Argusは開始時と比較して、タスクあたりのトークン使用量が21%減少し、実行時間が15%短縮されました。
- 意味: AIは賢くなるために再学習する必要はなく、単に学んだことを記憶する必要があったのです。AIは根本的な脳を変えることなく、自身の「ランタイム・ステート」を進化させ、より効率的なワーカーへと進化しました。
3. 「自分に嘘をつかない」テスト(レビュアーの介入)
チームは、レビュアーがどの程度の頻度で介入したかを追跡しました。731のタスクのうち、466回、レビュアーが呼び出されました。
- 救済: 43件のケースで、レビュアーは「これはまだ完了していない、やり直し」と指示しました。その後、エンジニアが再試行した結果、34件のタスクが修正され、さらに22件は、より厳格な二次レビューにも合格するほど完璧に修正されました。
- 阻止: レビュアーはまた、実際には不可能であったり壊れていたりするタスクに対して、システムが勝利を宣言することを防ぎました。これは35件のケースにおいて、システムが「できない」と言うことを学習したことを意味します。これは、ハルシネーション(もっともらしい嘘)を生み出すのではなく、正しく「できない」と言えるようになったことを示しており、非常に重要な成果です。
コードを超えて:数学、チップ、そして論文
Argusの能力はコード修正にとどまりませんでした。チームは、これが他の「ロングホライゾン(長期的)」なタスクも扱えることを示しました。
- 数学研究: 複雑な数学の定理を証明するキャンペーンにおいて、Argusは「誤りと証明された経路(falsified route)」の記録を保持しました。それを単に削除するのではなく、「進入禁止」の標識として保持したのです。これにより、システムは後でその行き止まりを回避し、定理の境界を強化することに成功しました。
- 論文執筆: 彼らは科学論文を執筆するために、6つの異なる研究プロジェクトを実行しました。システムは254回のミッションをこなし、16回の大きなロールバック(計画全体を書き直さなければならなかった場面)を乗り越え、最終的に6つの論文すべてを完成させました。あるプロジェクトでは、失敗したアイデアを成功した「負の結果(negative results)」の研究へと転換させており、時には「何がうまくいかないか」を知ることも有効な科学的発見であることを証明しました。
- チップ設計: 恐ろしいテストとして、Argusはコンピュータチップ(ACE-2)を設計しました。システムはコードを書き、タイミングをチェックし、最終的な設計はすべての厳格なハードウェアチェックをパスしました。システムは、自分が何をチェックしなかったのか(例:チップが実生活で動作するかどうか)を正確に把握しており、その限界についても明確にリストアップしていました。
まとめ
Argusは、AIが真に長期的な仕事を行うためには、単に大きな脳を持っているだけでは不十分であることを示しています。AIには、「ボス」と「ワーカー」を分離し、何がうまくいき、何がうまくいかなかったかの永続的な記録を保持し、そして作り話をしないための厳格な「レビュアー」を備えた**「システム」**が必要です。
この論文は、このような「検証ゲート(verification-gated)」のアプローチを用いることで、AIはより困難な問題を解決でき、再学習なしに効率を高めることができ、さらには行き詰まったときにそれを認めることもできると示唆しています。これは、すべてを即座に解決する魔法の杖ではありませんが、私たちと共に、長く複雑なプロジェクトに取り組み、迷うことなく、進捗について嘘をつくこともなく、粘り強く、軌道修正しながら、自らの手法を進化させていくAIへと向かうための、大きな一歩なのです。著者たちが述べているように、これは単にテストのスコアを上げることではなく、現実世界の混沌とした長期的な課題に取り組むために、持続し、ピボットし、自らの手法を進化させることができるシステムを構築することなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。