HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry
HarnessXは、置換代数とトレース駆動型のマルチエージェント進化を通じてAIエージェントのランタイムインターフェースを体系的に進化させる、構成可能かつ適応的なファウンドリを導入しており、モデルのスケーリングのみに依存することなく、多様なベンチマークにおいて大幅な性能向上を実現しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください、あなたは非常に優秀ですが経験の浅いインターン(AIモデル)を抱えています。あなたは、旅行の計画を立てたり、壊れたウェブサイトを修理したり、ビデオゲームを攻略したりといった複雑な問題を解決させようとしています。
現在、多くの人々は、より賢い「スーパー・インターン」(より大規模で高価なAIモデル)を雇うことで、インターンを賢くしようとしています。しかし、この論文「HarnessX」は、真の秘訣は単に優れたインターンを雇うことではなく、彼らが働くためのより優れたオフィス、ツールキット、そしてルールブックを構築することにあると主張しています。
彼らは、この「オフィスのセットアップ」を**ハーネス(Harness)**と呼んでいます。
問題点:「手作り」のオフィス
現在、AIに新しい仕事をさせたい場合、人間のエンジニアがそのAIのためにカスタムオフィスを手動で構築しなければなりません。彼らは特定の指示(プロンプト)を書き、特定のツールを接続し、メモリシステムをセットアップします。
- 問題: これらのオフィスは静的です。もしインターンが変わったり、仕事の内容が変わったりすれば、オフィス全体をゼロから再構築しなければなりません。
- 無駄: インターンが失敗したとき、私たちはそのミスを確認し、手動でオフィスを修正して、再び試行します。しかし、それらのミスを使ってオフィスを自動的に改善したり、あるいは次の試みのためにインターンをより良く訓練したりするために利用することは、ほとんどありません。
解決策:「ハーネス・ファウンドリ(鋳造所)」
HarnessXは、これらのオフィスを自動的に構築する工場(「ファウンドリ」)です。これは、オフィスのセットアップを、自律的に組み立てられ、適応し、進化できる「生きているもの」として扱います。
仕組みは、以下の3つのシンプルな要素に分解できます。
1. コンポジション(構成):レゴ式のオフィス
乱雑で絡まり合ったオフィスではなく、HarnessXは型定義された、交換可能なレゴブロックである「プロセッサー(Processor)」を用いてオフィスを構築します。
- 比喩: オフィスには、特定の「スロット」があると想像してください。一つは「ツール」用、一つは「メモリ」用、一つは「ルール」用、そして一つは「コンテキスト」用です。
- 仕組み: 「ウェブ検索」ブロックをツールのスロットに、「長期記憶」ブロックをメモリのスロットにカチッとはめ込むことができます。これらは標準化されたブロックであるため、建物全体を壊すことなく、これらを入れ替えることができます。これにより、オフィスはモジュール化され、変更に対して安全になります。
2. アダプテーション(適応):自己改善するマネージャー(AEGIS)
これがシステムの頭脳です。HarnessXは、AEGISと呼ばれる特別なマネージャーを使用して、インターンの働きを見守り、オフィスを自動的に修正します。
- 鏡: AEGISは、オフィスをビデオゲームのキャラクターのように扱います。それは「トレース(インターンの行動ログ)」を読み取り、「なぜ失敗したのか? ツールが悪かったのか? ルールか? それともプロンプトか?」と問いかけます。
- 4ステップのループ:
- 消化(Digest): 乱雑なログを読み込み、失敗の内容を要約します。
- 計画(Plan): どのような種類の変更が必要かを決定します(例:「新しいツールが必要」 vs 「指示を書き直す必要がある」)。
- 進化(Evolve): 実際に新しいオフィスの構成を構築します。
- 批評(Critic): 厳格な安全検査官として機能します。新しいオフィスをテストし、以前うまくいっていたものが壊れていないかを確認します。
- 結果: 人間が毎回コードを書き直すことなく、オフィスはどんどん良くなっていきます。
3. コ・エボリューション(共進化):双方向の道
通常、私たちはオフィスを修正するか、あるいはインターンを訓練するかのどちらかを行います。しかし、HarnessXはこれらを同時に行います。
- 比喩: オフィスが向上することで、インターンが新しいテクニックを学ぶのを助けます。すると、インターンが賢くなることで、オフィスはさらに複雑なタスクに挑戦できるようになります。
- ループ: システムは、インターンの失敗を利用してオフィスをアップグレードし、同時に、新しいオフィスを利用してインターンの脳をアップグレードするためのより良い訓練データを生成します。これらは互いに高め合うのです。
実験では何が起きたのか?
チームは、ウェブショッピングからソフトウェアエンジニアリングに至るまで、5つの異なる「ゲーム(ベンチマーク)」でテストを行いました。そして、小規模から大規模まで3種類の異なるAIモデルを使用しました。
- 大きな勝利: 平均して、パフォーマンスが**14.5%**向上しました。
- 驚異的な勝利: 能力の低いAIモデルにおいては、改善は劇的で、最大**44%**に達しました。
- なぜか? 論文では、弱いモデルは「行動のギャップ(やり方を知らない状態)」が多いと指摘しています。優れたオフィス(ハーネス)は、そのギャップを即座に埋めることができます。一方で、強いモデルはすでに十分に優れているため、オフィスによる助けは少なくなります。
- 「行き詰まり」の問題: 非常に複雑なテスト(GAIA)において、単一のオフィスではすべてを解決できませんでした。なぜなら、タスクによって相反するルールが必要になることがあるからです。システムは、複数のバージョンのオフィス(バリアント)を作成し、各タスクに最適なバージョンをルーティングすることで、この問題を解決しました。これにより、以前のタスクのやり方を「忘れてしまう」ことを防ぎました。
まとめ
この論文は、AIモデルが無限に賢くなるのを待たなくても、より良い結果を得る方法があることを結論づけています。**構成可能で、自己進化する実行環境(ハーネス)**を構築することで、特に小型または能力の低いモデルにおいて、莫大なパフォーマンス向上を引き出すことができるのです。
要約すると: 単に賢いインターンを買うのではなく、より賢く、自己修復可能なオフィスを構築し、彼らが自らのミスから学んでオフィスをさらに良くしていく仕組みを作りましょう。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。