Stop Comparing LLM Agents Without Disclosing the Harness
本論文は、長期的なタスクにおいて、エージェント実行ハarnessは基盤となる言語モデルよりも性能を決定づける要因となることが多いと主張し、インフラの向上をモデルの改善と体系的に誤って帰属させることを防ぐため、コミュニティがハarnessを考慮した評価プロトコルを採用するよう促すものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
この論文を平易な言葉と創造的な比喩を用いて解説します。
核心となる考え方:重要なのはエンジンだけではない、車全体だ
どの車のエンジンが最高かを判断しようとしていると想像してください。あなたは、錆びつき、壊れかけ、タイヤがパンクし、ハンドルが効かない古びたセダンにフェラーリのエンジンを載せます。次に、少し出力の低いエンジンを、新品でハイテクなレーシングカーに、完璧なタイヤと GPS ナビゲーションシステムを備えた状態で載せます。
もし 2 台目の車がレースに勝った場合、それはエンジンが優れていたからでしょうか?いいえ。 勝ったのは、エンジンではなく「車」(シャーシ、タイヤ、ナビゲーション)が優れていたからです。
この論文は、私たちが現在、AI に対して全く同じ過ちを犯していると主張しています。
AI「エージェント」(コードの作成やソフトウェアのバグ修正などのタスクを実行できる AI プログラム)をテストする際、私たちは通常、単一のスコアを見て「おや、モデル A はモデル B より優れている」と言います。著者たちは、これは誤解を招くと指摘しています。彼らは、複雑で長期的なタスクにおいて、スコアは AI モデルそのものよりも、AI を取り巻くソフトウェア基盤である「ハーネス」に大きく依存すると主張しています。
「ハーネス」:AI の体と神経系
この論文では、その基盤を**「ハーネス」**と呼んでいます。AI モデル(「脳」)をパイロットだと考えれば、ハーネスはコックピット、オートパイロットシステム、燃料計、そして通信ラジオです。
- モデル(脳): 思考し、テキストを生成する部分に過ぎません。これは「オープンループ」であり、答えを吐き出し、次のプロンプトを待つだけです。誰かに指摘されるまで、自分が間違いを犯したことに気づきません。
- ハーネス(コントローラー): これは以下の機能を持つソフトウェア層です。
- AI にどの情報を表示するかを決定する(コンテキスト)。
- AI の回答が妥当か確認する(検証)。
- 失敗した場合、AI に再試行を指示する(リトライロジック)。
- 情報過多による混乱を防ぐ(メモリ管理)。
この論文は、長く困難なタスクにおいて、ハーネスが「制約条件(バインディング・コントストレイント)」であると主張しています。つまり、ハーネスがボトルネックなのです。ハーネスが劣っていれば、最も賢い AI でも失敗します。逆にハーネスが優れていれば、少し賢くない AI でも成功できます。
「制約条件仮説」
著者たちは**「制約条件仮説(Binding Constraint Thesis)」**と呼ばれる理論を提唱しています。平易な日本語に訳すと、以下のようになります。
「難易度の高い長期的なタスクにおいて、最上位の AI モデル同士を比較する場合、スコアの差は、どのモデルが使われたかという要因よりも、ハーネスがどのように構築されたかという要因によって生じることが多い」
彼らは、ハーネスを変更することでスコアが15 パーセントポイント変動するのに対し、モデルを変更しても通常スコアは2〜4 ポイントしか変動しないことを見出しました。
比喩: 2 人のランナーを想像してください。一人はオリンピックのスプリンター(モデル A)、もう一人は非常にフィットネスに優れたアマチュア(モデル B)です。
- オリンピックのスプリンターに泥だらけのブーツを履かせ、重いバックパックを持たせれば(悪いハーネス)、完璧な靴を履いたアマチュアに負けるかもしれません。
- この論文は、現在のリーダーボードは、全員が異なる靴を履いた状態でのレースのように扱っているが、私たちは靴のことは無視して勝者だけを報告している、と言っています。
現在のリーダーボードが「不完全」である理由
現在、ベンチマーク(SWE-bench や Terminal-Bench など)は、まるで「脳」だけをテストしているかのように振る舞っています。しかし実際には、**「脳+ハーネス」**をテストしているのです。
研究者がハーネスの構築方法(コックピットの「レシピ」)を正確に公開することが稀であるため、モデルが実際に賢くなったのか、それともチームがその周りに優れたハーネスを構築しただけなのかを判断できません。
論文の証拠:
- 実例: 同じ AI モデル(Claude Opus)が、あるハーネスでは 45.9% のスコアを、別のハーネスでは 55.4% のスコアを獲得しました。モデルではなく、ソフトウェアのラッパーを変更しただけで、これほど大きな跳躍が見られました。
- 統制実験: 3 つの異なるトップティアモデルを、3 つの異なるハーネス(最小限、改良版、フル版)で実行しました。
- 結果: モデルを変更するよりも、ハーネスを変更する方がスコアを大きく変化させました。
- 意外な展開: 時には、「悪い」ハーネスを持つ「優れた」モデルよりも、「良い」ハーネスを持つ「劣った」モデルが勝利しました。ランキングが逆転したのです!
解決策:「開示」と「分散分解」
この論文は、モデルの使用を中止すべきだと言っているわけではありません。ハーネスが存在しないかのように振る舞うのをやめるべきだと言っています。彼らは AI を評価する新しい方法を提案しています。
- 「ハーネスカード」: 食品ラベルが成分をリストアップするように、すべての AI ベンチマーク提出物は「ハーネスカード」をリストアップすべきです。このカードには、コンテキストの構築方法、エラー処理の方法、AI の検証方法が詳細に記載されます。
- 分散分解: 単一のスコアを与えるだけでなく、研究者は以下を報告すべきです。
- スコアの差のいくつがモデルによるものか?
- いくつがハーネスによるものか?
- いくつがそれらの相互作用によるものか?
結論
もしあなたが研究者、投資家、あるいは AI リーダーボードを見ているユーザーであれば、この論文は警告します:ランキングを盲目的に信頼してはなりません。
「ハーネスカード」を見るまで、リーダーボードのランキングは、誰がどの車を運転しているか分からない状態でレースを評価するようなものです。「勝者」は単に優れた車を持っていたのであり、優れたドライバーだったわけではないかもしれません。AI の進歩を真に理解するためには、脳だけを比較するのをやめ、脳と、その脳が宿る体全体を比較し始める必要があります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。