← 最新の論文
🤖 AI

Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows

Harness-Bench は、106 の現実的なサンドボックス化されたタスクから構成される診断用ベンチマークであり、システム層の構成(ハーネス)の違いが LLM エージェントのパフォーマンスにどのように影響するかを評価し、モデルとハーネスの組み合わせによって実行結果が著しく変動することを明らかにするとともに、エージェントの能力をベースモデルのみに帰属させるのではなく、構成レベルで報告する必要性を浮き彫りにする。

原著者: Yilun Yao, Xinyu Tan, Chao-Hsuan Liu, Yaoming Li, Zhengyang Wang, Wenhan Yu, Zhewen Tan, Yuxuan Tian, Guangxiang Zhao, Lin Sun, Xiangzheng Zhang, Tong Yang

公開日 2026-05-28
📖 1 分で読めます☕ さくっと読める

原著者: Yilun Yao, Xinyu Tan, Chao-Hsuan Liu, Yaoming Li, Zhengyang Wang, Wenhan Yu, Zhewen Tan, Yuxuan Tian, Guangxiang Zhao, Lin Sun, Xiangzheng Zhang, Tong Yang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してください。あなたは素晴らしい世界クラスのシェフ(AI モデル)を持っています。このシェフは、適切な指示を与えられれば、どんな料理も作ることができます。しかし、現実世界では、シェフは真空状態で立つわけではありません。彼らは特定の道具、一連の規則、注文を確認するマネージャー、そしてミスを処理するシステムを備えたキッチンで働いています。

この論文 Harness-Bench は、シェフだけでなく、そのキッチンシステム(「ハネス」と呼ばれる)をテストすることについて述べています。

問題:私たちはキッチンを見逃してきた

これまで、AI エージェントをテストする際、人々は主に「シェフはどれほど優れているか?」を問うてきました。彼らは最終的な料理(AI がタスクを完了したかどうか)を見ていましたが、キッチンがどのように設定されていたかは無視していました。

  • シェフは適切な包丁(ツール)を持っていたか?
  • シェフは焦げたフライパン(回復)をどう処理するかを知っていたか?
  • キッチンマネージャー(システム)は、シェフが間違った材料(権限)を使うのを止めたか?

著者らは、モデルを見るだけで AI の能力を判断することはできないと主張しています。モデル+キッチンシステムを一緒に見る必要があります。散らかって壊れたキッチンにいる偉大なシェフは失敗し、完璧で整然としたキッチンにいる良いシェフは成功するかもしれません。

解決策:AI 向けの「キッチンシミュレーター」

研究者たちは、106 の異なる調理課題(タスク)を備えた巨大なテスト場 Harness-Bench を構築しました。これらは単なる単純な質問ではなく、コードの修正、財務データの分析、プロジェクトの管理などの複雑な仕事です。

以下が彼らがどのようにテストしたかです:

  1. 同じ材料、異なるキッチン:彼らは同じ 106 のタスクを取り、異なる AI モデルに与えました。
  2. 変数:彼らはタスクを完全に同じに保ちながら、各実行ごとに「キッチンシステム」(ハネス)を入れ替えました。いくつかのキッチンはハイテクで厳格でした。他のものは緩くシンプルでした。
  3. 結果:彼らは5,000 回以上の実験を行いました。

彼らが発見したもの

結果は驚くべきもので明確でした:キッチンはシェフと同じくらい重要です

  • 大きな違い:彼らは同じ AI モデルを使用しましたが、異なる「キッチン」に入れたところ、成功率は大きく変動しました。あるキッチンシステムは 76% の成功率を得ましたが、別のシステムは全く同じモデルでわずか 52% しか得られませんでした。
  • 「賢い」キッチンが勝つ:最も高いパフォーマンスを発揮したシステムは、最も賢い AI モデルを備えたものだけではありませんでした。それらは、システムが AI を軌道に乗せ、ミスから回復し、ツールを正しく使用することを助けたものでした。
  • 「ドリフト」問題:研究者たちは、AI がしばしば良い計画で始めますが、その後「軌道から外れる」ことを発見しました。論理的に考えていても、実際にファイルを保存することを忘れたり、ツールのエラーを無視して同じことを繰り返し続けたりすることがあります。最も優れた「キッチンシステム」は、これらのドリフトを捉えて修正しました。

大きな教訓

この論文は、「この AI モデルは 90% 優れている」と言うのをやめる必要があると結論付けています。代わりに、「この AI モデルはこの特定のシステムと組み合わされた場合、90% 優れている」と言うべきです。

信頼できる AI エージェントを構築したい場合、最も賢い頭脳を選ぶだけでは不十分です。それに伴う最高の体と神経系(ハネス)を構築する必要があります。Harness-Bench は、エンジニアがその体を測定し、改善するために彼らが作成したツールです。

要約

レースカーをテストするのと同じように考えてください。エンジン(AI モデル)を見て「速い」と言うだけではいけません。エンジンが、異なるトラックで、異なるタイヤとドライバー(ハネス)の下でテストされる必要があります。Harness-Bench は、車の速さがエンジンだけでなく、トラックやタイヤに大きく依存することを証明する新しいトラックです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →