← 最新の論文
💻 computer science

How Many Tools Should an LLM Agent See? A Chance-Corrected Answer

本論文は、LLM エージェントに提示するツールの数を動的に最適化するための「ランダム対比ビット(BoR)」と呼ばれる確率補正指標を導入し、強化学習を通じて、多様なベンチマークにおいて固定サイズのアプローチと比較して適応型ショートリストがツール選択の精度とカバレッジを大幅に向上させることを実証する。

原著者: Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh, Joey Blackwell II

公開日 2026-05-26
📖 1 分で読めます☕ さくっと読める

原著者: Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh, Joey Blackwell II

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたがシェフ(AI エージェント)で、特定の料理(ユーザーの質問への回答)を作ろうとしていると想像してください。あなたには、何千もの食材(ツール)が入った巨大なパントリー(ツールレジストリ)があります。料理を始める前に、サブシェフ(検索システム)があなたにどの食材を渡すかを決めなければなりません。

この論文が問う大きな問題は、**「サブシェフはあなたのカウンターに何個の食材を置くべきか?」**です。

  • 渡す食材が多すぎると: 圧倒され、混乱し、間違ったスパイスを掴んでしまう可能性があります。
  • 渡す食材が少なすぎると: 実際に必要な特定の食材が手元にないままになり、料理が失敗する可能性があります。

現在の多くのキッチンでは、固定されたルールを採用しています。「レシピが簡単か難しいかに関わらず、常にシェフに正確に5つの食材を渡す」というものです。この論文は、これが悪いアイデアであると主張し、より賢く、自己調整型のシステムを提案しています。

以下に、彼らの解決策をシンプルな比喩を用いて解説します。

1. 「固定ルール」の問題点

特定の1冊の本を見つける必要がある図書館を想像してください。

  • 固定ルール: 司書は常に5冊の本の束をあなたに渡します。
    • 簡単なクエリ: あなたは「リンゴ」に関する本が必要でした。司書は5冊の本を渡し、その最初の1冊がリンゴについている本でした。素晴らしい!しかし、残りの4冊を読む時間を無駄にしてしまいました。
    • 難しいクエリ: あなたは「18世紀の希少なきのこ」に関する本が必要でした。司書は5冊の本を渡しますが、正しい本は図書館の12番目の本にあります。正しい本は0冊です。

この論文は、司書がどれだけ良い仕事をしているかを測るには、単に渡された本の数だけでなく、**「単にランダムに本を掴んでいる場合と比較して、どれだけ優れているか」**によって測る必要があると述べています。

2. 解決策:「ランダム超えのビット(Bits-over-Random、BoR)」

著者たちは、**Bits-over-Random(BoR)**と呼ばれる指標を導入しました。これは「幸運スコア」と考えてください。

  • ランダム基準: 司書が棚から盲目に本を掴んだ場合、正しい本を手にする確率はどれくらいでしょうか?
  • BoR スコア: これは、その盲目の運と比較して、司書がどれだけ上手にやっているかを測定します。
    • 司書が1冊の本を渡し、それが正しい本だった場合、それは大きな勝利です(なぜなら、ランダムな確率では1回の試行で正解する可能性は極めて低いため)。
    • 司書が100冊の本を渡し、その中に正しい本が含まれていた場合、それはより小さな勝利です(なぜなら、ランダムな確率でも100回の試行であれば、おそらく見つけていただろうため)。

魔法のトリック: この論文は、この「幸運スコア」を学習ロボット(強化学習エージェント)への報酬として使用します。

  • ロボットが早期に停止し、ツールを見つけると、大きな報酬が得られます(なぜなら、確率を簡単に上回ったため)。
  • ロボットがリストにさらに多くのツールを追加し続けると、報酬は自然に減少します(なぜなら、巨大な山からツールを見つけることは印象的ではなく、運良く見つかる可能性が高いため)。

これにより、ロボットは人間に「5つで止まれ!」と指示されなくても、正しいツールを持っていると確信した時点で、ツールの追加を停止することを学習します。

3. 結果:賢いサブシェフ

研究者たちは、この「賢いサブシェフ」を3つの異なるテストキッチンで、「固定ルール(常に5つのツール)」と比較してテストしました。

  • 小さなキッチン(BFCL - 370 ツール):

    • 固定ルール: 安全策として常に50のツールを表示します。正しいツールを見つける確率は90.8%です。
    • 賢いシェフ: 平均して7つのツールのみを表示します。それでも正しいツールを見つける確率は**90.3%**です。
    • 結果: 賢いシェフは、成功率の低下をほとんど伴わずに、「カウンタースペース(トークン)」を大幅に節約しました。
  • 巨大な倉庫(ToolBench - 3,251 ツール):

    • 固定ルール: 常に5つのツールを表示します。正しいツールを見つける確率は64.7%です。
    • 賢いシェフ: 平均して約4.4のツールを表示します。ツールを見つける確率は61.9%です。
    • ひねり: 本当に難しい質問(正しいツールが倉庫の奥深くに埋もれている場合)において、固定ルールは**0%しか見つけられません。一方、賢いシェフは最初の数つのツールが機能しないと認識し、少し深く掘り下げる(5.7のツールを表示)ことで、それらの難しい質問の16.7%**を見つけ出しました。固定ルールは早々に諦めてしまいます。

4. なぜ「少ない」方が「多い」のか(「雑然」効果)

この論文は、AI が実際にツールを選択しようとしたときに何が起こるかもテストしました。

  • 発見: AI に巨大なツールのリスト(例えば50個)を見せると、混乱し、間違ったものを選ぶ頻度が高まります。
  • 比喩: 友人に「これらの50枚の写真のうち、どれが私の犬ですか?」と尋ねると、選択肢が多すぎるため、間違えて推測する可能性があります。2枚の写真だけを見せれば、正しいものを選ぶ可能性ははるかに高くなります。
  • 証明: 賢いシェフがより少ないツールを表示したとき、AI は正しいツールを**93.1%の確率で選びました。一方、5つのツール(固定ルール)を見るように強制された場合、正しく選んだのは87.1%**のみでした。

まとめ

この論文は、AI にどのくらいの数のツールを表示すべきかについて、「万能の数字」は必要ないことを証明しています。

  • 古い方法: 「5つのツールを表示する」。(難しいタスクには少なすぎ、簡単なタスクには多すぎる)。
  • 新しい方法: 「幸運スコア(BoR)」を使用して、システムが成功する十分な確率を持った時点でツールの追加を停止するように学習させる。
  • メリット: 計算リソースを節約し、AI の混乱を減らし、固定ルールでは見逃してしまう難しい質問において、AI が正しい答えを見つけるのを実際に助けます。

著者たちは、このアイデアをテストするために完全な生産システムではなく、シンプルな「プローブ」ロボットを構築しましたが、その結果は、AI に「どのくらい」見るかを決定させることが、固定された量を見るように強制するよりもはるかに賢明であることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →