← 最新の論文
🤖 AI

Do Agents Know What They Can't Do? Evaluating Feasibility Awareness in Tool-Using Agents

本論文は、重要なツールをマスクすることで実行不可能なツール利用エージェントタスクを生成する自動化パイプライン FeasiGen を導入し、それを用いて現在のエージェントは実行可能性に対する認識が乏しく、高いエラー率で不可能なタスクの処理を継続することが多い一方で、マルチエージェントアーキテクチャは性能向上を示すことを明らかにする。

原著者: Liang Cheng, Mingsheng Cai, Jiuming Jiang, Luo Mai

公開日 2026-05-28
📖 1 分で読めます☕ さくっと読める

原著者: Liang Cheng, Mingsheng Cai, Jiuming Jiang, Luo Mai

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く意欲的なアシスタントを雇い、飛行機の予約と支払いといった複雑なプロジェクトを手伝ってもらうと想像してください。そのアシスタントには、検索エンジン、予約エンジン、クレジットカード処理システムといった、使用可能なツールのリストを渡します。

次に、アシスタントが作業を開始する前に、こっそりとその工具箱からクレジットカード処理システムを取り除いてしまったと想像してください。

問題点:
現在の AI アシスタントの多くは、ツールが不足していることに気づいていない、その意欲的なアシスタントのようです。彼らはフライトを検索し、素晴らしい割引を見つけ、その後支払いを試みます。支払いができないことに気づいても、彼らは「ああ、これはできない」とは言いません。代わりに、試行を続けます。再度支払いを試みたり、存在しない別の支払い方法を探したり、なぜ支払いができないのかについて長い論文を書いたりします。彼らは、最初から不可能だったタスクに対して、膨大な時間とエネルギー(計算資源)を浪費します。

解決策 (FeasiGen):
この論文の研究者たちは、FeasiGen(Feasibility Generator、実現可能性生成器)と呼ばれるシステムを構築しました。これは「現実確認」を行う機械のようなものです。

  1. ルールの学習: まず、彼らは多くの異なる AI アシスタントがタスクを成功裏に完了する様子を観察しました。彼らは「足跡」(使用された特定のツール)を分析し、すべての成功において絶対に必要だったツールが何かを確認しました。飛行機の例では、すべての成功した予約に「Payment API」が使用されていたことに気づきました。
  2. 罠の作成: 次に、彼らは同じタスクを取り上げ、それらの重要なツールをこっそりと取り除きました。これにより、解決可能なタスクを不可能なものに変えました。
  3. テスト: 彼らはこれらの「壊れた」タスクを 9 つの異なる AI モデルに与え、モデルが「おい、重要なツールが足りないな、今すぐ止めるべきだ」と気づけるかどうか、あるいは堂々巡りを続けるかどうかを確認しました。

発見されたこと:
結果は少し驚くべきものであり、AI の効率性にとって少し懸念されるものでした。

  • ほとんどの AI は動き続ける: 最も賢いモデルでさえも、停止することに失敗することが多かったです。彼らは、約 23% から 74% の確率で、不可能なタスクの解決を試み続けました。まるで、道路が途絶えているか確認するのを忘れたドライバーが、壁を突き抜けて運転しようとするようなものです。
  • 頑固さのコスト: AI が不可能なタスクで試行を続けると、すぐに停止した場合に比べて、2 倍から 5 倍の計算資源(トークン) を使用します。これは、行き止まりの街路の終わりを歩いて、自分が道に迷ったことに気づくのと、そこまで歩いて引き返し、戻ってくるのとの違いです。
  • チームワークの助け: 研究者たちが「チーム」を編成した(一人は計画、一人は作業)場合、チームは欠落したツールを特定する能力が格段に向上しました。「計画役」はまずツールを確認し、何かが欠けていることに気づいて、「作業者」が着手する前に「停止」と指示しました。これにより、無駄な努力が劇的に削減されました。
  • より深く考えること(場合によっては): 行動する前に「段階的に考える」ことを強制されたモデルは、一般的に欠落したツールを特定する能力が優れていましたが、これはすべてのモデルに当てはまったわけではありません。

大きな教訓:
現在、私たちは主に AI がタスクを完了できるかどうかを見てテストしています。しかし、この論文はそれだけでは不十分だと述べています。私たちは、何をすべきでないかを知っているかどうかをテストすることも必要です。いつやめるべきかを知る AI は、どのように完了させるかを知る AI と同じくらい重要です。現在、ほとんどの AI は行き止まりに陥ったときに気づくのが非常に下手であり、これにより膨大なエネルギーと資金が浪費されています。

限界に関する注記:
研究者たちは、彼らのテストがツールリストが固定され既知の「閉じた」環境でのみ機能することを認めています。もし AI が魔法のように新しいツールを発明したり、オープンなインターネット上でそれらを見つけたりできるのであれば、このテストは同じように機能しません。しかし、ツールが厳密に定義されているシステムにおいては、この「現実確認」は、AI が実際にどれほど賢いかを測定するための重要な新しい方法です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →