← 最新の論文
🤖 AI

GOAT: A Training Framework for Goal-Oriented Agent with Tools

本論文は、ドキュメントから目標指向の API 実行データを自動的に合成することで、人間の注釈なしにオープンソースの LLM エージェントを複雑なツール使用に対して微調整可能にする新たなトレーニングフレームワーク「GOAT」を導入し、既存のベンチマークおよび新たに提案された GOATBench において最先端の性能を達成する。

原著者: Hyunji Min, Sangwon Jung, Junyoung Sung, Dosung Lee, Leekyeung Han, Paul Hongsuck Seo

公開日 2026-05-06
📖 1 分で読めます☕ さくっと読める

原著者: Hyunji Min, Sangwon Jung, Junyoung Sung, Dosung Lee, Leekyeung Han, Paul Hongsuck Seo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが非常に賢く、読書家である図書館員(AI)を想像してください。その図書館員は本を読み、物語を書く方法を知っています。しかし、もしあなたがこの図書館員に、図書館の奥の部屋に行って特定の古い地図の箱を見つけ、その中から特定のページを取り出し、そのページを使って料理本から特定のレシピを見つけるよう頼むと、その図書館員はしばしば道に迷います。間違った箱を選んだり、間違った本を開いたり、地図のページをキッチンに持ってくるのを忘れたりするかもしれません。

これが、現在の AI エージェントが「ツール」(データベース、気象サービス、映画リストへのデジタル接続である API など)を使用しようとする際に直面する問題です。彼らは会話をするのは得意ですが、前のステップの結果に完全に依存する次のステップを含む、多段階のミッションを計画するのは苦手です。

この論文は、その混乱した図書館員を名探偵へと変えるように設計された新しいトレーニング手法「GOAT(Goal-Oriented Agent with Tools:ツールを備えた目標指向エージェント)」を紹介しています。簡単な比喩を用いて、その仕組みを説明します。

問題:「当てずっぽうゲーム」

通常、AI にツールの使い方を教えるために、研究者たちは人間に数千もの例文を書かせる必要があります。例えば、「まず、気象 API に雨の情報を問い合わせる。次に、その『雨』という回答を受け取り、衣料 API にレインコートを問い合わせる」といった具合です。
これは高価で時間がかかります。これらの人手による例文がなければ、AI モデルは単に当てずっぽうをします。複数のステップを連鎖させる必要がある複雑なタスクでは、失敗することがよくあります。

解決策:「逆工程」キッチン

GOAT の著者たちは、人間に指示書を書かせる必要はないと気づきました。彼らはすでに「料理本」(API ドキュメント)を持っていたのです。完成した料理からレシピを当てさせるのではなく、「まず料理を作り、その後でレシピを記述する」と決めたのです。

彼らは「Call-First(呼び出し優先)」戦略を使用します。

  1. キッチンの地図化:まず、システムはすべての API マニュアルを読み、ツールがどのように接続されているかの地図を描きます。(例:「『気象』ツールの出力は、『傘』ツールの入力に完璧に適合する」など)
  2. 食事の調理(Call-First ステップ):システムはこの地図上の経路を選び、実際にツールを実行します。気象ツールにデータを問い合わせ、結果を得て、その結果を使って即座に傘ツールに問い合わせます。当てずっぽうをするのではなく、実際のステップを実行し、実際の回答を得ます。
  3. レシピの作成(抽象化ステップ):ツールが作業を終えた後、AI は出来上がった一連の出来事を見て、それに対応するユーザーの問い合わせ文を作成します。つまり、「ああ、私はレインコートを見つけるためにこれらすべてのステップを踏んだ。つまり、ユーザーが『雨が降るなら何を着ればいい?』と尋ねたのは、私が今解決した内容だ」というわけです。

このように逆順(行動 \rightarrow 質問)に行うことで、AI は人間が指示書を書く必要なく、ツールがどのように接続されるかの正しい論理を学びます。まず作業を実行し、その後で自分が何をしたかを説明することで学習するのです。

結果:スーパーヘルパー

この論文は、この新しい「GOAT」でトレーニングされたエージェントをいくつかの課題でテストしました。

  • RestBench & API-Bank:これらは、AI がツールの連鎖を使って映画レビューや音楽の推薦を見つける必要がある試験のようなものです。
  • GOAT-Bench:著者たちは、このような複雑な多段階タスクに特化した、新しい大規模な試験を独自に作成しました。

発見は明確でした

  • オープンソースモデル:GOAT 以前、小さくオープンソースの AI モデル(無料で誰でも利用可能なもの)は、これらの複雑なタスクにおいてほぼ無能でした。ほぼ 100% の失敗率でした。
  • GOAT 後:この新しい手法でトレーニングされると、これらの同じオープンソースモデルはこれらのタスクにおいて驚くほど優秀になりました。場合によっては、通常これらのテストを支配する高価なクローズドソースモデル(GPT-4 など)よりも優れたパフォーマンスを発揮しました。
  • 人間は不要:トレーニングデータセット全体は、システムが API マニュアルを使用して自動的に構築されました。人間が座ってステップバイステップの指示を書く必要はありませんでした。

結論

GOAT は、AI エージェントに計画を立ててツールを使用する方法を教える手法であり、まず実際の作業を実践させ、その後で目標を説明させるようにするものです。これにより、高価な人間の教師を必要とすることなく、オープンソースの AI モデルを「無知な当てずっぽう屋」から「信頼できる計画者」へと変えることができます。著者たちは、コードと新しいテストスイート(GOAT-Bench)を他の人が利用できるように公開しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →