← 最新の論文
💻 computer science

GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling

本論文は、80 億パラメータの LLM を訓練するための高品質で多様な合成関数呼び出しデータを生成するマルチエージェント自動化パイプライン「GenesisFunc」を導入し、同規模のオープンソースモデルと比較してドメイン内性能とドメイン外汎化能力において優位性を示しつつ、高度な API ベースのシステムと競合する性能を達成することを報告する。

原著者: Hao-Xiang Xu, Chong Deng, Jiaqing Liu, Wen Wang, Qian Chen, Lujia Bao, Xiangang Li, Zhen-Hua Ling

公開日 2026-05-29
📖 1 分で読めます☕ さくっと読める

原著者: Hao-Xiang Xu, Chong Deng, Jiaqing Liu, Wen Wang, Qian Chen, Lujia Bao, Xiangang Li, Zhen-Hua Ling

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いものの経験の浅いアシスタント(大規模言語モデル、または LLM)がいると想像してください。このアシスタントが人間と同様に、天気を調べたり、飛行機を予約したり、予算を計算したりするといったツールの使用を可能にしたいと考えています。しかし、問題があります。アシスタントにこれらのツールの使い方を教えるためには、人々が助けを求め、アシスタントが適切なツールを選択し、詳細を埋める何千もの例を示す必要があるのです。

現実世界では、これらの例を集めることは干し草の山から針を探すようなものです。費用がかかり、時間がかかり、見つかる例はしばしば散漫で不完全です。これらの例を人工的に生成(合成)しようとした以前の試みは、機能しない「偽の」ツールや、ロボット的で反復的な会話をもたらすことが多くありました。

GENESISFUNC の登場です。これは、あなたの AI アシスタントのためのハイテクな自動化された「トレーニングキャンプ」と考えてください。すべての例を人間チームに書かせる代わりに、著者たちは AI エージェントのチームが協力して完璧なトレーニングデータを生成するシステムを構築しました。

以下に、GENESISFUNC の「トレーニングキャンプ」がどのように機能するかを、簡単なステップに分解して示します。

1. 信頼できるツールボックス(ツールプール)

トレーニング開始前に、システムは練習用のツールセットを必要とします。偽のツールを作るのではなく、GENESISFUNC は BFCL ベンチマークと呼ばれる、信頼できる公共のリアルワールドツールライブラリにアクセスします。

  • 比喩: 料理を学びたいシェフを想像してください。彼らは偽の食材を考案するのではなく、高品質で検証済みのスーパーマーケットに行き、新鮮で本物の野菜を選びます。これにより、トレーニングが空想ではなく現実に基づいていることが保証されます。

2. 監督版(マルチエージェント対話生成)

これがシステムの核心です。著者たちは、トレーニングスクリプト(会話)を作成するために、映画制作クルーのように機能する 4 人の AI「エージェント」(専門プログラム)のチームを編成しました。

  • キャスティングディレクター(サンプルエージェント): シーンに使用するツールの組み合わせを選びます。「主役」(タスクに必要なツール)と「エキストラ」(似ているが正解ではないダミーツール)を選択し、AI がそれらを区別する方法を学べるようにします。
  • 脚本医(メモリエージェント): 現在までに書かれたすべてのシーンを追跡します。チームが「飛行機の予約」について書き続けると、このエージェントは「ねえ、あれは十分やったから、代わりに『旅行の計画』についてのシーンを書こう」と言います。これにより、トレーニングデータが多様で反復的にならないことが保証されます。
  • 俳優(ファンクションエージェント): 実際の対話を作成します。ユーザーが質問をし、アシスタントが適切なツールを選択して空白(日付や場所など)を埋めて応答する内容を書きます。詳細が現実的になるよう注意を払い、時にはオプションの詳細を省略して、実際の人間の会話を模倣します。
  • 批評家(ジャッジエージェント): 草案を読み、最も優れたものを選びます。弱いスクリプトは捨て、AI アシスタントが完璧に仕事を完了したスクリプトを保持します。

3. 品質管理チェック(多段階評価)

素晴らしいチームであっても、ミスは起こります。モデルのトレーニングにデータを使用する前に、厳格な 3 段階の検査を受けます。

  • 文法警察(ルールチェッカー): コンピュータプログラムが形式が正しいか確認します(例:「正しい括弧を使っているか?」)。
  • 論理判事(モデルチェッカー): より賢い AI が会話を読み、論理が妥当か確認します(例:「アシスタントは実際にユーザーの問題を解決したか?」)。
  • 人間編集者(人間検証): 少数の人間チームが最も難しいケースを検証します。コンピュータがすでにエラーの 95% をフィルタリングしているため、人間が費やす時間は合計約 15 時間だけです。

結果:スーパーヘルパー

このシステムが大量で高品質なデータセットを生成した後、著者たちはそれを使用して 80 億パラメータの AI モデル(中規模モデル)をトレーニングしました。

  • 結果: このトレーニング済みモデルは、ツールの使用において達人となりました。同じサイズの他のオープンソースモデルよりも優れた性能を発揮し、大手テック企業のより大規模で高価なモデルとさえ競合しました。
  • 「汎化」の魔法: トレーニングデータが多様だったため(さまざまな種類のツールや複雑な会話を網羅)、モデルは単に例を暗記したわけではありませんでした。ツールの使用という「スキル」を学びました。以前見たことのないツールでテストされた際にも、驚くほど優れたパフォーマンスを発揮しました。

なぜこれが重要なのか

この論文は、この手法が AI にツールの使用を教える上での最大のボトルネック、すなわち良質なデータの欠如を解決すると主張しています。AI エージェントのチームを使用してデータを生成し、多様化し、検証することで、彼らは以下のパイプラインを構築しました。

  1. 信頼性: 実際に機能するリアルなツールに基づいている。
  2. 多様性: 単純な一歩の要求から複雑な多段階の会話まで、多くのシナリオを網羅している。
  3. スケーラビリティ: 大規模な人間のアノテーターチームを必要とせず、新しいツールを容易に追加できる。

要約すると、GENESISFUNC は AI アシスタントにツールの使い方を教えるための完璧な「教科書」を自動的に構築する工場のようなものであり、より賢く、能力の高いデジタルヘルパーを実現します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →