MidTool: Mid-training Data Synthesis for Agentic Tool Use
本論文は、大規模言語モデルの専用の中間学習を可能にするために多様なデータを合成するオープンなコーパス構築パイプラインであるMidToolを紹介し、このアプローチが事後学習のみに依存する場合と比較して、一般的なエージェントとしてのツール利用能力を大幅に向上させることを実証する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大規模言語モデルは、人間のような流暢さで読み、書き、推論することができる次世代のデジタルアシスタントのエンジンです。これらのシステムが真に有用であるためには、単に質問に答えるだけでなく、行動できる能力を持たなければなりません。これは、計算機や検索エンジン、あるいはソフトウェアのインターフェースといったツールを、いつ手に取るべきかを知り、問題を解決するためにそれらを正しく使いこなせることを意味します。現在の人工知能の展望において、研究者たちはこのツールの使用能力を、主にトレーニングの最終ステップとして扱ってきました。彼らは強力な事前学習済みモデルを取り上げ、関数を呼び出したりソフトウェアと対話したりする方法を、ファインチューニングというプロセスを通じて特別に教え込みます。しかし、このアプローチは最終段階に重い負担を強いることになります。モデルに対し、一連のアクションを計画したり、欠落した情報から回復したりといった複雑な振る舞いを、現実世界でそれらのツールが実際にどのように機能するかという深い基礎なしに、一度にすべて学習させようとするからです。
ワシントン大学とSnowflakeの研究チームは、異なる道を提案しました。彼らは、ツールの使用能力は、初期の広範な学習と最終的な専門的指示の間の段階である、モデルの成長過程の中間段階において育まれるべきであると示唆しています。彼らはこのプロセスを「ミッドトレーニング(中間学習)」と呼んでいます。このアイデアを検証するために、彼らはモデルにツールとの対話を教えるために特別に設計された大規模なカスタムデータセットを構築しました。彼らはこのプロジェクトを「MidTool」と名付けました。この専門的なデータを最終的なトレーニングステップの前にモデルに供給することで、彼らは、標準的な最終トレーニングのみを受けたモデルよりも、モデルがより効果的にツールを使用し、アクションの計画やエラーへの対処をより良く理解できることを発見しました。
研究者たちはまず、ツールの仕組みに関する生の知識を含む多様な資料を集めました。彼らは単にツールが使われている例を探しただけでなく、それらのツールがどのように機能すべきかを記述しているマニュアル、コード、ドキュメント、および技術仕様を収集しました。これには、数百万のウェブページ、数千のPDF形式の技術文書、膨大なコンピュータコードのリポジトリ、そして実世界のアプリケーション・プログラミング・インターフェース(API)の構造化された定義が含まれていました。彼らはこれらのソースを、AIという学生のための「教科書」として扱いました。この原材料から、彼らは203億トークン(処理されるテキストの量を示す尺度)を含むトレーニング混合物を作成しました。この混合物は慎重にバランスが取られており、ウェブドキュメントから約42%、コードから26%、PDFから23%、そしてエージェントがツールを使用する直接的な合成例から9%が抽出されました。
この静的な文書のコレクションを動的な学習体験に変えるために、研究者たちは二角的なアプローチを用いました。第一の手法は「グラウンディング(接地)」に焦点を当てたものです。彼らは技術文書やコードを取り上げ、ユーザーがそれらのテキストに記述されたツールを使用する必要があるシナリオをモデルに想像させました。モデルは、乱雑なマニュアルや複雑なコードスニペットを読み、利用可能なツールを特定し、それらを使用するために必要な情報を判断することを学ばなければなりませんでした。これにより、モデルは文脈に基づいてツールの「アフォーダンス(そのツールができること)」を認識することを学びました。第二の手法は「実行」に焦点を当てたものです。ここでは、研究者は実際のツール定義を使用して、エージェントが問題を解決していくステップバイステップの物語を生成しました。これらの物語には、エージェントが計画を立て、ツールを呼び出し、レスポンスを受け取り、次に何をすべきかを決定するというプロセスが含まれていました。決定的なことに、これらの例には情報が欠落していたり、ツールが失敗したりするシナリオも含まれており、モデルが諦めたり推測したりするのではなく、どのように回復し、明確化を求めるかを教えていました。
チームは、40億パラメータと80億パラメータの2つのバージョンのベース言語モデルを使用して、このアプローチをテストしました。彼らはこれらのモデルを新しいMidToolデータセットでトレーニングし、その後、他の研究者が用いる標準的な最終トレーニングステップを適用しました。そして、AIがどれだけツールを使いこなせるかを測定するために設計された3つの異なるベンチマークでモデルをテストしました。これらのテストは、単純なシングルステップのコマンドから、実際のソフトウェア環境と対話する必要がある複雑なマルチステップのタスクまで多岐にわたります。結果は明確なパターンを示しました。ミッドトレーニングを受けたモデルは、受けなかったモデルよりも一貫して優れた性能を発揮しました。その改善は、特に複数のステップを必要とするタスクや、未知のツールを扱う必要がある最も困難なタスクにおいて顕著でした。例えば、マルチターン(複数回のやり取り)の会話におけるツールの使用能力を測定するテストでは、40億パラメータのモデルは、最終トレーニングのみを受けたモデルと比較して、スコアが10ポイント以上上昇しました。
この研究は、このアプローチの限界も明らかにしました。ミッドトレーニングされたモデルは、一般的なツール使用においては大幅に向上しましたが、あらゆる種類のタスクにおいてエキスパートになったわけではありません。深い反復的なウェブ検索を含む特定のベンチマークでテストした際、モデルは同様のレベルの改善を示しませんでした。これは、一般的な基礎がツールの使い方や指示に従うための助けにはなるものの、深いリサーチや複雑な探索といった高度に専門化された振る挙動には、専用のトレーニングデータが必要であることを示唆しています。研究者たちは、ミッドトレーニングが強力で安定した基盤を提供し、その後の最終トレーニングをより効率的にすることを発見しました。モデルはより速く収束し、より高いレベルのパフォーマンスに到達しました。これは、ミッドトレーニング段階が、ツールがどのように組み合わさっているかという理解を深めるためのより良い内部的な理解を構築するのに役立ったことを示しています。
この研究は、ツールの使用はモデルの開発の最後に追加される単なるスキルであるという、支配的な仮定に異を唱えるものです。むしろ、ツールを通じて世界と相互作用する能力は、モデルの核となる知識の中に織り込まれるべき、根本的な能力であることを示唆しています。ツールのドキュメントの構造やツールのワークフローの論理にモデルをさらすことで、研究者たちは、より堅牢で適応性の高いシステムを作り上げました。これらの知見は、次世代のAIエージェントが真に効果的であるためには、そのトレーニングに、単にどのようなツールが存在するかだけでなく、それらをどのように認識し、それらを用いて計画を立て、問題が発生した際にどのように回復するかを学ぶための、専用のフェーズを含める必要があることを示唆しています。この中間的なトレーニング段階こそが、人工知能における、より自然で信頼性の高いエージェンシー(主体性)を解き放つ鍵となるようです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。