CoCoDA: Co-evolving Compositional DAG for Tool-Augmented Agents
CoCoDA は、記号的統合による検索効率の最適化と構造認識型報酬メカニズムを通じた学習の加速を実現する単一の構成的コード DAG 内で、プランナーと成長するツールライブラリを共進化させることにより、小規模言語モデルがより大規模な教師モデルに匹敵するかそれ以上の性能を発揮することを可能にするフレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に頭が良くても小さなロボットアシスタント(「プランナー」)が、高度な数学の計算やコードの作成といった複雑な問題を解決する必要があると想像してください。このロボットは、一度に情報を保持できる「脳のスペース」(コンテキストウィンドウ)が限られています。それを助けるために、使用できるスキル(ツール)の工具箱を与えます。
既存の手法の問題点は、ポケットに膨大な量の図書館の書籍を持ち運ぼうとするようなものです。ロボットを助けるために有用な書籍(ツール)を追加すればするほど、ポケットは重くなりすぎて、ロボットは問題を解決するために必要なだけの書籍を脳に収められなくなります。また、ロボットはこれらの書籍をどのように整理すればよいかを知りません。単に散らかったテキストの山として見えるため、必要なものを素早く見つけることが困難です。
CoCoDA は、工具箱の構築方法と、ロボットがそれを使う方法を学ぶ仕組みを変えることで、この問題を解決する新しいシステムです。以下に、簡単な比喩を用いてその仕組みを説明します。
1. 「生きた設計図」(構成的 DAG)
散らかった書籍の山ではなく、CoCoDA は生きた設計図(有向非巡回グラフ、DAG)を構築します。
- ノード: これらは個々のツールと考えることができます。いくつかはハンマーやドライバーのような基本的なツールであり、他のものは基本的なツールを組み合わせて作られた「スーパーツール」(例えば、組み立て済みのドリルプレス)です。
- 接続: 設計図は、スーパーツールが基本的なツールからどのように構築されるかを正確に示しています。まるで「ケーキ」のレシピが「生地を混ぜる」ステップと「焼く」ステップを指し示すレシピブックのようです。
- 利点: 設計図が構造を知っているため、ロボットはすべての書籍のすべてのページを読む必要はありません。「目次」(シグネチャ)と「レシピのステップ」(依存関係)を見るだけで、どのツールが組み合わさるかを瞬時に知ることができます。
2. 「スマートフィルター」(型付き DAG 検索)
ロボットが新しい問題に直面したとき、正しいツールを選ぶ必要があります。従来の手法では、ライブラリ内のすべてのツールの説明を読み取るため、遅く、かつ脳のスペースを浪費します。
CoCoDA は、セキュリティチェックポイントのように選択肢を絞り込む4 段階のフィルターを使用します。
- ステージ 1(ID 確認): ツールの「ID カード」(その型のシグネチャ)を確認します。ツールが仕事に合わない場合(例えば、紙を切るためにハンマーを使おうとするなど)、即座に却下されます。これは脳の力をほとんど消費しません。
- ステージ 2(説明スキャン): ID 確認を通過したツールの短い説明を読み、関連性があるかどうかを確認します。
- ステージ 3(ルール確認): 「ルール」(事前条件と事後条件)を確認します。このツールは持っていない入力が必要ですか?正しい出力を生み出しますか?そうでなければ、捨てられます。
- ステージ 4(例の一致): 最後に、実際にツールが機能する現実世界の例を見て、絶対的に最良の一致を選びます。
魔法: 安価で高速なステージ(1 と 2)で不良ツールを除外するため、実際に生き残った少数のツールの詳細をすべて読むのに費やす高価な「脳の力」は最小限に抑えられます。これにより、ライブラリが巨大に成長しても、ロボットの「ポケット」が重くなりすぎるのを防ぎます。
3. 「共進化」(共に学ぶ)
これが最もユニークな部分です。通常、ロボットはツールの使い方を学びますが、ツールはそのままです。CoCoDA では、ロボットと工具箱が共に成長します。
- 発見: ロボットがいくつかの基本的なステップ(「加算」、「乗算」、次に「除算」など)を連鎖させることで難しい問題を成功裏に解決すると、「教師」(より大きく、賢い AI)がその成功を見ます。
- 発明: 教師は、「あのステップの連鎖は有用だ!それらを新しい『スーパーツール』に束ねて、設計図に追加しよう」と言います。
- 報酬: ロボットは、これらの新しいスーパーツールを使用することで、基本的なステップを繰り返し行う必要がなくなるため、ボーナススコア(報酬)を獲得します。
- ループ: ロボットが上手になるにつれて、束ねるパターンをより多く見つけます。工具箱が賢くなるにつれて、ロボットはより難しい問題を解決できます。それらは同期して進化します。
結果
この論文では、数学の問題、テーブル分析、コーディングタスクにおいてこのシステムをテストしました。
- 「小 vs 大」テスト: 80 億の「脳ユニット」を持つ小さなロボットと、320 億ユニットを持つ巨大なロボットを比較しました。
- 結果: CoCoDA を用いることで、小さなロボットは難しい数学や論理パズルにおいて、巨大なロボットと同等か、あるいはそれ以上のパフォーマンスを発揮しました。
- 効率性: 小さなロボットが単に運が良かっただけではありません。知識を非常に効率的に整理する方法を学び、重労働を行うために巨大な脳サイズを必要としなくなったのです。
要約すると、CoCoDA は小さな AI に、自分の組織化された階層的なスキルライブラリを構築することを教えます。これにより、どのツールを掴み、どのように組み合わせればよいかを正確に知り、圧倒されることなく、自らの重量級クラスをはるかに超える活躍を可能にします。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。