Collaborative Agent Reasoning Engineering (CARE): A Three-Party Design Methodology for Systematically Engineering AI Agents with Subject Matter Experts, Developers, and Helper Agents
本論文は、科学的領域における信頼性の高い AI エージェントの構築のために、非公式なドメインの意図を厳密で検証可能な仕様へと変換する、専門知識を持つ人材、開発者、および大規模言語モデル(LLM)の補助エージェントという三者のワークフローを活用する体系的なステージゲート型手法である「協調的エージェント推論工学(CARE)」を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、科学者たちが巨大な図書館から特定のデータを見つけるのを助ける、高度に熟練したロボットアシスタントを構築しようとしていると想像してください。過去には、人々はこれらのロボットに教えるために、単に彼らと話しかけ、何を言えばよいかを推測し、最善を望むという試みをしてきました。これは、ランダムな言葉を叫ぶだけで犬に複雑な数学を教えようとするようなものです。時にはうまくいくこともありますが、ほとんどは試行錯誤の混乱に終わります。
本論文は、これらの AI アシスタントを構築するための新しい、体系的な方法であるCARE(Collaborative Agent Reasoning Engineering:協働エージェント推論工学)を紹介しています。推測に頼るのではなく、CARE は AI の構築を橋の建設のように扱います。厳格な設計図、専門家チーム、そして段階的な検査プロセスが必要です。
以下に、CARE の仕組みを簡単な概念に分解して示します。
三つの当事者チーム
CARE は、人間がコンピュータと話すだけのものではありません。それは以下の三者間の対話です。
- 専門知識を持つ専門家(SMEs): ゲームのルールを知る科学者たち(例:「2020 年以降のデータのみを信頼する」「決して答えを推測しない」など)。
- 開発者: ロボットを構築する方法を知るエンジニアたち。
- 「ヘルパーエージェント」: 人間同士が対話するのを助けることだけが唯一の役割である特別な AI アシスタントたち。彼らは超効率的な書記や通訳のようなものです。彼らは科学者の話を聞き、明確化の質問をし、開発者が理解できる明確で構造化された形式でルールを書き留めます。
課題:「ジグザグのフロンティア」
本論文は、AI はジグザグの山脈のようなものであると説明しています。時には驚くほど賢く役立つこともあれば、混乱して事実を捏造することもあります。あなたが専門家であれば、安全な経路をナビゲートする方法を知っています。しかし、初心者がいる場合、崖から転落してしまうかもしれません。CARE の目的は、誰が使用しても AI が専門家のように振る舞うように構築することです。
CARE プロセス:五段階の建設現場
単にプロンプトを入力して最善を望むのではなく、CARE は「ステージゲート方式」のプロセスを使用します。つまり、現在のステップが人間によって承認されるまで、次のステップに進むことはできません。
- 範囲の定義と分解: チームは目標を定義します。このロボットは具体的に何をするべきか? ヘルパーエージェントは境界を書き留めるのを助けます。
- 主要情報の引き出し: チームは「ツール」と「文脈」を収集します。ロボットはどのデータベースにアクセスできるか?正しい答えとはどのようなものか? ヘルパーエージェントはこれらの答えをチェックリストに変換します。
- 推論ポリシーとガードレール: ここが最も重要な部分です。チームはロボットがどのように考えるかを決定します。いつ助けを求め、いつ「わからない」と言うべきか? ヘルパーエージェントはこれらのルールを草案し、人間がそれを承認します。
- プロンプトのアーキテクチャ: ルールが設定された後になって初めて、チームは AI 向けの実際の指示(「プロンプト」)を作成します。ルールがすでに明確であるため、プロンプトは単に承認されたルールの翻訳であり、推測ではありません。
- ベンチマークと検証: ロボットが作業を開始する前に、テストを受けます。チームは、ロボットが実際に書き留めたルールに従っているかどうかを確認するための質問セットを作成します。
「ヘルパーエージェント」の比喩
ヘルパーエージェントを建設現場の監督と考えてください。
- 科学者(SME)は、「安全で強固な壁が必要だ」と言います。
- 開発者は、「わかりました、建設します」と言います。
- 監督がいなければ、彼らは「強固」とは何かについて議論するか、開発者は見た目によいが崩れる壁を建設するかもしれません。
- ヘルパーエージェントがいる場合、それは介入して、「科学者さん、『強固』とは 500 ポンドを支えられることを意味しますか?開発者さん、あなたの計画はその 500 ポンドの要件を満たしていますか?」と言います。そして、契約書(「アーティファクト」)に正確な仕様を書き留めます。後で計画が変更された場合、契約書も更新され、誰が何を変更したかが正確にわかります。
実世界でのテスト:NASA ケーススタディ
これが機能することを証明するために、チームは NASA のために、地球科学データの巨大なカタログ(NASA Common Metadata Repository)を検索する AI エージェントを構築しました。
- 対決: 彼らは 2 つのエージェントを構築しました。
- エージェント A(CARE エージェント): ヘルパーエージェントを用いた厳格な 5 段階の CARE プロセスを使用して構築されました。
- エージェント B(ベースライン): 「古い方法」で構築されました(同じ AI モデルとツールを使用しましたが、厳格な CARE プロセスは使用しませんでした)。
- 結果:
- 621 の質問による大規模な自動テストにおいて、CARE エージェントは**71.7%の確率で最初に正しい答えを見つけましたが、古い方法は69.1%**でした。
- 実際の NASA 科学者によって作成された、より小さく困難なテスト(43 の質問)において、CARE エージェントは上位 5 つの結果の中に正しい答えを**27.2%の確率で見つけ、古い方法の20.2%**を上回りました。
結論
本論文は、AI を構築する前に人間と「ヘルパーエージェント」が協力して明確なルールを書き留める構造化されたプロセスを使用することで、より信頼性が高く、安全で、性能の優れたロボットが得られると主張しています。これは、「プロンプトエンジニアリング」という混沌とした芸術を、予測可能な工学の分野へと変えるものです。
重要な注意点: 本論文は、科学的データの発見にのみこの方法をテストしました。医療診断、法的助言、または他の特定の分野においてこの方法が機能すると主張するものではありません。これらの分野が将来の作業で明示的に言及されない限り、成功は提供された NASA のデータ検索の例に厳密に限定されます。本論文はこれら他の分野を扱っていません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。