← 最新の論文
💬 NLP

MyAG: A Graph-Based Framework for Designing and Analyzing Composable LLM Agent Systems

本論文は、柔軟な設計、階層的な構成、および性能分析を可能にするために、構成可能なLLMエージェントシステムをコンポーネント、ワークフロー、およびサーチグラフへと分解する、オープンソースのグラフベースのフレームワークであるMyAGを紹介する。

原著者: Zhisong Zhang

公開日 2026-07-16
📖 1 分で読めます☕ さくっと読める

原著者: Zhisong Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが単に質問に答えるだけでなく、実際に「行動」する世界を想像してみてください。ウェブを閲覧し、航空券を予約し、複雑なパズルを解くようなデジタルアシスタントとして機能する世界です。これが「AIエージェント」の領域です。これらを単なるチャットボットではなく、脳(大規模言語モデル)と、世界と相互作用するための手(ツール)を備えた小さなロボットだと考えてください。しかし、ここが難しいところです。これらのロボットを作る作業は非常に煩雑です。どのようなツールを持たせるか、どのようにステップバイステップで思考させるか、そして行き詰まったときにどうするかを決めなければなりません。それは、エンジン、ステアリングホイール、GPSがすべて一体化して接着されており、交換できない車を作ろうとしているようなものです。車の走らせ方を変えたいと思っても、エンジン全体を再構築しなければならないかもしれません。研究者たちは、これらのエージェントを柔軟で効率的、かつ修正しやすい形で構築する方法を見つけ出そうとしています。なぜなら、現在は、ロボットが失敗している理由が「頭が悪い」せいなのか、それとも単に指示の書き方が下手だったせいなのかを判断するのが困難だからです。

ここで、香港城市大学のZhisong Zhang氏によって作成された新しいツールキット、「MyAG」が登場します。論文では、MyAGを「グラフベースのフレームワーク」として提示しています。これは、エージェントのデザインを一つの巨大で絡まり合った塊にするのではなく、3つの別個で明確な設計図に整理するという、少し凝った言い方です。著者らは、「誰が(構成要素)」、「どのように(ワークフロー)」、「もし〜だったら(探索戦略)」を分離することで、開発者がレゴブロックのようにパーツを組み合わせたり、入れ替えたりできることを示唆しています。彼らは、この分離によって、システム全体を書き直すことなく異なる戦略をテストすることが非常に容易になることを発見しました。実験において、彼らはこのアプローチによって、エージェントのタスク遂行能力と、それに要する時間やコストとの間のトレードオフを詳細に観察できることを示しました。彼らはすべてのAI問題を解決したと主張しているわけではありませんが、彼らの手法が、エージェントがどこで時間を費やし、どこでリソースを浪費しているのかを正確に特定するのに役立つことを実証しました。

デジタル脳の3つの設計図

MyAGを理解するために、あなたが映画の監督をしていると想像してください。あなたには3つの明確な仕事があり、MyAGは、一つを修正しても他のものが台無しにならないように、それらを切り離しておくことを要求します。

1. コンポーネント・グラフ(構成要素):キャストとクルー
これは、映画に誰が登場するかというリストです。AIの世界では、これらはエージェント(意思決定を行う俳優)、環境(ウェブブラウザのような、彼らが活動する舞台)、そしてツール(彼らが使う小道具)です。MyAGにおいて、これは「誰が誰と通信できるか」を示すマップとして描かれます。例えば、「アクション・エージェント」は「ブラウザ環境」に接続されていることがあり、これはエージェントがウェブページ上のボタンをクリックできることを意味します。面白いのは、同じ俳優を異なるシーンで再利用できることです。シーンが変わるたびに新しい俳優を作る必要はありません。既存の者に次に何をすべきかを伝えるだけでよいのです。

2. ワークフロー・グラフ(脚本):台本
これは、俳優がいつ話し、次に何をすべきかを指示する脚本です。物語の流れです。エージェントは天気をチェックしてからチケットを予約するのか? それとも、失敗したらやり直すためにループするのか? MyAGでは、この脚本をフローチャートとして描くことができます。ループ、分岐(もしこれが起きたら左へ、あれが起きたら右へ)、そして停止条件を設定できます。最も素晴らしい点は、同じキャスト(コンポーネント・グラフ)を維持したまま、脚本(ワークフロー・グラフ)を入れ替えて、異なる物語の構造がよりうまく機能するかどうかを確認できることです。

3. サーチ・グラフ(探索グラフ):「もしも」の稽古
ここからが本当に興味深いところです。時として、ロボットは最適なものを見極める前に、さまざまな経路を探索する必要があります。例えば、ドアを試してみて、鍵がかかっていると気づき、次に窓を試すといった具合です。サーチ・グラフは、これらすべての「もしも」のシナリオを記録します。エージェントが辿ったすべての分岐、すべての行き止まり、そしてすべての成功した経路を追跡します。これにより、システムは「ベストファースト・サーチ(常に最も有望な経路を選ぶ)」や「ロールバック(物事がうまくいかない場合に前のステップに戻る)」といった戦略を使用できます。これは、映画のセット全体を再構築することなく、「カット! 今度はキャラクターを歩くのではなく、走らせてみよう」と言えるディレクターがいるようなものです。

レゴブロックで塔を築く

この論文の大きなアイデアの一つは、**階層的構成(Hierarchical Composition)**です。巨大なロボットを作ると想像してください。最初からすべての小さなネジやワイヤーを設計しようとするのではなく、まず手を、次に足を、次に頭を作り、最後にそれらを組み合わせます。MyAGでは、AIエージェントでこれを行うことができます。インターネット上で論文を見つけるのが非常に得意な小さな「ウェブブラウジング・システム」を作ることができます。そして、そのシステム全体を包み込み、より大きな「リサーチ・アシスタント」システムの中の単一のツールとして扱うことができるのです。

論文では、これらの「サブシステム」は、ステートレス(計算機のように、使用されるたびにリセットされる)またはステートフル(人間の助手のように、以前に何が起きたかを記憶する)である場合があることを説明しています。このモジュール性により、毎回ゼロから始めるのではなく、テスト済みの小さなパーツを組み合わせて、複雑なエージェントを構築することができます。

ストップウォッチと財布:効率性の測定

著者らは効率性についても重視しています。彼らは、エージェントが正解に辿り着いたからといって、それが優れたエージェントであるとは限らないと主張しています。100回試行して多額の費用がかかったかもしれません。MyAGには、内蔵のストップウォッチと財布が含まれています。

彼らは主に2つの要素を測定します:

  • LLMコスト (CLC_L): 「脳」がいくらかかるか。これは、AIが読み書きする単語数(トークン)に基づいて計算されます。入力トークンと出力トークンの重みを設定する数式を使用しており、ユーザーは使用するAIモデルの価格に応じて設定を変更できます。
  • 環境コスト (CEC_E): 「手」がいくらかかるか。これは、ウェブページがロードされるのを待ったり、ページをスクロールしたりするなど、現実世界で行われる動作にかかる時間を測定します。

これらのコストを追跡することで、研究者はパフォーマンスと効率性のトレードオフを見ることができます。例えば、単純な「グリーディ(強欲)」戦略(思いついたことをそのまま実行する)は、代替案を検討するために時間を無駄にしないため、最も速く、最も安価であることがわかりました。一方で、「ロールバック」戦略(失敗したときに戻ってやり直すことを許可する)は、多少の時間とトークンコストはかかりますが、多くの場合、より良い結果をもたらします。「Best-of-N」戦略(多くの経路を同時に試し、その中から最良のものを選ぶ)は、非常に正確ですが、非常に低速で高コストになります。

実験が示したこと

チームは、GAIAベンチマークを用いた複雑な質問への回答と、Mind2Web-Liveを用いたウェブナビゲーションという、2つの実世界のタスクでMyAGをテストしました。さまざまな戦略を用いて、それらがどのように競い合うかを検証しました。

  • スピード vs 知能: グリーディ戦略は、代替案をチェックするために時間を浪費しないため、最も効率的であり、最も少ない時間とコンピュータ・トークンを消費しました。
  • 二度目のチャンスの力: ロールバック戦略は、十分な時間があれば、全体として最も優れたパフォーマンスを発揮しました。エージェントが間違いを認め、やり直すことを可能にしたため、時間とトークンのコストは多少増えたものの、精度の向上につながりました。
  • 複雑さの代償: Best-FirstBest-of-Nのような戦略は、パフォーマンスを向上させる可能性がありますが、重い代償を伴います。これらは、より多くのコンピュータ・パワーと時間を必要とします。論文では、これらの複雑な手法の成功は、どの経路が最適かを判断するための優れた「判定役(judge)」を持っているかどうかに大きく依存すると指摘されています。

彼らはまた、時間がどこに使われたかを詳細に分析しました。ウェブナビゲーションにおいては、「スクロール」は驚くほど安価で高速でしたが、「待機(ページロード待ち)」は最も高価なアクションであり、発生頻度は低いものの、時間の大部分を占めていることがわかりました。このような詳細な分析は、開発者がエージェントのどこを最適化すべきかを正確に知る助けとなります。

結論

MyAGは、すべてのAI問題を解決する魔法の杖ではありません。著者らは、これが商用アプリを構築するための完成された製品ではなく、研究用のツールとして設計されていることを明確にしています。セキュリティや分散ネットワークなどはまだ扱っていません。しかし、彼らは「誰が」、「どのように」、「もし〜だったら」を分離することが、AIエージェントの設計、テスト、理解をいかに容易にするかを証明することに成功しました。研究者にエージェントを可視化し、測定するための明確な方法を提供することで、MyAGは、よりスマートで、速く、コスト効率の高いデジタルアシスタントをどのように構築すべきかを解明する手助けとなります。この論文は、このアプローチが、AIエージェント・システムをより透明で管理しやすいものにするための確かな一歩であることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →