← 最新の論文
🤖 AI

The 2025 AI Agent Index: Documenting Technical and Safety Features of Deployed Agentic AI Systems

本論文は、急速に進化するエコシステムの追跡という課題に対処するため、30種類の最先端AIエージェントの起源、能力、および安全性に関する機能を記録した包括的なリソースである「2025年AIエージェント・インデックス」を紹介するとともに、安全性や社会的影響に関する開発者の透明性の著しい欠如を明らかにするものである。

原著者: Leon Staufer, Kevin Feng, Kevin Wei, Luke Bailey, Yawen Duan, Mick Yang, A. Pinar Ozisik, Stephen Casper, Noam Kolt

公開日 2026-06-30
📖 1 分で読めます☕ さくっと読める

原著者: Leon Staufer, Kevin Feng, Kevin Wei, Luke Bailey, Yawen Duan, Mick Yang, A. Pinar Ozisik, Stephen Casper, Noam Kolt

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界を、活気にあふれ、混沌とした建設現場として想像してみてください。長年、私たちは作業員(AIモデル)が設計図の読み方やセメントの混ぜ方を学ぶ様子を見守ってきました。しかし最近、新しいものが到着しました。それが**「AIエージェント」です。これらを単なる作業員ではなく、自ら道具を手に取り、ドアを開け、人間の助けをほとんど借りずに自律的に物事を構築し始めることができる「現場監督」**だと考えてください。

問題は?建設現場はあまりにも急速に拡大しており、現場監督たちも非常に秘密主義であるため、誰が何を構築しているのか、どれほど安全なのか、あるいはルールに従っているのかが、実際には誰にも分かっていないのです。

この論文**「2025年 AIエージェント・インデックス(The 2025 AI Agent Index)」**は、研究チームがヘルメットを被り、現場を歩き回って詳細な棚卸しを行った記録のようなものです。彼らは単に現場監督の数を数えただけではありません。彼らの道具箱の中を覗き込み、安全マニュアルを読もうと試みたのです。

以下に、その内容を分かりやすく説明します。

1. 「誰が誰なのか」リスト

研究者たちは、現在使用されている中で最も人気があり強力な30種類のAIエージェントを調査しました。彼らは単に質問に答えるだけのチャットボットを見たのではなく、航空券を予約したり、コードを書いたり、ビジネスのワークフローを管理したり、あるいは商品を購入するためにウェブサイトを閲覧したりといった、実際に「実行」できるシステムを調査しました。

彼らはこれら30のエージェントを、主に3つの「近隣地域」に分類しました。

  • チャット・ネイバーフッド(チャットの街)(12種類): これらはチャットウィンドウを通じて会話ができる便利なアシスタントですが、他のアプリやツールを開くための特別な鍵を持っています。
  • ブラウザ・ネイバーフッド(ブラウザの街)(5種類): これらはウェブブラウザの中に住むデジタル従業員のようなものです。人間と同じようにボタンをクリックし、フォームに入力し、まるで人間が操作しているかのようにウェブサイトをナビゲートします。多くの場合、あなたが一挙手一投足を監視していなくても実行されます。
  • エンタープライズ・ネイバーフッド(企業の街)(13種類): これらは大企業向けの「現場監督ビルド」です。企業が人事、営業、またはITサポートなどのタスクを自動的に処理するためのデジタルワーカーのチームをセットアップできるプラットフォームです。

2. 「ブラックボックス」問題(透明性)

この論文における最大の驚きは、情報の欠落がいかに多いかという点です。例えば、車を購入したのに、メーカーが以下の情報を教えることを拒否した状況を想像してみてください。

  • ブレーキがどのように機能するか。
  • その車が衝突テストを受けたかどうか。
  • エンジンがオーバーヒートした場合に何が起きるか。
  • 車が衝突した場合、誰が責任を負うのか。

これこそが、研究者がこれらのAIエージェントに見出した現実です。

  • 安全性の秘密: 研究者が投げかけた安全に関する質問(例:「ハッキング対策のテストを行いましたか?」など)に対し、約**56%**の回答が「分からない」または「公開されている情報は見当たらない」でした。
  • 「セーフティ・ウォッシング(安全性の粉飾)」現象: 一部の企業はマーケティングにおいて「安全である」と熱心に語っていますが、いざ研究者が実際のテスト結果や安全報告書を探そうとしても、棚は空っぽでした。これは、自らを「街で一番健康的なレストラン」と称しながら、衛生検査のスコアを見せることを拒むレストランのようなものです。
  • アイデンティティの危機: これらのエージェントのほとんどは、自分がロボットであることを人間に伝えていません。ブラウザエージェントがウェブサイトを閲覧している際、ウェブサイト側はそれを人間ユーザーだと思い込んでしまいます。ごくわずかなものだけが、「こんにちは、私はAIです」と示す「デジタルIDカード」を持っています。

3. 「三つの頭を持つ怪物」(誰が何をコントロールしているのか?)

この論文は、これらのエージェントがサンドイッチのように層(レイヤー)になって構築されていることを説明しています。そして、それが誰が主導権を握っているのかを分からなくさせているのです。

  • パン(基盤モデル): これは「脳」にあたります(GPT、Claude、Geminiなど)。これを作るのはごく一部の大企業だけです。
  • 具材(エージェント・ビルダー): これは中間層であり、脳に対して何をすべきかを指示するものです(Microsoft Copilot StudioやZapierなど)。
  • 上のパン(ユーザー/企業): これは、実際にエージェントを使用している個人または企業です。

研究者は、これらの層が異なる会社によって作られているため、誰も全体像を把握できていないことを発見しました。脳の製作者はビルダーが何をしているかを知らず、ビルダーはユーザーがどのように展開しているかを正確には知りません。これが、何か問題が発生した際の「責任の押し付け合い」を生む原因となります。

4. ウェブ上の「ワイルド・ウエスト(無法地帯)」

論文は、大きな緊張関係を浮き彫りにしています。それは、ブラウザエージェントがインターネットのルールを破りつつあるということです。
数十年にわたり、ウェブサイトにはプログラム(クローラー)に対して「立ち入り禁止」を伝えるための robots.txt という看板がありました。

  • 従来の方法: ウェブサイトが「クロール禁止」と言えば、礼儀正しいロボットは停止します。
  • エージェントによる方法: これらの新しいエージェントの多くは、人間のように振る舞うように設計されています。彼らはしばしば「立ち入り禁止」のサインを無視し、セキュリティチェックを回避し、物事を遂行するために人間になりすまします。
  • 結果: これにより法的紛争が起きています。AmazonやPerplexityのような企業同士で、AIエージェントが許可なくサイトを閲覧したり買い物を行ったりする権利があるのかどうかを巡って訴訟が起きています。

5. 「ビッグ・スリー」への依存

これら30種類のエージェントのほぼすべてが、わずか**3つの「脳の家系」**に依存しています。それはOpenAIのGPT、AnthropicのClaude、そしてGoogleのGeminiです。

  • 比喩: 30の異なる自動車ブランドがあるものの、それらすべてが全く同じ3社のエンジンを使用している状況を想像してください。もしそのエンジンメーカーの1社に問題が生じたり、生産が止まったり、価格を変更したりすれば、30のブランドすべてが窮地に立たされます。これは、極端な集中による大きなリスクを生み出します。

結論

「2025年 AIエージェント・インデックス」は、現在暗闇の中で運営されている、急速に成長するテクノロジーの断片を捉えたものです。

研究者たちは、これらのエージェントが「悪い」と言っているわけではありません。しかし、私たちは目隠しをした状態で飛行しているのだと警告しています。私たちは、私たちの代わりに動く強力なツールを手に入れましたが、それらに対する明確なルール、安全報告書、あるいは身元確認の仕組みを持っていません。論文は、もし私たちがこれらのエージェントを安全で信頼できるものにしたいのであれば、「現場監督」たちは自らの仕事のプロセスを公開する必要があり、「建設現場」にはより優れた標識が必要であると示唆しています。

要約すると: 私たちは自律的なロボットの艦隊を構築しましたが、そのほとんどはナンバープレートも持たず、安全検査も受けておらず、自分がロボットであることを誰にも告げずに走行しているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →