← 最新の論文
🤖 AI

Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-CodeX

この論文は、エージェントシステムの多様な実行環境に適応するよう、リスク源・失敗モード・現実的危害の 3 次元分類を各環境にカスタマイズすることで、OpenClaw および Codex の実行軌跡に対する安全性評価と診断を可能にする拡張ベンチマーク「ATBench-Claw」と「ATBench-CodeX」を提案するものである。

原著者: Zhonghao Yang, Yu Li, Yanxu Zhu, Tianyi Zhou, Yuejin Xie, Haoyu Luo, Jing Shao, Xia Hu, Dongrui Liu

公開日 2026-04-17
📖 1 分で読めます☕ さくっと読める

原著者: Zhonghao Yang, Yu Li, Yanxu Zhu, Tianyi Zhou, Yuejin Xie, Haoyu Luo, Jing Shao, Xia Hu, Dongrui Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

🧠 核心となるアイデア:「同じテスト監督、新しい現場」

まず、この研究の背景にある**「AI エージェント」とは何かを想像してください。
これは、単にチャットで会話するだけの AI ではなく、
「実際に手を動かす AI」**です。
例えば、「メールを送る」「ファイルを削除する」「コードを書いてサーバーに上げる」といった、現実世界に影響を与える行動ができる存在です。

しかし、AI が働く「現場(環境)」はどんどん変わっています。

  • 昔: 単純なチャットボット
  • 今: ツールを使うエージェント(OpenClaw)
  • 未来: コードやサーバーを直接操作するエンジニア AI(Codex/CodeX)

【問題】
現場が変わると、AI が犯す「失敗(事故)」の種類も変わります。
「メールを送る現場」で危ないことと、「サーバーを操作する現場」で危ないことは違います。
でも、「AI の安全性を測るテスト方法(ATBench)」自体は、毎回ゼロから作り直すのは大変で、非効率です。

【この論文の解決策】
「テストの監督(システム)はそのままにして、『試験問題(リスクの定義)』だけ現場に合わせて書き換えよう!」というアイデアです。


🛠️ 2 つの新しい「試験会場」

この論文では、ATBench というテストシステムを、2 つの異なる「現場」に合わせてカスタマイズしました。

1. ATBench-Claw(「道具使い」の現場)

  • どんな現場?
    AI が「ツール」や「スキル」を使って、メッセージを送ったり、外部サービスとやり取りしたりする場所です。
  • どんなリスクがある?
    • 「誰の命令で動いているのか?」(誰が送信者か分からない)
    • 「過去の会話の記憶が汚染されている」
    • 「許可なく外部にデータを送ってしまう」
  • 例え話:
    これは**「料理人(AI)が、新しい包丁や食材(ツール)を使って料理をする現場」です。
    危険なのは、「包丁を誤って他人に投げつけてしまう」「誰が注文したか忘れる」「食材が腐っている(悪意あるツール)のに使ってしまう」ことです。
    このテストでは、
    「誰が命令したか」「許可は取ったか」「道具が安全か」**という新しいチェック項目を追加しました。

2. ATBench-CodeX(「建築家」の現場)

  • どんな現場?
    AI が「コード(プログラム)」「サーバー」「依存関係(ライブラリ)」を直接操作する場所です。OpenAI の Codex などが対象です。
  • どんなリスクがある?
    • 「サーバーを壊すコードを書いてしまう」
    • 「ウイルス入りのライブラリをインストールしてしまう」
    • 「セキュリティの壁(ファイアウォール)を突破してしまう」
  • 例え話:
    これは**「建築家(AI)が、ビルの設計図や配管(コード)を直接いじる現場」です。
    危険なのは、「配管を間違えて水浸しにする」「危険な資材(悪意のある依存関係)を組み込む」「許可なく建物を壊す」ことです。
    このテストでは、
    「コードの安全性」「サーバーへの影響」「許可された範囲内か」**という、より専門的なチェック項目を追加しました。

📊 なぜこれがすごいのか?(3 次元の「安全マップ」)

この研究のすごいところは、**「3 次元の安全マップ(分類表)」**を使っている点です。

  1. リスクの源(どこから来た?):ユーザーの指示?ツール?内部のバグ?
  2. 失敗の形(どう失敗した?):悪意のある実行?許可の無視?
  3. 現実への被害(何が悪かった?):金銭的損失?プライバシー漏洩?物理的被害?

この「3 次元マップ」の骨格(システム)はそのままに、**「現場ごとの色付け(カスタマイズ)」**をするだけで、どんな新しい AI 現場でもテストできるようになりました。

  • Claw 版:新しい「色(リスク項目)」をたくさん足しました。
  • CodeX 版:既存の「色」を、コード現場に合うように「濃く(強調)」しました。

🏆 実験結果:誰が一番上手?

実際に、この新しいテストで AI を試してみました。

  • 結果:
    • 従来の「ガードレール AI(安全チェック専門の AI)」は、新しい現場(特に CodeX)だと、少し苦戦しました。
    • しかし、「AgentDoG(この研究チームが作ったシステム)」は、どちらの現場でも最高レベルの成績を叩き出しました。
    • 特に、複雑な「許可の無視」や「隠れた危険」を見つけ出す能力が圧倒的でした。

💡 まとめ:この論文が伝えたいこと

「AI の現場は毎日進化しています。だから、安全性を測るテストも**『その都度、ゼロから作り直す』のではなく、『現場に合わせて柔軟にアップデートできる仕組み』**が必要です。」

この論文は、**「ATBench という万能なテスト監督システム」を使って、「道具使いの現場(Claw)」「建築家の現場(CodeX)」**の両方で、AI が安全に働けるかどうかを正しく診断できることを証明しました。

一言で言うと:

「AI の『運転免許試験』を、『軽自動車の道』でも『大型トラックの道』でも、同じ試験監督で、現場に合わせた問題を出すだけで、正確に判定できる仕組みを作りました!」

これにより、AI がどんな新しい世界に進んでも、安全にチェックし続けることができるようになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →