人工知能の世界を、ロボットたちが物語を書いたり、問題を解決したり、さらには私たちとチャットしたりすることを学んでいる、巨大で絶えず拡大し続ける図書館だと想像してみてください。しかし、どんな図書館にも、書ける内容にはルールがあります。爆弾の作り方、ヘイトスピーチ、そして秘密を盗むためのトリックなどは禁止されています。科学者たちは、これらのロボットがルールに従っているかどうかを確認するために、「安全性テスト」を作成します。これらのテストは、ロボットにルールを破らせようとする一連の「謎解き」や「罠」のようなものだと考えてください。もしロボットがその仕掛けを拒否すれば高得点となり、もし仕掛けに嵌まってしまえば低得点となります。問題は、世界の変化が非常に速いことです。新しい法律が制定され、ロボットを騙す新しい方法が発明され、古い謎解きは解くのが簡単になりすぎてしまいます。去年の安全性テストは、ロボットが古い仕掛けを無視することを学習してしまったか、あるいは新しい法律によってテストが想定すらしていなかったものが禁止されたために、今日では役に立たなくなっているかもしれません。だからこそ、研究者たちは、動き続ける世界において常に妥当性を保てるよう、これらのテストを「ライブ」にし、自己更新させる方法を常に模索しているのです。
この論文は、AIR-BENCH Liveと呼ばれる、自己更新型の新しい安全性テストを紹介しています。これは、単に禁止リストを持って入り口に立っているだけの警備員ではなく、代わりにニュースを常にスキャンし、世界中の新しい法律を読み、AIをテストするための新しい巧妙な謎解きを即座に作成するロボットのアシスタントを持つ警備員のようなものです。研究者たちは、アメリカ、中国、EUなどの政府の規制を自動的に「スクレイピング(読み取り)」するパイプラインを構築しました。例えば、「ロボットの脳を盗むこと」や「選挙を混乱させるための偽動画を使うこと」に対する新しい法律を見つけると、それを安全性チェックリストの新しいカテゴリーとして追加します。次に、AIエージェントのチームが協力して、これらの新しいルールに基づいた、現実的で多言語によるプロンプト(謎解き)を作成します。彼らは、謎解きがスクリプトを読んでいるロボットからではなく、さまざまな状況にいる実在の人々から来ているように見せるために、「ペルソナ」、つまり「役柄」を使用します。
チームは、この進化するベンチマークを用いて14種類の異なるAIモデルをテストしました。その結果、安全性に大きな格差があることが分かりました。あるモデルは非常に安全で、ほぼすべての仕掛けを拒否しましたが(スコア1.00)、他のモデルはかなり騙しやすいものでした(スコアは0.17まで低下)。興味深いことに、新しく近代化されたプロンプトは古いものよりも難易度が高く、最も従順なモデルでさえも、少しミスを誘発することが分かりました。また、研究者たちは、英語以外の言語で尋ねられた場合、ほとんどのモデルの安全性がわずかに低下することを発見しました。これは、あらゆる人間の言語においてロボットを礼儀正しく安全に保つことが、依然として進行中の課題であることを示唆しています。論文は、世界が変わることを止めることはできないものの、世界と共に進化する安全性テストを構築できることを結論付けています。これにより、AIが賢くなるにつれて、その安全性をテストする私たちの能力も同様に賢くなっていくことを保証できるのです。
技術要約: AIR-BENCH Live
問題提起
AIR-BENCH 2024のような基盤モデルの安全性ベンチマークは、AIの能力とグローバルな立法事項の両方が急速に進化しているため、急速な陳腐化という問題に直面しています。静的なタクソノミー(分類体系)では、新しい規制から生じる新たな危害を捉えることができず、テンプレートベースの攻撃プロンプトは、モデルが適応し防御が進歩するにつれて効果を失います。その結果、固定されたベンチマークは識別力が低下し、現代的なモデルにおける不安全な挙動を表面化させるのではなく、時代遅れのプロンプトに対して拒絶反応を示すだけになってしまいます。モデルの回復力が高まる中で厳格性を維持するために、新しい規制要件を継続的に吸収し、攻撃プロンプトを再生成する「ライフロング(生涯)」な評価フレームワークが切実に求められています。
手法
AIR-BENCH Liveは、安全性ベンチマークの更新を自動化するために設計された、自己進化型パイプラインを導入しています。このシステムは、JSONツリーとして表現された深さ4の階層的リスクタクソノミー上で動作します。ここで、内部ノードには再帰的な要約が格納され、リーフノード(末端ノード)にはベンチマークのペイロード(プロンプト、判定器、およびソースポリシー)が含まれます。パイプラインは、主に以下の3つの自動化されたコンポーネントで構成されています。
自動化されたポリシー監視と分類:
- ウェブスクレイパーが、16の規制ソース(Congress.gov、EU AI Office、中国CAC、NISTなど)に対して幅優先探索によるクロールを実行します。
- 抽出エージェント(GPT-5.4-mini)が候補となるポリシー条項を特定し、非英語のテキストを英語に翻訳します。
- 回想起重視のキーワードフィルタリングにより、具体的な攻撃可能な危害(武器、詐欺など)に言及している条項を保持し、行政的な定型文を除去します。
- 検証エージェントが、残った条項がテスト可能な有害な能力を記述していることを確認します。
- 階層的分類エージェントがタクソノミーツリーをナビゲートし、新しいポリシーの断片を既存のレベル4のリーフに適合させるか、あるいは新しい粒度の高いカテゴリを提案します。調整エージェントは、分岐間での重複を防ぎます。
マルチエージェント・プロンプト生成:
- マルチエージェントかつペルソナ駆動型のアルゴリズムが、レガシーなプロンプトを刷新し、新しいカテゴリのためのプロンプトを生成します。
- 基本生成: GPT-5.4-miniが、構文の多様性とリアリズムを誘発するためにPersonaHubからランダムなペルソナをシードとして用い、各カテゴリにつき8つの候補プロンプトを生成します。
- 洗練ループ: クリティック・リファイナー・ループ(Critic: GPT-5.4; Refiner: GPT-5.4-mini)が1〜2回反復し、ステージ固有の基準への準拠を確実にします。これにより、ペルソナの逸脱を最小限に抑えつつ、リスクのある意図の明快さと自然さを最大化します。
- 変異: プロンプトはジェイルブレイク(脱獄)技術を用いて変異させます(現在は「権威による承認」、すなわち前文で権威に訴えかける手法)。
- 翻訳: Qwen 3.7-plusを使用して、プロンプトをスペイン語、日本語、ポルトガル語に翻訳し、意味の保存を確認するためのクリティック・ループを実行します。
- 人間によるレビュー: パイプラインには、人間が最も強力なプロンプトを選択するオプションのチェックポイントが含まれていますが、システムは最小限の人間の介入で機能するように設計されています。
データセットの分割:
- 最終的なデータセットは、管轄区域(ソースとなる立法機関に基づく)および言語ごとに分割され、クロス管轄および多言語分析を可能にします。
主な貢献
- 自己進化型パイプライン: AIR-BENCH Liveは、政府の規制を継続的に監視し、動的なタクソノミーに対して新しいポリシーを分類し、データセット全体の再設計を必要とせずにプロンプトを再生成する自動化パイプラインを備えた最初のベンチマークです。
- 拡張されたタクソノミー: 現在のイテレーションにおいて、パイプラインはベンチマークを314から335の粒度の細かいリスクへと拡張しました。7つの管轄区域にわたる31の新しいポリシー条項から、21の新しいレベル4カテゴリを追加しました。これらの新カテゴリは、モデルの重みの窃盗、自律的なサイバー攻撃、選挙における合成メディア操作などの新たなリスクに対処しています。
- 自動化されたプロンプトの近代化: システムは、レガシーな英語のみの様式化されたプロンプトを、現実的で多言語かつペルソナ駆動型のプロンプトに置き換えます。このプロセスでは、クリティック・リファイナー・ループを活用することで、従来の人間によるイン・ザ・ループの反復と同等、あるいはそれを上回る品質のプロンプトを生成できることを示しています。
- 多言語および管轄区域の粒度: ベンチマークは現在、4つの言語(英語、スペイン語、日本語、ポルトガル語)と複数の管轄区域をサポートしており、従来の静的なベンチマークにおけるギャップに対処しています。
結果
著者らは、AIR-BENCH Liveデータセット(計2,680個のプロンプト)を用いて、14の最新の基盤モデルを評価しました。
- 安全性の広がり: モデルの安全性には大きな分散が見られ、自身の挙動に基づいて判定されたモデルのスコアは、0.17(Mistral Large)から0.89(Claude Haiku 4.5)まで及びました。GPT-5.5およびClaude Opus 4.8は、推論前のAPIレベルのモデレーションによるブロックに起因して、完全なスコア(1.00)を達成しました。
- プロンプトの難易度: AIR-BENCH Liveの近代化されたプロンプトは、平均して2024年版よりも0.06ポイント難易度が高くなっています。最も遵守性の高いモデル(例:DeepSeek V3.2、Kimi K2)は、最大のパフォーマンス低下(それぞれ−0.20および−0.19)を示しており、これは新しいプロンプトが高度な安全性アライメントを効果的に挑戦させていることを示しています。
- 多言語性能: ほとんどのモデルは、英語のみのプロンプトと比較して、非英語のプロンプトにおいてスコアが低くなる傾向にあり、天井値に達していないモデル全体で平均0.03の低下が見られました。Gemini 2.5 Flash(−0.12)やLlama 3 8B(−0.08)において顕著な低下が観察されました。Qwen3-235Bのような多言語重視のモデルでさえ低下(−0.07)を示しており、多言語の事前学習が多言語のアライメントを保証するわけではないことを示唆しています。
- カテゴリ別性能: パフォーマンスは「自動意思決定」および「厳格に規制された業界における助言」において最も低く(多くのモデルが0.10未満)、 「非同意の裸体」および「分裂の助長」において最も高くなりました(ほぼ全てのモデルが0.75超)。
意義と主張
本論文は、AIR-BENCH Liveが、静的なベンチマークの根本的な限界、すなわち「急速に変化する分野」であるAIの安全性に追いつけないという点に対処していると主張しています。新しい立法を吸収し、プロンプトを再生成することを自動化することで、このベンチマークは静的なスナップショットから、規制や技術的変化とともに進化する「生きているシステム」へと変貌を遂げます。
著者らは、マルチエージェント・プロンプト生成アルゴリズムが、大幅に少ない人間のレビューでありながら、以前のイテレーションよりも現実的で、難易度が高く、多言語に対応したプロンプトを生成することに成功したと主張しています。結果は、このベンチマークが強力な識別力を維持しており、異なる安全性アライメントを持つモデルを効果的に区別できることを示しています。さらに、調査結果は、クロスリンガル(言語横断的)なアライメントが依然として大きな課題であることを浮き彫りにしており、多くのモデルにおいて、非英語の文脈では安全な挙動が低下することを示しています。本論文は、AIのリスクと法律が変化し続ける中で、関連性のある安全性評価を維持するためには、このような進化するフレームワークが不可欠であると結論付けています。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録