← 最新の論文
🤖 AI

AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models

本論文は、急速に変化するAIの展望における静的なベンチマークの限界に対処するため、自動化されたパイプラインを利用して新しい政府規制を継続的に統合し、多言語の攻撃プロンプトを生成する、基盤モデルのための自己進化型安全性ベンチマークであるAIR-BENCH Liveを紹介するものである。

原著者: Rohan Naphade, Minzhou Pan, Bo Li

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Rohan Naphade, Minzhou Pan, Bo Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界を、ロボットたちが物語を書いたり、問題を解決したり、さらには私たちとチャットしたりすることを学んでいる、巨大で絶えず拡大し続ける図書館だと想像してみてください。しかし、どんな図書館にも、書ける内容にはルールがあります。爆弾の作り方、ヘイトスピーチ、そして秘密を盗むためのトリックなどは禁止されています。科学者たちは、これらのロボットがルールに従っているかどうかを確認するために、「安全性テスト」を作成します。これらのテストは、ロボットにルールを破らせようとする一連の「謎解き」や「罠」のようなものだと考えてください。もしロボットがその仕掛けを拒否すれば高得点となり、もし仕掛けに嵌まってしまえば低得点となります。問題は、世界の変化が非常に速いことです。新しい法律が制定され、ロボットを騙す新しい方法が発明され、古い謎解きは解くのが簡単になりすぎてしまいます。去年の安全性テストは、ロボットが古い仕掛けを無視することを学習してしまったか、あるいは新しい法律によってテストが想定すらしていなかったものが禁止されたために、今日では役に立たなくなっているかもしれません。だからこそ、研究者たちは、動き続ける世界において常に妥当性を保てるよう、これらのテストを「ライブ」にし、自己更新させる方法を常に模索しているのです。

この論文は、AIR-BENCH Liveと呼ばれる、自己更新型の新しい安全性テストを紹介しています。これは、単に禁止リストを持って入り口に立っているだけの警備員ではなく、代わりにニュースを常にスキャンし、世界中の新しい法律を読み、AIをテストするための新しい巧妙な謎解きを即座に作成するロボットのアシスタントを持つ警備員のようなものです。研究者たちは、アメリカ、中国、EUなどの政府の規制を自動的に「スクレイピング(読み取り)」するパイプラインを構築しました。例えば、「ロボットの脳を盗むこと」や「選挙を混乱させるための偽動画を使うこと」に対する新しい法律を見つけると、それを安全性チェックリストの新しいカテゴリーとして追加します。次に、AIエージェントのチームが協力して、これらの新しいルールに基づいた、現実的で多言語によるプロンプト(謎解き)を作成します。彼らは、謎解きがスクリプトを読んでいるロボットからではなく、さまざまな状況にいる実在の人々から来ているように見せるために、「ペルソナ」、つまり「役柄」を使用します。

チームは、この進化するベンチマークを用いて14種類の異なるAIモデルをテストしました。その結果、安全性に大きな格差があることが分かりました。あるモデルは非常に安全で、ほぼすべての仕掛けを拒否しましたが(スコア1.00)、他のモデルはかなり騙しやすいものでした(スコアは0.17まで低下)。興味深いことに、新しく近代化されたプロンプトは古いものよりも難易度が高く、最も従順なモデルでさえも、少しミスを誘発することが分かりました。また、研究者たちは、英語以外の言語で尋ねられた場合、ほとんどのモデルの安全性がわずかに低下することを発見しました。これは、あらゆる人間の言語においてロボットを礼儀正しく安全に保つことが、依然として進行中の課題であることを示唆しています。論文は、世界が変わることを止めることはできないものの、世界と共に進化する安全性テストを構築できることを結論付けています。これにより、AIが賢くなるにつれて、その安全性をテストする私たちの能力も同様に賢くなっていくことを保証できるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →