← 最新の論文
🤖 AI

What AI Red-Team Evaluations Can and Cannot Prove

本論文は、AIのレッドチーム評価における計算可能な「証拠的上限(evidential ceiling)」を確立しており、現在のベンチマークが高頻度で発生する危害に対しては安全性を効果的に証明できる一方で、統計的な固有の限界により、稀に発生する破滅的なリスクの安全性を証明するには根本的に不十分であることを示している。

原著者: Bandana Kaur

公開日 2026-07-27
📖 1 分で読めます☕ さくっと読める

原著者: Bandana Kaur

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ある謎を解こうとしている探偵だと想像してください。その謎とは、「この新しいロボットは、現実世界に放ปล่อยしても安全か?」というものです。これを知るために、あなたは単にロボットに「私は善良です」と言わせるのではなく、ロボットに意地悪なことや危険なことを言わせようと仕掛けるレッドチーミングのような、一連の巧妙なテストを行います。これがAI安全性評価の世界です。しかし、ここで問題が発生します。ロボットが安全であると確信するためには、どれだけの「仕掛け」を試す必要があるのでしょうか?もし10回の仕掛けに対して合格したとしても、それで十分でしょうか?もしロボットが100万回に1回の割合で危険な挙動を見せるとしたらどうでしょう?

ここに統計学が登場します。それは、暗い部屋の中を照らす懐中電灯のようなものです。小さな懐中電灯(小さなテスト)なら、床にある大きな目立つ岩(頻繁に起こる間違い)を簡単に見つけることができます。しかし、もしその危険が、たまにしか現れない、目に見えないほど微細な塵のようなものだとしたら、同じ小さな懐中電灯では、たとえそこに塵があったとしても完全に見逃してしまうかもしれません。科学者たちは長い間、これらのAI「安全性テスト」が本当に有用なのか、それとも単なる時間の無駄なのかについて議論してきました。ある者は、これらは何も証明していないと言う一方で、ある者は、これらはすべてを証明していると言います。この論文は、非常に具体的な方法を用いることで、その議論に決着をつけようとしています。それは、異なるサイズの「塵」を見るために、懐中電景がどれほど明るくある必要があるかを正確に計算することです。

APIsec Research LabsのBandana Kaur氏によって書かれたこの論文は、安全性テストは役に立たないわけではないが、魔法の杖でもない、と主張しています。テストには明確な限界があり、その限界は意見の問題ではなく、数学の問題なのです。著者は「エビデンデンシャル・シーリング(証拠の天井)」という概念を用いています。例えば、一度に一定量しか水を保持できないバケツを想像してください。もし、漏水が「小さい」ことを証明しようとしているなら、失敗がゼロであるクリーンなテスト(満水のバケツ)は非常に説得力があります。しかし、もし漏水が「極めて微小」であること(非常に稀な壊滅的失敗など)を証明しようとしているなら、その同じバケツでは、確信を持つための十分な証拠を捕まえるには小さすぎるかもしれません。

この論文の主な発見は、計算可能な「交差点(crossing point)」が存在するということです。もしある種の危害が十分に頻繁に発生する場合(例えば1%の割合で発生する場合)、約520個のプロンプトによる標準的なテストを行えば、「よし、このモデルはデプロイするのに十分安全である可能性が高い」と言うことができます。実際、520回のテストを実行して問題がゼロであった場合、それは単に1つの問題が見つかった場合よりも強い証拠となります。それは、清潔な部屋を見つけるようなものです。もし菌がいたるところにいると予想されている状況において、清潔な部屋であることは大きな驚きであり、何かが機能していることを証明します。

しかし、論文は稀な事象に対しては明確な一線を画しています。もし有害な挙動が極めて稀(例えば0.001%未満の確率)である場合、どれほど多くのプロンプトを試したとしても、「クリーンな結果(失敗ゼロ)」はほとんど何も教えてくれません。数学によれば、こうした稀で壊滅的なリスクに対しては、クリーンなテスト結果は弱い証拠となります。この領域では、たった一つの観測された失敗の方が、クリーンなテストよりも情報量が多いのです。なぜなら、クリーンなテストは単なる運が良かっただけかもしれないからです。論文は、こうした稀な事象に対して、現在の公開ベンチマークは「桁違いに不足している」、つまり、安全性を証明するには数千倍も規模が小さすぎるのだと計算しています。

また、著者はこれらのテストがどのように構築されているかも重要であると指摘しています。もしテストの質問がすべて非常に似通っている場合(例えば、同じ質問を少し言葉を変えて聞くような場合)、それは干し草の山の中から針を探しているのに、部屋の片隅しかチェックしていないようなものです。論文は、現在のテストはしばしば密集しており、見た目ほど効果的ではない可能性があると示唆しています。さらに、論文は単にテストを「増やす」ことが解決策であるという考えに異を唱えています。そうではなく、安全なモデルと不安全なモデルをより良く区別できる、よりスマートなテストが必要です。もし、あるテストが悪質なモデルを90%の確率で欺ける一方で、善良なモデルを10%しか欺けないのであれば、それは強力なツールとなります。しかし、もし両方を等しく欺いてしまうのであれば、それを何度実行したとしても、それは役に立ちません。

最後に、論文はAIラボが結果を報告する方法についての新しいルールを提案しています。単に「500回のテストを実行し、悪い結果は見つかりませんでした」と言うのではなく、自分たちのテストが「何を証明できるのか」を正確に報告すべきである、と。もし危害率が高いのであれば、安全性を主張できます。しかし、もし危害率が低く稀なものであるなら、自分たちのテストでは安全性を証明できなかったことを認め、他の種類の証拠が必要であることを認めるべきです。この論文は、テストをやめるべきだと言っているのではありません。テストが数学的に証明できないことを、あたかも証明できるかのように振る舞うのをやめるべきだと言っているのです。これは誠実さへの呼びかけです。自分の懐中電灯の限界を知り、部屋の隅しか照らしていないのに、部屋全体が見えると主張してはいけません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →