How Should AI Safety Benchmarks Benchmark Safety?
本論文は、210件のAI安全性ベンチマークをレビューしてその技術的および認識論的な欠陥を特定し、より妥当で堅牢かつ責任ある安全性評価フレームワークを開発するために、確立されたリスク管理および測定理論に基づいたロードマップを提案するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、新しい世代の超スマートなロボットを採点しようとしている教師だと想像してください。あなたは、それらのロボットが世界に放たれても安全か、あるいは誤って(あるいは意図的に)トラブルを引き起こさないかを確かめたいと考えています。そのため、あなたは彼らに、AIの運転免許試験のような一連のテストを与えます。コンピュータサイエンスの世界では、これらのテストは「ベンチマーク」と呼ばれます。ベンチマークとは、標準化された障害物競走のようなものだと考えてください。もしロボットがハードルを飛び越え、パズルを解き、罠を回避できれば、私たちはそのロボットが現実世界へ出る準備ができていると見なします。しかし、ここに落とし穴があります。ロボットが、あなたが作った特定のハードルを飛び越えるのが得意だからといって、あなたがコースに置いていないバナナの皮で転んだり、退屈したからといって火をつけ始めたりしないとは限らないのです。この論文は、AIの安全性をテストすることの、複雑で混沌とした世界を掘り下げ、現在の私たちの「障害物競走」がいかに単純すぎて、硬直しており、時には何が本当の危険であるかという本質を見失っているかを論じています。
著者たち、すなわちテクニカル・ユニバーシティ・オブ・ミュンヘンやコーネル大学などの研究者チームは、AIの安全性テストの現状を大規模に調査することに決めました。彼らは単にいくつかのテストを覗き見ただけではありません。研究者たちが作成してきた210種類もの異なる安全性ベンチマークをレビューしたのです。彼らは、これらのテストが実際に私たちを守るために機能しているのか、それとも単に偽りの安心感を与えているだけなのかを知りたかったのです。
ここで大きな問題が見つかりました。ほとんどのテストは、間違ったものを見ています。 彼らは、ベンチマークの**81%**が、すでに知っていて経験したことのあるリスク、例えば「有害な」言語や、AIにルールを破らせるための単純なトリック(「ジェイルブレイク」と呼ばれます)のみをチェックしていることを発見しました。それは、車を滑らかな直線コースだけでテストして、泥だらけの山道でもうまく走行できると想定するようなものです。テストは、AIがどのように失敗するかについての、奇妙で予測不能で全く新しい方法、つまり著者たちが「未知の未知(unknown unknowns)」と呼ぶものを完全に無視しています。
さらに、これらのテストが安全性を測定する方法は、しばしば数学的に不安定です。論文は、ベンチマークの**79%**が、安全性を単純な「合格か不合格か」のスイッチとして扱っていることを指摘しています。彼らはAIが不適切な要求を拒否した回数をカウントし、それを「安全性スコア」と呼びます。しかし、著者たちはこれは誤解を招くものだと主張しています。AIがテストにおいて90%の確率で要求を拒否したとしても、それが現実世界において90%安全であるとは限りません。それは、橋が軽い微風に耐えたからといって、ハリケーンにも耐えられると判断せずに、橋が安全だと言うようなものです。テストは、AIが失敗した場合にどれほど深刻な被害が出るかという点を無視しており、また、現実の世界で人々が実際にどれほどそれらの危険な要求をするのかという点も考慮していません。
研究者たちはまた、テストと現実とのつながりがしば しば壊れていることも発見しました。彼らはこれを「プロキシ・チェーン(代理の連鎖)」と呼んでいます。例えば、ある学生が良いドライバーかどうかを知りたいとして、シミュレーターで車の駐車テストを行うとしましょう。それが「プロキシ(代理指標)」です。しかし、もしそのシミュレーターが雨や他のドライバー、あるいは学生が携帯電話に気を取られるといった状況を考慮していないのであれば、そのテスト結果は、その学生が実際に高速道路で安全に運転できるかどうかを教えてはくれません。論文は、多くのAI安全性テストがそのようなシミュレーターであると主張しています。それらは「拒否率」や「キーワードの一致」といったものを測定していますが、これらの数字は必ずしも現実世界の被害へと翻訳されるわけではありません。
では、著者たちは代わりに何をすべきだと提案しているのでしょうか? 彼らは、これら壊れたテストを修正するための10の推奨事項を含む、新しいロードマップを提案しています。
第一に、既知のことだけをテストすることをやめるべきだと彼らは言います。AIがどのように失敗するかという、新しく、奇妙で、予期せぬ方法を積極的に探し出すようなテストを構築する必要があります。彼らは、固定された質問リストに固執するのではなく、常に新しい方法でAIを壊そうとするツールを使用することを提案しています。
第二に、より優れた数学を用いる必要があります。単に「合格」か「不合格」と言うのではなく、実際の「リスク」を計算すべきです。これは、「この悪いことが起こる可能性はどのくらいか?」そして「もし起こった場合、どの程度ひどいことになるのか?」と問うことを意味します。著者たちは、原子力発電や航空分野で使用されている「確率論的リスク評価(Probabilistic Risk Assessment)」と呼ばれる手法を提案しています。彼らは、あるモデルがテストでは安全に見えても、そのモデルの利用者数や、人々がどれほど頻繁に危険な要求をするかを考慮に入れると、実際のリスクがはるかに高くなるという計算式さえ示しています。
第三に、私たちのテストが、主張している通りのものを実際に測定しているかを確認する必要があります。これは、特定の状況における「安全性」が何を意味するのかを非常に明確にし、テストがクリーンで人工的なラボではなく、現実世界を反映するようにすることを意味します。また、彼らは、AIの影響を受ける人々――例えば、ティーンエイジャー、患者、あるいは特定のコミュニティの人々――を、テストのデザインに巻き込む必要があるとも主張しています。なぜなら、彼らこそが、どのような危害が「現実的なもの」と感じられるかを最もよく知っているからです。
彼らのアイデアが機能することを証明するために、チームはメンタルヘルスに関するAIとティーンエイジャーとの会話に焦点を当てた、小さな例となるテストを構築しました。彼らは単にAIがルールを知っているかどうかを尋ねたのではありません。彼らは実際の会話をシミュレートし、実際にツールを使用するティーンエイジャーの数を踏まえて、潜在的な被害を計算しました。その結果、標準的なテストでは「安全」に見えるモデルであっても、現実世界の数値に基づくと、依然として重大な問題を引き起こす可能性があることが示されました。
結局のところ、この論文はAIが破滅に向かっているとか、テストが不可能だと言っているわけではありません。それは、現在のテスト方法が、スープの温度を測るために定規を使おうとしているようなものであり、用途に対して間違った道具であると言っているのです。AIを真に安全にするためには、安全性を単純なチェックリストとして扱うのをやめ、複雑で生きたシステムとして扱い、変化し、私たちを驚かせ、テスト管の中ではなく現実世界について考える必要があるのです。著者たちは、より厳格で、より人間中心のテスト方法を採用することで、単に賢いだけでなく、真にすべての人にとって安全なAIを構築できると示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。