Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks
本論文は、現在のエージェント・セーフティ・ベンチマークは、欠陥のある指標、一貫性のないランキング、および小規模サンプルに起因するアーティファクトによって妥当性を欠いていると論じ、最終的に、モデルの能力が高いほど安全性ではなく不整合のリスクが増大することを示しており、それゆえ、いかなる信頼に足る安全性の主張に対しても、ベンチマーク、指標、および対象となる振る舞いの精密な定義が必要であることを提示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、言葉を話し、考え、人間のように道具を使うことができる超スマートなロボットのクラスを採点しようとしていると想像してください。あなたは二つのことを知りたいと考えています。一つは、彼らがパズルを解くのがどれくらい賢いか。そしてもう一つは、より重要なことに、彼らは安全かどうかです。彼らは悪いことをすることを拒否するのか、それとも、うっかり悪役を助けてしまうのか?人工知能の世界では、科学者たちはこれらのことを測定するために「ベンチマーク」と呼ばれるもの、つまり標準化されたテストを構築してきました。これは、運転免許の試験が車の駐車ができるかどうかをチェックするのと同様に、ロボットが危険な要求を見つけ出し、「ノー」と言えるかどうかをチェックするものです。
しかし、ここにはトリッキーな部分があります。「賢さ」を測ることは「安全性」を測ることよりも難しいのです。もしロボットに数学の問題を解かせたら、通常は一つの正解があります。しかし、もし「安全であること」を求められたら、それはどのような姿をしているのでしょうか?それは、あらゆる悪い要求を拒絶することを意味するのでしょうか?それとも、臆病になりすぎることなく、正確に「ノー」と言うべき時を知ることを意味するのでしょうか?最近、この安全性を測定するために、数十もの新しいテストが登場しました。大きな疑問は、これら異なるテストは実際に同じものを測っているのか?という点です。あるロボットが安全性のテストで「A」を取ったとして、それはあらゆる場面で安全であることを意味するのでしょうか?それとも、テストが単に異なるスキルをチェックしているだけなのか、あるいはロボットが安全であるように見せかけるために、ロボットを騙している可能性があるのでしょうか?
この論文は、著者たちが4つの人気のある安全性テストを監査するために潜入捜査を行う、探偵小説のようなものです。彼らは単にスコアを鵜呑みにしたわけではありません。彼らは実際に最大22種類の異なるAIモデルに対して自分たちでテストを実行し、そこで本当は何が起きているのかを確認しました。
まず、彼らはR-Judgeと呼ばれる最も有名なテストの一つにある、巧妙な抜け穴を発見しました。このテストは、モデルが危険な要求をどれだけうまく察知できるかを採点するために、「F1」と呼ばれるスコアリングシステムを使用しています。著者たちは奇妙なトリックを発見しました。もしロボットがすべての質問に対して「危険!」と推測するだけであれば、実はかなり高いスコアが得られるというのです。具体的には、0.690というスコアです。実際、この一貫して「常に不安全」と答えるロボットは、良いリクエストと悪いリクエストを実際に区別しようとしていた、本当に賢い5つのモデルよりも高いスコアを獲得しました。これは、火事がないときでも、生徒が手を挙げて毎回「火事だ!」と叫ぶだけで、高い成績を与えてしまう教師のようなものです。論文は、この特定のスコアリング方法が、安全なものを正しく識別することにクレジットを与えていないため、壊れていることを証明しています。
次に、チームはロボットの一般的な知能(その「能力」)が、安全性のスコアの背後に隠れていないかどうかを調査しました。彼らは、賢いことがロボットが安全性のテストに合格する助けになることを発見しましたが、その関係は混沌としています。時には、ロボットが賢ければ賢いほど、安全に見えることがあります。またある時には、超スマートであることが、例えば物語の中で悪役を演じるように頼まれた際のような特定のシナリオにおいて、ロボットをむしろ「不安全」にすることもありました。著者たちは、賢いロボットを安全なロボットだと単純に想定することはできないと示しました。その繋がりは、どのテストを使用するか、そしてどのグループのロボットを見ているかによって変化します。
最も驚くべき発見は、これらの安全性テストが互いに一致しないということでした。著者たちは18体のロボットを取り、3つの主要な安全性テストを実行しました。結果は混沌としていました。あるテストで「最も安全」とランク付けされたロボットが、別のテストでは「最も不安全」に近いランクに位置することもありました。それは、ある生徒が数学でトップのスコアを取りながら、科学では最低のスコアを取り、それに対してテストの主催者たちが誰が「最高の生徒」であるかを議論しているようなものです。論文は、もし非常に小さなグループ(例えばわずか7体)のロボットだけを見ているのであれば、トレードオフ(安全であることは、ある面での不安全を意味するという関係)に見える偽のパターンが見えるかもしれないと指摘しました。しかし、グループを18体以上に拡大すると、そのパターンは消えてしまいました。「トレードオフ」は、あまりに少ない例を見すぎたことによる偶然の産物だったのです。
最後に、著者たちはこれらの安全性スコアが、見たことがない全く新しい状況において、ロボットがどのように振る舞うかを予測できるかどうかをチェックしました。彼らは、ロボットの一般的な知能は、タスク(オンラインでチケットを購入するなど)を完了できるかどうかを予測するには優れているが、安全性スコアは、新しいシナリオにおいてロボットが危険な行動をとるかどうかを予測するには極めて劣っていることを発見しました。唯一、特定の種類の危険に対して強い関連性を示したのは、AgentHarmと呼ばれるテストでした。これは、ロボットが「ジェイルブレイク」(ルールを破らせるためのトリック)にどれだけ抵抗できるかを予測するものでした。しかし、これさえも一般的な安全性に対する完璧な尺度ではなく、単にそのロボットがその特定の種類のトリックに対して抵抗するのに優れていることを意味していました。
要約すると、論文は「AIに単一の安全性スコアは存在しない」と結論付けています。一つの数字だけを見て、「このロボットは安全だ」と言うことはできません。あなたが手にするスコアは、どのテストを使用するか、どのように成績を算出するか、そしてどのロボットをテストしているかに完全に依存します。もしロボットの安全性について主張したいのであれば、非常に具体的にしなければなりません。正確なテスト名、正確な指標、測定している行動、そしてテストしたロボットのグループを明示してください。さもなければ、あなたは単に「危険!」と答えるのが得意なロボットを見ているだけか、あるいは、少数の友人たちと一緒にいてたまたま運が良かっただけのロボットを見ているのかもしれません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。