← 最新の論文
💬 NLP

RAS: Measuring LLM Safety Through Refusal Alignment

本論文は、内部の隠れ状態が学習された拒絶方向とどの程度一致しているかを分析することでLLMの安全性(セーフティ)を測定する、高速かつ堅牢なホワイトボックス評価指標である**RAS(Refusal Alignment Score)**を導入しており、従来の出力ベースのジャッジ評価に代わる、より効率的で安定した選択肢を提供する。

原著者: Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu, Wei-Bin Lee

公開日 2026-06-25
📖 1 分で読めます☕ さくっと読める

原著者: Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu, Wei-Bin Lee

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

建物の警備員を雇う場面を想像してみてください。伝統的に、その警備員が優秀かどうかをテストするには、わざとトラブルメーカー(ハッカー)を送り込み、そこで何が起こるかを観察します。もし警備員が彼らを中に入れてしまったら、不合格です。もし彼らを阻止できたら、合格です。

これが、現在AIの安全性をテストする方法です。つまり、AIに危険な質問を投げかけ、それに回答するかどうかを見るのです。しかし、この論文の著者たちは、この手法には3つの大きな問題があると指摘しています。

  1. 遅くてコストがかかる: AIが長い回答を書き終えるのを待ち、その後、人間や別のAIを雇って、それが「悪い」ものかどうかを判断させる必要があります。
  2. 脆弱である: 質問の言い回しを少し変えたり、AIが少しおしゃべりになったりするだけで、AIの安全性自体は変わっていないにもかかわらず、テスト結果が変わってしまう可能性があります。
  3. 手遅れである: AIが悪質な回答を書き終えたときには、すでに被害は出ています。AIが発言した「後」になって初めて、失敗したことがわかるのです。

新しいアイデア: 「思考」を聞くこと

著者たちは、SafeVecと呼ばれる新しいAIテスト手法を提案しています。これは、AIが言葉を発する「前」に、その「脳」(内部の数学的状態)を見ることで安全性を測定するものです。

AIの内部状態をコンパスだと考えてみてください。

  • 安全なAIが危険な要求(例:「爆弾の作り方を教えて」)を受けたとき、その内部コンパスは即座に**「NO」**の方角へと回転します。
  • 壊れた、あるいは「検閲されていない」AIが同じ要求を受けたとき、そのコンパスは**「YES」**の方角へ回転するか、あるいはあてもなくフラフラと揺れ動きます。

この論文では、**RAS(拒絶アライメント・スコア)**というツールを紹介しています。その仕組みは以下のステップで行われます。

1. 「NO」の方向を見つける

まず、研究者たちは既知の安全なAI(「参照モデル」)を用意します。そのAIに対して、安全な質問と危険な質問の両方を投げかけます。そして、その際の内部コンパスの差を測定します。この差が、AIの脳内における**「拒絶」を表す特定の方向を作り出します。これを「No-Vector(拒絶ベクトル)」**と呼びましょう。

2. ターゲットとなるAIをテストする

次に、テストしたい新しいAIを用意します。そのAIに対して、同じ危険な質問を投げかけます。ただし、AIが話し始めるのを待つのではなく、その内部コンパスの状態を観察します。

  • コンパスが「No-Vector」を強く指しているか? もしそうなら、そのAIは安全です。
  • コンパスがそこから離れているか? もしそうなら、そのAIは安全ではない可能性が高いです。

3. スコア(RAS)

このコンパスの読み取り値を、0から100のスコアに変換します。

  • 100は、AIの内部的な思考が、悪い要求に対して「NO」と言うことに完璧に一致していることを意味します。
  • 0は、AIの内部的な思考が完全に不一致であり、「YES」と言う準備ができていることを意味します。

なぜこれが優れているのか?

この論文は、この手法がゲームチェンジャーである理由として3つの点を挙げています。

  • 鏡ではなく、X線である: 従来のテストは「出力(鏡)」だけを見ます。この手法は「内部の思考(X線)」を見ます。AIが口を開く前に、安全性の問題を捉えることができるのです。
  • 極めて高速である: コンピュータは、AIがパラグラフを書き終えるのを待ち、その後、判定員を雇ってそれを読ませる必要がありません。そのため、このテストは数百倍速いのです。彼らのテストでは、従来の方法よりも約216倍高速でした。
  • 信頼性が高い: 彼らはこの手法を3つの異なるAIファミリー(Llama、Gemma、Qwen)でテストしました。スコアは、AIの実際の挙動と一貫して一致していました。RASスコアが高ければ、AIが悪質な回答を与えることは稀でした。スコアが低ければ、安全テストに失敗することがよくありました。

限界(制約事項)

この論文は、このツールにできないことについても正直に述べています。

  • 「鍵」が必要である: 内部のコンパスを見るには、AIのコードへの「ホワイトボックス」アクセスが必要です。ウェブサイト上のチャットボットのように、内部の数学的計算が見えないクローズドなシステムには使用できません。
  • 「地図」が必要である: 「No-Vector」は、AIのファミリーごとに固有のものです。Llama AIの安全コンパスを使って、Qwen AIを直接テストすることはできません。各特定のタイプに合わせてツールを較正する必要があります。
  • シグナルであって、保証ではない: スコアが高いということは、AIが「拒絶すること」を考えていることを意味しますが、あらゆる状況において、必ずしも毎回拒絶することを保証するものではありません。

まとめ

要約すると、著者たちはAIの安全性のスピードメーターを作り上げました。車が衝突する(悪い出力が出る)のを待つのではなく、ドライバーが制御を失いかけているかどうかを予測するために、エンジンの振動(内部の思考)を測定するのです。これはより速く、より安価であり、AIが危険な要求に対して「NO」と言うように訓練されているかどうかを、0〜100の明確なスコアで示してくれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →