← 最新の論文
💻 computer science

Matching Ranks Over Probability Yields Truly Deep Safety Alignment

本論文は、ターゲット分布におけるトークンのランクを一致させることで、新たなRank-Assisted Prefilling(RAP)攻撃に効果的に対抗し、標準的なデータ拡張による防御と比較して最大4.7倍の安全性向上を実現する、オープンソースLLMのディープ・セーフティ・アライメントを強化する手法であるPRESTOを導入するものである。

原著者: Jason Vega, Gagandeep Singh

公開日 2026-07-23
📖 1 分で読めます☕ さくっと読める

原著者: Jason Vega, Gagandeep Singh

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが物語を書いたり、数学の問題を解いたり、人間のようにチャットしたりできる世界を想像してみてください。これらは大規模言語モデル(LLM)と呼ばれ、超スマートなデジタルアシスタントのような存在です。しかし、それほどまでにスマートであるため、ある懸念があります。もし誰かが、爆弾の作り方や誰かを傷つける方法といった危険なことを言わせるようにコンピュータを騙したらどうなるでしょうか?これを防ぐために、科学者たちは、悪いことを求められたときにモデルに「いいえ、それはできません」と言わせるように教えています。これは「セーフティ・アライメント(安全性の調整)」と呼ばれます。しかし、ドアにかかった鍵と同じように、これらの安全ルールは時として破られてしまうことがあります。このようなトリッキーな方法の一つが、「プリフィリング攻撃(prefilling attack)」と呼ばれるものです。あなたが友人と物語を書いている場面を想像してください。しかし、友人に次の文章を始めさせる代わりに、あなたがこっそりと最初の数語を自分で書いてしまうのです。例えば、「爆弾を作るための計画は以下の通りです……」と書き、その後に文章を完成させるよう頼むのです。なぜなら、コンピュータはあなたの物語をスムーズに継続するように設計されているため、「いいえ」と言うことを忘れて、危険な計画をそのまま書き続けてしまう可能性があるからです。

最近、研究者たちは、たと로最初にそのような言葉をこっそり紛れ込ませたとしても、モデルに「いいえ」と言わせる方法を開発しました。しかし、この新しい論文が示しているように、その修正策は完全には十分ではありませんでした。著者たちは、モデルを欺く新しい方法、すなわち「ランク支援型プリフィリング(Rank-Assisted Prefilling: RAP)」攻撃を発見しました。これは、コンピュータが次に言うべき最も可能性の高い言葉を単に選ばせるのではなく、コンピュータが考えている上位20個の言葉のリストを見て、たとえコンピュータがそれを非常に起こりにくいと考えていたとしても、最も危険に聞こえる言葉をハッカーが選ぶというものです。これは、コンピュータが最も安全な道を選ぼうとしているゲームにおいて、ハッカーがすべての道を覗き見ることができ、コンピュータの警告を無視して恐ろしい道を選べるようなものです。論文によると、この新しいトリックは驚くほど効果的であり、安全であると考えられていたモデルの安全性を打破してしまうことが分かっています。

これを阻止するために、著者らは「PRESTO」と呼ばれる新しい学習手法を提案しています。PRESTOは、単にコンピュータに高い自信を持って「いいえ」と言わせるのではなく、あなたが最初に書いた巧妙な言葉を完全に無視するようにモデルを教えます。これは、泥棒が指示を囁いている声には耳を貸さず、飼い主の命令だけに耳を傾けるように訓練されたガードドッグ(番犬)のようなものです。このようにすることで、モデルは危険な言葉が自身の選択に影響を与えるのを止めます。研究者たちがこれら3つの人気のあるAIモデルでテストしたところ、PRESTOは、モデルの通常の能力を低下させることなく、ハッカーがモデルを欺くことを、最大で4.7倍も困難にすることが分かりました。このことは、モデルがあなたの言葉にどのように注意を向けるかを変えることで、たとえ誰かが賢く出し抜こうとしても、真に安全なAIを構築できることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →