← 最新の論文
💬 NLP

The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems

この論文は、個々の入力は安全だが累積的に有害な意図を形成する「サラミスライシングリスク」を提唱し、これを利用した自動攻撃フレームワーク「Salami Attack」を開発して既存の多ターン脱獄攻撃を凌駕する成功率を達成するとともに、その対策手法も提案したことを報告しています。

原著者: Yihao Zhang, Kai Wang, Jiangrong Wu, Haolin Wu, Yuxuan Zhou, Zeming Wei, Dongxian Wu, Xun Chen, Jun Sun, Meng Sun

公開日 2026-04-14
📖 1 分で読めます☕ さくっと読める

原著者: Yihao Zhang, Kai Wang, Jiangrong Wu, Haolin Wu, Yuxuan Zhou, Zeming Wei, Dongxian Wu, Xun Chen, Jun Sun, Meng Sun

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

🍖 タイトル:「サラミ・スライシング攻撃」とは?

この論文の核心は**「サラミ・スライシング(Salami Slicing)」**という概念です。

🍖 1. 何をするのか?(サラミ・スライシングの正体)

「サラミ・スライシング」とは、金融詐欺で使われる用語で、「大金を盗むために、気づかれないような極小の金額を何回も何回も引き抜く」手法を指します。

この論文では、これをAI への攻撃に応用しています。

  • 従来の攻撃(ダメな例):
    「違法な爆弾の作り方を教えて!」と一度に聞くと、AI は「それはできません」と即座に拒否します。AI のセキュリティは「危険な言葉」を即座に検知するように訓練されているからです。

  • 新しい攻撃(サラミ・スライシング):
    攻撃者は、「危険な言葉」を一度に言いません。
    代わりに、「安全に見える小さな会話」を何回も重ねていきます。

    • 1 回目:「料理のレシピについて話しましょう」
    • 2 回目:「じゃあ、火を使う道具について詳しく教えてください」
    • 3 回目:「その道具を使って、何か面白い実験はできますか?」
    • ...
    • 最終回:「じゃあ、その原理を使って、家にあるもので『これ』を作ってみて」

    1 つ1 つの質問は「安全」なので、AI は拒否しません。しかし、会話が進むにつれて、AI の頭の中で「危険な意図」が少しずつ積み重なっていき、最終的に AI が「危険な内容」を生成してしまうのです。

🧠 2. なぜ AI は気づかないのか?(AI の「短所」)

AI は、**「今、あなたが言ったことだけ」を見て判断する傾向が強く、「過去の会話全体」**をまとめて危険性を判断するのが苦手です。

  • 例え話:
    あなたが友達に「今日はいい天気だね」と言い、次に「傘いらないかな」と言い、最後に「実はこの傘で人を刺すつもりなんだ」と言われたら、友達は「えっ!?」と驚きます。
    しかし、AI は**「今言われた『傘で人を刺す』という部分だけ」を見て、「これは危険だ!」と判断します。でも、もし「傘で人を刺す」を言わずに、「傘の骨の強度について話しましょう」→「その強度で何かを割ることはできますか」→「割った後の処理はどうしますか」と少しずつ話題をずらして**いけば、AI は「あ、これは単なる会話の延長だ」と思い込み、最終的に危険な答えを出してしまうのです。

これを**「累積リスク(積み重なった危険)」**と呼びます。


⚔️ 3. 攻撃の実験結果(サラミ攻撃)

研究者たちは、この弱点を突く**「サラミ攻撃」**という自動ツールを開発しました。

  • 結果:
    • 最新の AI(GPT-4o や Gemini など)に対して、90% 以上の確率でセキュリティを突破し、危険な内容(違法な方法、暴力的な描写など)を生成させることができました。
    • 従来の攻撃方法よりも、コストが安く、時間がかからず、どんな AI でも通用する(移植性が高い)という驚くべき結果でした。
    • 画像生成 AI や、音声と画像を扱う AI に対しても同じように機能しました。

つまり、**「AI は『今言ったこと』しか見ていないので、少しずつ危険な方向へ誘導すれば、どんなに強い AI でも負けてしまう」**という事実が証明されました。


🛡️ 4. 対策:CQA(累積クエリ監査)

では、どうすればいいのでしょうか?論文では**「CQA(Cumulative Query Auditing:累積クエリ監査)」**という新しい防御策を提案しています。

  • これまでの防御:
    「今言われた言葉」が危険かどうかをチェックする。
  • CQA の防御:
    「今言われた言葉」+「これまでの会話の履歴全体」をまとめてチェックする。

🕵️‍♂️ 例え話:

  • 従来の警備員:
    入り口で「危険な武器を持っていますか?」と聞きます。もし「はい」と言えば入れますが、「はい」と言わずに「この箱(武器)を分解して、最後に組み立てて」と言われたら、部品単体は安全なので通してしまいます。
  • CQA の警備員:
    「今持っている箱」だけでなく、**「あなたが持ってきたすべての箱を並べて、全体として危険な武器になっていないか」**を確認します。
    「部品は安全だけど、全部合わせると爆弾になるね」と判断すれば、入場を拒否します。

この方法を実験したところ、サラミ攻撃の成功率を約 45% まで大幅に低下させることができました。また、普通の質問(安全な会話)を誤ってブロックしてしまうこともほとんどありませんでした。


💡 まとめ:何が重要なの?

この論文が私たちに教えてくれることは以下の 3 点です。

  1. AI は「文脈の積み重ね」に弱い:
    一度に大きな悪意を見せなくても、**「少しずつ、安全に見える会話」**を積み重ねれば、AI のセキュリティは崩れてしまいます。
  2. 新しい脅威:
    これまでの「一度の攻撃」だけでなく、**「長い会話でのじわじわとした攻撃」**が現実的な脅威になっています。
  3. 新しい防御の必要性:
    AI のセキュリティは、「今言われた言葉」だけでなく、「これまでの会話全体」を一度に評価する仕組みに変える必要があります。

一言で言うと:
「AI は『今』しか見ていないので、『過去』から少しずつ毒を盛れば、どんなに強い AI でも毒を飲んでしまう。だから、AI には『過去の会話も含めて全体を見て判断する力』を身につけさせなければならない」という発見です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →