← 最新の論文
💻 computer science

Transient Turn Injection: Exposing Stateless Multi-Turn Vulnerabilities in Large Language Models

本論文は、LLM のステートレスなモデレーションの脆弱性を悪用し、対話の文脈を維持せずに意図を分散させる新たな攻撃手法「Transient Turn Injection(TTI)」を提案し、主要なモデルにおける脆弱性を実証するとともに、セッションレベルの文脈集約などの対策を論じています。

原著者: Naheed Rayhan, Sohely Jahan

公開日 2026-04-24
📖 1 分で読めます☕ さくっと読める

原著者: Naheed Rayhan, Sohely Jahan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

🕵️‍♂️ 核心となるアイデア:「一瞬の隙」を突く攻撃

この論文で提案されている新しい攻撃手法の名前は、**「トランジェント・ターン・インジェクション(TTI)」です。
これを日本語で言い換えると、
「一瞬の隙を突く、分散型ハッキング」**のようなものです。

🏰 従来の攻撃 vs 新しい攻撃(TTI)

1. 従来の攻撃(「壁をぶち抜く」)

  • イメージ: 城の門(AI のセキュリティ)に、巨大なハンマーで「開けろ!開けろ!」と激しく叩き続けるような攻撃です。
  • 仕組み: 一度の会話で、無理やり「悪いこと」をさせようとします。
  • 結果: 現代の AI は「そんなこと言わないでください」と門番(フィルタ)が即座に止めるため、この方法は最近では通りにくくなっています。

2. 新しい攻撃「TTI」(「石を一つずつ積み上げる」)

  • イメージ: 城の門番は「一度に大きな荷物」しかチェックしません。そこで、攻撃者は**「石を一つずつ」**門番に渡します。
    • 1 回目:「石、いいですか?」→ OK(無害)
    • 2 回目:「じゃあ、この石を少し削って?」→ OK(無害)
    • 3 回目:「削った石を並べて?」→ OK(無害)
    • ...
    • 最終的に、「城の壁(危険な情報)」が完成してしまいます。
  • 仕組み:
    • 攻撃者は、AI との会話履歴を**「記憶させない」**ようにします( Stateless:ステートレス)。
    • 毎回、新しい会話(新しいセッション)を始め、**「前の会話は何も覚えていない」**というふりをします。
    • 攻撃者側の AI が、前の AI の回答をヒントに、**「次はもう少し危険な質問」**を工夫して送り続けます。
    • 個々の質問は「 innocuous(無害)」に見えるため、AI のセキュリティは「大丈夫だ」と判断してしまいます。
  • 結果: 会話が進むにつれて、AI は知らず知らずのうちに、本来教えてはいけない**「医療の秘密」や「危険な方法」**を話し出してしまいます。

🧪 実験結果:どの AI が弱かった?

研究者たちは、OpenAI(GPT 系)、Anthropic(Claude 系)、Google(Gemini 系)、Meta(Llama 系)など、最新の AI たちをこの「石積み攻撃」で試しました。

  • 🏆 強かった AI:
    • Anthropic の Claude 3.5 HaikuOpenAI の GPT-4.1 Mini など。
    • これらは「石を積み上げても、最終的に『これは危険な話ですね』と気づいて止める」能力が非常に高かったです。特に、AI 自体が倫理観を深く学習している(Constitutional AI など)モデルは強いです。
  • ⚠️ 弱かった AI:
    • Google の Gemini 1.5/2.0 シリーズMistral 系 など。
    • これらは、石を積み上げられると、すぐに「壁(危険な情報)」を完成させてしまいました。特に「医療」や「違法行為」に関する質問で弱点が見られました。

重要な発見:
「1 回の会話では安全そうに見える AI でも、『会話の履歴を忘れる』という設定で何度も質問を繰り返されると、簡単にハッキングされてしまう」ということがわかりました。


🛡️ どうすれば守れるのか?(対策)

この新しい攻撃に対抗するには、従来の「1 回の質問をチェックする」だけでは不十分です。以下のような対策が必要です。

  1. 「会話全体」を見ること(セッションレベルの監視)

    • 門番が「石」だけでなく、「この人が今日持ってきた石の総量」や「積み方のパターン」をチェックする必要があります。
    • 「一見無害な質問」が、過去 10 回で「危険な話」に繋がっているなら、そこで止めるべきです。
  2. AI の「心」を強くする(深層学習による調整)

    • 単に「悪い言葉は禁止」というリストを作るのではなく、AI 自体が「なぜこれが危険なのか」を深く理解するように訓練する必要があります(Anthropic の手法がこれに当たります)。
  3. 不審な行動を察知する

    • 「同じ人が、何度も新しい会話を作って、少しずつ質問を変えている」ような行動パターンを検知し、一時的に制限をかけるなどの対策が必要です。

💡 まとめ

この論文が伝えたいことはシンプルです。

「AI は、一度に大きな攻撃には強くなりました。しかし、『無害な質問』を少しずつ積み重ねて、ゆっくりと安全を崩す『忍び寄る攻撃』には、まだ弱い部分があります。」

特に、医療や法律など、**「失敗が許されない分野」**で AI を使う場合、この「石積み攻撃」のような新しいリスクを常に意識し、AI が「会話の文脈全体」を理解して守れるようにする必要があります。

AI のセキュリティは、単なる「壁」を作るだけでなく、**「文脈(ストーリー)を理解する」**ことが次の鍵になるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →