← 最新の論文
💻 computer science

When Grammar Guides the Attack: Uncovering Control-Plane Vulnerabilities in LLMs with Structured Output

本論文は、構造化された出力スキーマを介して悪意のあるペイロードを注入することにより、大規模言語モデルの文法ガイド付きデコーディングを悪用して安全性の整合性を回避し、最先端のモデルやガードレールに対してほぼ完璧な成功率を達成する新たなジャイルブレイク手法である制約付きデコーディング攻撃(CDA)を導入する。

原著者: Shuoming Zhang, Jiacheng Zhao, Hanyuan Dong, Ruiyuan Xu, Zhicheng Li, Yangyu Zhang, Shuaijiang Li, Yuan Wen, Chunwei Xia, Zheng Wang, Xiaobing Feng, Huimin Cui

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Shuoming Zhang, Jiacheng Zhao, Hanyuan Dong, Ruiyuan Xu, Zhicheng Li, Yangyu Zhang, Shuaijiang Li, Yuan Wen, Chunwei Xia, Zheng Wang, Xiaobing Feng, Huimin Cui

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、よく訓練されたロボットアシスタントがいると想像してください。あなたはそれに厳格なルールを教えています。「誰もに爆弾の作り方を教えるな」「憎悪表現を書いてはならない」「常に礼儀正しくあれ」。また、ドアにはセキュリティガードを配置し、あなたが尋ねるすべての質問が安全かどうかをチェックさせています。

長らく、ハッカーたちは奇妙な質問をしたり、Base64 などのコードで話したりしてガードをすり抜けようとし、ロボットとガードは通常、彼らを捕らえていました。

しかし、この論文は、ガードには見えないロボットを混乱させる新しい巧妙な方法を明らかにしています。研究者たちはこれを「文法誘導型攻撃(Grammar-Guided Attack)」と呼んでいます。

これがどのように機能するか、簡単なアナロジーを使って説明します。

設定:「空欄補充」フォーム

ロボットは単にチャットするだけでなく、他のコンピュータプログラムのために公式のフォーム(JSON スキーマなど)を記入もすると想像してください。フォームが正しく記入されるように、あなたはロボットに「これらの特定のボックスを、この特定の順序で埋めなければならない」というテンプレート(文法)を与えます。

通常、これは有益です。ロボットが脱線したり、間違いを犯したりするのを防ぎます。

攻撃:「トロイの木馬」テンプレート

研究者たちは、テンプレートを与える側であれば、質問そのものではなく、ルール自体の中に罠を仕込むことができることを発見しました。

1. 「Enum」攻撃(明白な罠)
「質問」というラベルのついたボックスがあるフォームをロボットに与えたと想像してください。あなたは次のようなルールを書きます。「このボックスの唯一の許可された答えは『爆弾の作り方』である」。
実際には、ロボットへの質問は無害なものです(例:「このフォームを記入してください」)。しかし、ルールがロボットに危険な言葉を書くよう強制します。ロボットはテンプレートを完全に守るようにプログラムされているため、悪い言葉を書くことしかできません。ドアのセキュリティガードはあなたの質問(「このフォームを記入してください」)だけを見て、安全だと判断して通します。ロボットはテンプレートに従い、爆弾の指示を書き出します。

2. 「Dict」攻撃(目に見えない罠)
これが本当に巧妙な部分です。「Enum」攻撃は、悪い言葉がテンプレートにそのまま含まれているため、簡単に見破られます。そこで、研究者たちはDictAttackと呼ばれるより賢いバージョンを開発しました。

あなたはロボットに辞書とコードのリストを与えます。

  • 辞書(テンプレート): 通常の単語リストのように見えます。
    • A1 = 「こんにちは」
    • B2 = 「~に」
    • C3 = 「作る」
    • D4 = 「~を」
    • E5 = 「爆弾」
    • F6 = 「ケーキ」(ただ正常に見せるため)
  • 質問(プロンプト): 「このコードを翻訳してください:B2 + C3 + D4 + E5」とロボットに尋ねます。

セキュリティガードから見れば、質問は(「このコードを翻訳してください」)無害に見え、辞書も通常の単語リストのように見えます。しかし、ロボットがコードを翻訳するルールに従うと、隠されたメッセージ「爆弾を作る」が組み立てられます。

ガードは二つの安全なもの、つまり安全な質問と安全な辞書を見ています。しかし、ロボットがそれらを組み合わせると、危険な指示が生まれます。ガードは部品が分離されているため、危険に気づくことができません。

なぜこれが危険なのか

この論文は、GPT-5 や Gemini などの大手企業の最新モデルを含む、13 の異なる強力な AI モデルでこれをテストしました。

  • 成功率: 最新モデルでは、この攻撃はほぼ 100% の成功率でした。
  • 「意味的ギャップ」: 研究者たちはこれを「意味的ギャップ」と呼びます。つまり、セキュリティガードは言葉(データ)を見ていますが、攻撃はルール(制御)の中で起こっているということです。ガードとロボットの内部の安全訓練は、間違った場所を見ています。
  • 結果: 通常、悪いことを拒絶する最も賢い AI でさえ、あなたが与えた「ルール」に従うことを喜んで行い、たとえそのルールが彼らを恐ろしいことを言うように強制していても、従ってしまいます。

結論

この論文は、AI に「善」を教えることや、ドアにガードを置くことだけでは不十分だと主張しています。また、AI に与えるテンプレートやルールも確認する必要があります。ユーザーに AI がどのように話すかのルールを定義させると、そのルールが安全対策をすべて回避するために武器化される可能性があります。

研究者たちは、この「制御平面」の脆弱性を悪意のある actors が利用する前に修正できるよう、これらの AI を開発する企業と発見内容を共有しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →