← 最新の論文
💻 computer science

The Security Budget of Code LLMs: An Information-Theoretic Capacity-Security Bound

本論文は、コード生成LLMが、機能的容量と摂動保持の総和がタスクのエントロピーとプロンプト漏洩によって制限されるという固定された「セキュリティ・バジェット」の下で動作することを実証する情報理論的な境界を確立し、実験結果を通じて、この理論的な天井が様々なモデル、データセット、および精度レベルにわたって成立することを示す。

原著者: Jianwei Tai

公開日 2026-06-03
📖 1 分で読めます☕ さくっと読める

原著者: Jianwei Tai

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に有能だが少し緊張気味のロボット・プログラマーを雇っていると想像してください。あなたはそのロボットに、コードを書くための指示(「プロンプト」)を与えます。時として、あなたは指示の中の単語を誤って変えてしまったり、あるいはハッカーがロボットを騙して危険なものを作成させようとして、指示をわずかに改ざんしたりすることがあります。

この論文は、根本的な問いを投げかけています。ロボットの「脳」のうち、仕事を正しく遂行するためにどれだけの容量を割けるのか、そして、意図せず(あるいは悪意を持って)トリックに従ってしまうためにどれだけの余地が残されてしまうのか?

著者らはこれを**「セキュリティ・バジェット(安全予算)」**と呼んでいます。彼らは、ロボットの思考能力を、二つの競合するタスクに分割しなければならない、固定されたエネルギーや帯域幅のようなものとして扱っています。

二つの競合するニーズ

ロボットの注意力を「パイ」と考えてみてください。論文によれば、このパイは二つのスライスに分けられます。

  1. 「仕事」のスライス(キャパシティ): これは、ロボットがあなたの本来の意図をどれだけ理解しているかです。ロボットは、あなたが実際に求めた通りのコードを書いたでしょうか?
  2. 「エコー」のスライス(セキュリティ/保持): これは、たとえ言葉がわずかに変わったとしても、ロボットの出力が使用された特定の単語をどれだけ「記憶」しているかです。
    • 落とし穴: もしロボットの出力が、プロンプトの微細な変化に対してあまりにも敏感(高い「エコー」を持つ状態)である場合、それはハッカーが「チェックする」という言葉を「無視する」といった言葉に簡単に置き換えることができ、ロボットがその新しい、危険な指示に従ってしまうことを意味します。
    • ゴール: あなたは、ロボットに仕事を上手くこなしてほしいと考えていますが、同時に、プロンプトの具体的な言い回しに対してあまりにも敏感であってほしくはありません。

大原則(定理)

著者らは、このパイの「速度制限」として機能する数学的なルールを証明しました。彼らはこう述べています。

仕事のスライス + エコーのスライス ≤ 全体の脳の空間 + プロンプトの漏洩

平易な言葉で言えば、ロボットは、仕事を完璧にこなすことと、あなたのプロンプトのあらゆる微細な変化に対して完璧に敏感であることの両方を、同時に実現することはできません。そこには硬い限界が存在します。

  • 全体の脳の空間: これはタスクがいかに複雑であるかを表します。もしあなたが単純な「Hello World」を頼めば、ロボットには十分な余裕があります。もし複雑な銀行システムを頼めば、「脳の空間」は膨大になり、安全マージンのためのスペースが少なくなります。
  • プロンプトの漏洩: これは、あなたの元のプロンプトと「騙された」プロンプトの間で、どれだけの情報が共有されているかを示します。トリックが「猫」を「犬」(類義語)に変える程度であれば、漏洩は高いです。もしトリックが文章の半分を削除することであれば、漏洩は低くなります。

論文は、ロボットをプロンプトに対してあまりにも敏感にしようとすると(堅牢にしようとすると)、必然的に、実際の仕事を正しく行うために利用できるスペースが減少してしまうことを証明しています。

検証方法

研究者たちは単に推測したのではなく、実際のAIモデル(CodeLlamaやQwenなど)を用いて、実際のコーディング問題に対して実験を行いました。

  • 「ブラックボックス」テスト: 彼らは、プロセス中の内部的な思考を覗き見ることなく、ロボットの最終的な出力(コード)を確認しました。彼らはコードを指紋のように扱いました。
  • 結果: すべてのテストにおいて、数学的な法則は成立しました。「仕事」のパフォーマンスと「エコー」の感度の合計が、この速度制限を破ることはありませんでした。
    • ロボットが仕事には非常に優れているが、トリックに対しては敏感ではない(未使用の予算、つまり「スラック」が多く残っている)場合もありました。
    • ロボットがトリックに対して非常に敏感であった場合、それは仕事を完璧に行うための余地が少なくなっていることを意味しました。
    • 決定的なことに: 特定の種類の手口(変数の名前変更や類義語の入れ替えなど)は、他の手口よりも大きな「エコー」を残すことがわかりました。これは、どの種類のプロンプトの変化が、最も警戒すべき危険なものかを教えてくれます。

「ストレス・テスト」

彼らのルールがどれほど強力であるかを確かめるため、彼らはそれを壊そうと試みました。

  1. 23の攻撃プール: プロンプトをいじる23通りの方法を試しましたが、ルールは依然として成立しました。
  2. 「ユニバーサル・サフィックス(共通接尾辞)」: すべてのプロンプトに同じ危険なフレーズを追加しました。ルールは依然として成立しました。
  3. 「勾配攻撃(グラディエント・アタック)」: ロボットを騙すための完璧な方法を見つけ出す、極めて巧妙な数学的攻撃を用いました。それでもルールは成立しましたが、その際、ロボットのコードの質は著しく低下しました(騙されるのではなく、「崩壊」しました)。

人間にとっての教訓

この論文は、AIアシスタントを構築するための実践的なレッスンで締めくくられています。

AIがテストに合格するかどうかだけを測定してはいけません。また、「情報のチャネル」をどれだけ攻撃者に開放してしまっているかも測定しなければなりません。

  • プロンプトを強化(硬化)すれば(、より厳格で標準的なものにすれば)、 「エコー」のスライスが減り、ハッカーがAIを騙すことが難しくなります。
  • しかし、安全のためにAIを単に「愚か」にすることはできません。AIが仕事をこなすのに十分な賢さを持ちつつ、言葉遊びによってセキュリティリスクにならないような、絶妙なバランスを見つけ出さなければならないのです。

要約すると: AIが「完璧な労働者」であり、かつ「あなたの声のあらゆる微細な変化に対する完璧な聞き手」であることは、数学的な限界によって両立できないのです。この論文は、その限界を測るための「定規」を与えてくれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →