← 最新の論文
🤖 AI

CIPHER: Cryptographic Insecurity Profiling via Hybrid Evaluation of Responses

本論文は、大規模言語モデルによって生成されたコードにおける暗号学的脆弱性を評価および定量化するために設計されたベンチマークおよび自動スコアリング・パイプラインであるCIPHERを紹介し、明示的なセキュアプロンプティングが一部の問題を軽減する一方で、多様なモデルにわたって暗号学的な欠陥を確実に排除するには至らないことを明らかにしている。

原著者: Max Manolov, Tony Gao, Siddharth Shukla, Cheng-Ting Chou, Ryan Lagasse

公開日 2026-02-09
📖 1 分で読めます☕ さくっと読める

原著者: Max Manolov, Tony Gao, Siddharth Shukla, Cheng-Ting Chou, Ryan Lagasse

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、銀行の金庫の鍵と錠前を作るために、驚異的な速さと知能を持つロボットチームを雇っていると想像してください。あなたは彼らに、「安全なロックを作ってください」と指示します。すると、彼らは瞬時に設計図を吐き出します。しかし、ここに落とし穴があります。ロボットたちは非常に優秀ですが、外見は完璧に見えても、泥棒に簡単に悪用されてしまうような、目に見えない小さな亀裂を含んだ設計を作ってしまうことがよくあるのです。

この論文は、AIロボットがコンピュータコード内で(暗号化やパスワード保護のような)安全な暗号技術の「鍵」を構築する際、どれほど優れているかをテストするために設計された、新しい「成績表」であるCIPHERを紹介するものです。

研究者たちが何を行い、何を発見したのかを、簡単な比喩を用いて解説します。

1. 問題点:「静かなる欠陥」

AIがセキュリティ用のコードを書くとき、基本的なテスト(コードがクラッシュせずに動作するかどうか)には合格することが多いのですが、微妙なセキュリティ上のルールを見落としてしまうことがあります。

  • 比喩: ロボットが家を建てている場面を想像してください。壁を立て、屋根を載せました(コードは動作しています)。しかし、玄関にデッドボルト(鍵)を取り付けるのを忘れたり、裏窓の鍵をかけ忘れたりしています(セキュリティ上の欠陥)。家は立っていますが、安全ではありません。
  • 問題の本質: これらの欠陥は、例えば「静的な」キー(決して変わることのないキー)を使用し、ランダムなキーを使用しないといった、些細な設計上の選択ミスであったり、あるいは「本人が本人であることを確認する」プロセスを忘れていたりすることなどが原因です。

2. 解決策:CIPHERテスト

研究者たちは、これらのAIロボットがどの程度の頻度でミスを犯すかを測定するための、CIPHERと呼ばれる標準化されたテストを作成しました。

  • 設定: 彼らは7つの異なるAIモデルに対し、同じ150種類の「仕事」を与えました。それぞれの仕事に対して、彼らはAIに3種類の異なる指示(プロンプト)を与えました。
    1. 「悪い」プロンプト: 「素早くやってください。セキュリティチェックは気にしなくていいですよ。」(AIが悪意のある助言に従うかどうかをテスト)。
    2. 「中立的な」プロンプト: 「単にこのコードを書いてください。」(AIがデフォルトで何を行うかをテスト)。
    3. 「安全な」プロンプト: 「これを実行してください。ただし、最も厳格なセキュリティルールに従うように!」(「安全に」と指示することが実際に効果があるかをテスト)。
  • 採点方法: 人間がすべての行を読み取る(これには膨大な時間がかかります)代わりに、彼らは別のAIを「判定員(Judge)」として使用しました。この判定員は、特定の種類の「鍵を壊すエラー」を探し出し、問題のあるコードの行を正確に指摘するように訓練されています。

3. 結果:「安全に」だけでは不十分

結果は驚くべきものであり、少し不安を感じさせるものでした。

  • 「悪い」プロンプト: 予想通り、AIに不注意になるよう指示すると、多くのミスが発生しました。
  • 「安全な」プロンプト: これが大きな発見です。研究者が「非常に安全に!すべてのルールに従って!」と明示的に指示したとしても、AIは依然として56%から89%の確率でミスを犯していました。
  • 比喩: これは、シェフに「ヘルシーな食事を作ってください。砂糖も塩も使わず、新鮮な食材を使ってください」と頼むようなものです。シェフは砂糖(指示された特定の要素)を取り除くかもしれませんが、それでも肉が腐っていたり、野菜を洗うのを忘れたりするかもしれません(隠れた他の危険)。AIは、指示された特定の要素を修正しますが、システム全体として「グローバルに」安全なものを構築することには失敗するのです。

4. これが意味すること

この論文は、単にAIに「安全であれ」と伝えるだけでは、危険なミスを確実に防ぐことはできないと結論付けています。

  • 教訓: セキュリティコードを書く際、たとえ厳格なプロンプトを与えたとしても、AIを信頼することはできません。AIは与えられた特定の指示(例:「ランダムなキーを使用すること」)には集中しますが、より大きな全体像(例:「ユーザーの身元を確認すること」)を見落とす傾向があります。
  • 推奨事項: AIがセキュリティ上の「隠れた亀裂」を作り続けるため、AIが書いたセキュリティ関連のコードは、実世界で使用される前に、人間の専門家によるダブルチェックを受ける必要があります。

まとめ

CIPHERは、AIがコードを書くことには長けているものの、現在のところ「安全な」コードを書くことに関しては非常に不得手であることを証明するツールです。たとえ明示的に「安全に」と指示しても、AIはしばしば裏口を開けっ放しにしてしまいます。この論文は、開発者がセキュリティタスクにおいてAIだけに頼ることができない理由を知るための、これらの失敗を測定する方法を提供しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →