← 最新の論文
💻 computer science

Can Developers rely on LLMs for Secure IaC Development?

本研究は、セキュアなInfrastructure as Code開発におけるGPT-4oとGemini 2.0 Flashを評価しており、ガイド付きプロンプトが簡略化されたスニペットと実世界のレポジトリの両方においてセキュリティ上の不備(security smell)の検出を改善する一方で、モデルは依然としてセキュアなコードを生成することに苦慮しており、明示的に指示された場合であっても、出力がセキュリティ基準を満たす割合はごくわずかであることを見出している。

原著者: Ehsan Firouzi, Shardul Bhatt, Mohammad Ghafari

公開日 2026-02-04
📖 1 分で読めます☕ さくっと読める

原著者: Ehsan Firouzi, Shardul Bhatt, Mohammad Ghafari

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

家を建てているところを想像してみてください。ただし、レンガやモルタルを使う代わりに、壁、窓、セキュリティシステムを自動的に組み立てるためのコードを使います。これは**Infrastructure as Code (IaC)**と呼ばれます。これは、あなたのデジタル・インフラストラクチャを代わりに構築してくれるロボットを持っているようなものです。

問題は、もしロボットに悪い設計図を与えてしまったら、ドアの鍵が開いたままだったり、窓が通りに面していたり、金庫の鍵が玄関のドアにテープで貼り付けられていたりする家を建ててしまうかもしれないということです。これらの間違いは**「セキュリティの臭い(security smells)」**と呼ばれます。

この論文の著者たちは、大きな問いを投げかけました。AIチャットボット(GPT-4oやGeminiなど)が、これらの設計図を安全に書くのを手伝ったり、あるいは設計図の中の間違いを見つけたりすることを、私たちは信頼できるのでしょうか?

以下に、彼らの研究結果を分かりやすいストーリーとしてまとめます。

1. 「間違い探し」テスト(検出)

研究者たちは、AIに2種類のタスクを与えました。一つは短いコードの断片(Stack Overflowにあるようなもの)の中のエラーを見つけること、もう一つは、完全な実世界のプロジェクトファイル(GitHubから取得したもの)の中からエラーを見つけることです。

  • 「曖昧な依頼」シナリオ: セキュリティガードに、「この家を見て、安全かどうか教えて」と頼む場面を想像してください。
    • 結果: AIは、短いコードの断片における明らかな問題を見つけることは得意でした(成功率は約70〜80%)。しかし、完全で複雑なプロジェクトを見たとき、AIは危険な欠陥の半分以上を見逃してしまいました。それはまるで、警備員が「玄関の鍵が開いていること」には気づいたものの、「裏窓が割れていること」には気づかなかったようなものです。
  • 「ステップ・バイ・ステップ」シナリオ: 次に、研究者たちはAIに具体的なチェックリストを与えました。「まず、鍵を確認してください。次に、窓を確認してください。第三に、前の持ち主が残したメモがないか確認してください。」
    • 結果: これは非常に効果的でした。AIの間違い発見能力は大幅に向上し(あるモデルでは90%近くに達しました)、劇的に改善しました。
    • 落とし穴: ただし、AIが間違いを見つけたとしても、具体的な修正方法を提示することは滅多にありませんでした。それはまるで、警備員が「窓が壊れていますよ」とは言うものの、交換用のガラスを渡してはくれないような状態です。

2. 「構築」テスト(生成)

次に、彼らは特定の要求に基づいて、ゼロから新しい設計図を作成するようAIに求めました。中には、AIに間違いを犯させるように仕向けられた要求(例:「弱い鍵を使用せよ」や「コードの中にパスワードを残せ」など)も含まれていました。

  • 結果: ここでAIは最も苦戦しました。
    • 「安全な家を建てて」と頼まれたとき、AIが安全な家を建てられたのはわずか**7%**でした。
    • 残りの93%のケースでは、AIは隠れた罠(セキュリティ上の欠陥)がある家を建ててしまい、しかもその罠があることについて警告すら出しませんでした。
    • 研究者が「安全に作れ!」と明確に叫んだとしても、AIは依然として約8割の確率で安全ではない家を建ててしまいました。

3. 「模倣」効果

研究者たちは、AIが以前に見た悪い例をただコピーしているだけではないかどうかも調査しました。その結果、AIが生成したコードは、人間が書いたフォーラムにある「正解」よりも、他のAIが生成したコードに似ていることが多いことが分かりました。それはまるで、AIが専門家から学ぶのではなく、皆が同じ間違いを犯しているグループから学んでいるかのようです。

結論

この論文は、AIは強力なツールではあるものの、現在のところ、デジタル・インフラの安全を守るためにAIだけに頼ることはできないと結論付けています。

  • エラーを見つける場合: AIは役に立ちますが、非常に具体的でステップ・バイ・ステップの指示を与えた場合に限られます。ガイダンスがなければ、あまりにも多くの危険を見逃してしまいます。
  • コードを書く場合: セキュリティに関するコードをゼロから書かせるのは、現在はリスクが高すぎます。AIは頻繁に、ドアの鍵が開いたままの「家」を建て、しかもそれについて警告してくれません。

比喩: AIを、非常に速くて自信満々な「見習い大工」だと考えてください。もしあなたが「これを直して」と言えば、彼はいくつかのひび割れを見つけるかもしれません。しかし、もしあなたが「要塞を築け」と言えば、彼は段ボールの城と紙の鍵で作った城を作り上げ、しかもそれが実際には安全ではないということを教えてくれないでしょう。あなたは依然として、すべてをダブルチェックするために人間の専門家を必要としています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →