Security and Privacy Prompts in the Wild: What Users Ask LLMs and How LLMs Respond
本研究は、WildChatデータセットに含まれる14,727件の実世界のセキュリティおよびプライバシーに関するプロンプトを分析してユーザーの問い合わせを分類し、LLMの回答品質を評価しており、商用モデルは一般的にオープンウェイトモデルよりも優れているものの、依然としてユーザーを誤導しかねない矛盾した助言を時折生成してしまうことを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたは、あらゆる質問に答えることができる、超スマートで全知全能の司書を雇っています。あなたは「天気はどう?」とか「ケーキの作り方は?」といった質問をするかもしれません。しかし、もしあなたが「隣人のWi-Fiをハッキングする方法は?」や「この怪しいメールは詐欺かな?」といった、危険なことを尋ねたらどうなるでしょうか?
この論文は、まさにそのようなシナリオについての調査報告書のようなものです。研究者たちは、人々がデジタルセキュリティとプライバシー(アカウントの安全を守り、データを非公開にすること)について、実際にAIという名の司書にどのような質問をしているのか、そしてAIがどのように回答しているのかを調べようとしました。
以下は、日常的な例えを用いた、この調査の全容です。
1. 探偵の仕事:人々は何を尋ねているのか
研究者たちは、320万件もの人間とAIの実際の会話(「WildChat」と呼ばれます)という巨大な図書館へと踏み込みました。彼らはノイズを取り除き、セキュリティとプライバシーに関する14,727件の会話を特定しました。
彼らはこれらの質問を9つの異なる「棚」に分類し、さらに450件を詳しく分析して、質問の「雰囲気」を把握しました。その結果、6つの主要なインタラクションが見つかりました。
- 一般知識の探求者 (33%): これらは、「ウイルスとは何か?」や「二要素認証はどう機能するのか?」といった基本的な質問をしている人々です。これは司書に「トマトって何?」と聞くようなものです。
- トラブルシューター (21%): これらのユーザーは困っています。SNSから締め出されたり、サイトからBAN(利用停止)されたりして、「アカウントを取り戻すための手紙をどう書けばいいですか?」と尋ねています。
- 自己防衛者 (12%): これらは先回りして行動するユーザーです。「この新しいショッピングアプリは安全か?」や「スマホの追跡を止めるにはどうすればいいか?」と尋ねます。彼らはAIをボディガードとして利用しています。
- AIの探索者 (10%): これは新しく、奇妙なカテゴリーです。人々はAIに対して、それ自身について尋ねています。「私たちのチャットを覚えていますか?」や「あなたの秘密のAPIキーは何ですか?」といった具合です。彼らは、AIに「裏口」があるのか、あるいは自分たちをスパイしているのではないかを探ろうとしています。
- 悪意のある行為者 (7%): 残念ながら、悪いことを行うための助けを求める人もいます。「他人のパスワードを盗むにはどうすればいいか?」や「学校のインターネットフィルターを回避するにはどうすればいいか?」といった質問です。
- その他: 残りのカテゴリーは、セキュリティのためのコード作成や、嫌がらせへの対処などをカバーしています。
2. テスト走行:AIの回答はどの程度優れているのか?
研究者たちは単に質問を見ただけではありません。5つの異なるAIモデル(3つの有名な「商用」モデルと2つの「オープン」モデル)に対し、270のセキュリティに関する質問をテストしました。彼らは各AIに同じ質問を10回ずつ行い、毎回同じ回答を出すかどうかを確認しました。
そして、回答を1から10のスケール(10が完璧)で採点しました。
- 商用AI (VIPたち): 大手の有料AIモデル(GPT-5.5など)が明確な勝者でした。平均スコアは8.67でした。彼らは、通常正しいアドバイスをくれる専門のセキュリティコンサルタントのような存在です。
- オープンAI (DIYチーム): 無料のオープンソースモデル(Llama 4など)のスコアは低く、6.71程度でした。彼らは「まあまあ」ではありましたが、医療用の薬とハッキング用語を混同してしまうようなミスも犯しました。
3. 「一貫性のなさ」の問題:賢さと一貫性
ここが最も驚くべき物語の部分です。研究者たちは、「賢いこと」が必ずしも「一貫していること」を意味しないということを発見しました。
警備員に「このドアはロックされていますか?」と尋ねる場面を想像してください。
- 警備員Aは、10回連続で「はい」と言います。(一貫していますが、必ずしも最も賢い警備員とは限りません)。
- 警備員Bは、最初は「はい」、次は「いいえ」、その次は「たぶん」と言います。たとえ警備員Bが普段は正しかったとしても、その「ブレ」は危険です。なぜなら、誰を信じていいのか分からなくなるからです。
この研究により、以下のことが判明しました。
- オープンAI (Llama 4) は、実は最も一貫していました。回答の質は低かったものの、97%の確率で同じ回答を出していました。
- トップの商用AI (GPT 5.5) は、最も賢かった(品質が高かった)のですが、時折矛盾した回答をしました。ある時は「パスワードを変更すべきです」と言い、次の時には「あなたのパスワードは大丈夫です」と言うこともありました。
なぜこれが重要なのか
この論文は、セキュリティの世界においては、一貫性は知性と同じくらい重要であると主張しています。
もしあなたが銀行口座を守る方法をAIに尋ねているとしたら、聞くたびに違うアドバイスをもらうわけにはいきません。AIが今日「Xをしなさい」と言い、明日「Xをするな」と言ったら、あなたは混乱して結局何もできなくなり、データが露出してしまうかもしれません。
まとめ
この研究は、実在する人々がAIに対して実在するセキュリティの質問をしている状況を初めて調査したものです。以下のことが明らかになりました。
- 人々は、基礎的な学習からシステムのハッキング、あるいは自己防衛に至るまで、あらゆる目的でAIを利用しています。
- 大手の有料AIモデルは、一般的に無料のモデルよりも優れたアドバイスを提供します。
- しかしながら、最高のAIであっても、時として矛盾した回答をすることがあります。真に信頼できる安全性を備えるためには、AIは賢く、かつ安定していなければなりません。
研究者たちは、AIの回答がどれほど「良い」かだけでなく、どれほど「一貫しているか」も測定する必要があると結論づけています。なぜなら、デジタル上の安全性において、賢いけれど混乱しているAIは、依然としてリスクとなるからです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。