Security and Privacy Prompts in the Wild: What Users Ask LLMs and How LLMs Respond
本研究分析了来自 WildChat 数据集的 14,727 个真实世界的安全与隐私提示词,旨在对用户查询进行分类并评估大语言模型的响应质量,结果显示虽然商业模型通常优于开源权重模型,但它们偶尔仍会产生可能误导用户的矛盾建议。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明、无所不知的图书管理员,可以回答你的任何问题。你可能会问他,“天气怎么样?”或者“我该如何烤蛋糕?”但当你问一些危险的问题时,比如“我该如何黑进邻居的 Wi-Fi?”或者“这封奇怪的邮件是诈骗吗?”会发生什么?
这篇论文就像是一份针对这种场景的侦探报告。研究人员想要观察真实的人们是如何就数字安全与隐私(保护你的账户安全和数据私密)向这位 AI 图书管理员提问的,以及 AI 的回答表现如何。
以下是他们调查过程的详细拆解,使用了许多日常类比:
1. 侦探工作:人们在问什么
研究人员进入了一个包含 320 万条真实人机对话(称为“WildChat”)的庞大图书馆。他们过滤掉了噪音,发现了 14,727 条专门关于安全与隐私的对话。
他们将这些问题分成了九个不同的“书架”,然后仔细研究了其中的 450 个问题,以了解这些问题的“氛围”。他们发现了六种主要的交互类型:
- 常识寻求者 (33%): 这些人只是在问一些基础问题,比如“什么是病毒?”或“双重身份验证是如何工作的?”这就像是在问图书管理员:“西红柿是什么?”
- 故障排除者 (21%): 这些用户遇到了麻烦。他们被锁在了社交媒体账号之外,或者被某个网站封禁了,正在询问:“我该如何写一封信来找回我的账号?”
- 自我防御者 (12%): 这些是积极主动的用户。他们会问:“这个新的购物 App 安全吗?”或者“我该如何停止手机追踪我?”他们把 AI 当作保镖。
- AI 探测者 (10%): 这是一个全新的、奇怪的类别。人们在询问关于 AI 自身 的问题。他们会问:“你记得我们的聊天吗?”或者“你的秘密 API 密钥是什么?”他们试图看看 AI 是否有“后门”,或者是否在监视他们。
- 坏人 (7%): 不幸的是,有些人是在寻求做坏事的帮助。他们问:“我该如何窃取别人的密码?”或“我该如何绕过学校的网络过滤器?”
- 其他类别: 其余类别涵盖了编写安全代码或处理骚扰等内容。
2. 路测:AI 的回答有多好?
研究人员不仅观察了问题,还针对 270 个安全问题测试了五种不同的 AI 模型(三种著名的“商业型”模型和两种“开放型”模型)。他们对每个 AI 模型进行 10 次重复提问,以观察它们是否每次都给出相同的答案。
他们按照 1 到 10 分的标准对答案进行评分(10 分为完美)。
- 商业 AI(VIP 级): 这些大型付费 AI 模型(如 GPT-5.5)是明显的赢家。它们的平均得分达到了 8.67。可以把它们看作是专业的安全顾问,通常能给出正确的建议。
- 开放 AI(DIY 组): 免费的开源模型(如 Llama 4)得分较低,约为 6.71。它们表现“还可以”,但犯了一些错误,比如把一种医疗药物与一个黑客术语搞混了。
3. “反复无常”问题:一致性 vs. 质量
这是故事中最令人惊讶的部分。研究人员发现,聪明并不意味着一致。
想象一下你在问一名保安:“这扇门锁了吗?”
- 保安 A 连续 10 次都说“锁了”。(很一致,但可能不是最聪明的保安)。
- 保安 B 第一次说“锁了”,第二次说“没锁”,第三次说“也许锁了”。即使保安 B 通常是对的,但他的反复无常是危险的,因为你不知道该信任谁。
研究发现:
- 开放 AI (Llama 4) 实际上是最一致的。它 97% 的时间都给出相同的答案,尽管其回答的质量往往较低。
- 顶尖商业 AI (GPT 5.5) 是最聪明的(质量最高),但它偶尔会给出矛盾的答案。有一次它可能会说:“你应该更改密码,”而下一次它可能又会说:“你的密码没问题。”
为什么这很重要
论文认为,在安全领域,一致性与智能同样重要。
如果你正在询问 AI 如何保护你的银行账户,你不能承担由于它每次提问都给出不同建议而带来的风险。如果 AI 今天说“执行方案 X”,明天却说“不要做 X”,你可能会感到困惑并最终无所适从,从而导致数据暴露。
核心结论
这项研究是首次观察真实的人向 AI 提出真实的安全问题。研究发现:
- 人们利用 AI 处理从基础学习到尝试黑入系统或保护自身的一切事务。
- 大型付费 AI 模型通常比免费模型提供更好的建议。
- 然而,即使是最优秀的 AI 有时也会自相矛盾。要实现真正的可靠安全,AI 需要既聪明又稳定。
研究人员总结道,我们需要同时衡量 AI 回答的“好坏程度”和“一致程度”,因为当涉及到数字安全时,一个聪明但混乱的 AI 仍然是一种风险。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。