← 最新论文
💻 computer science

HelpBench: Assessing the Ability of LLMs to Provide Privacy, Safety, and Security Advice

本文介绍了 HelpBench,这是一个包含 450 个真实问题和评估细则的基准测试,它揭示了尽管最先进的大语言模型在数字隐私、安全和保障方面通常能提供高质量的建议,但其相当一部分响应仍包含不准确或潜在有害的信息。

原作者: Sarah Meiklejohn, Sunny Consolvo, Patrick Gage Kelley, Tara Matthews, Sai Teja Peddinti, Renee Shelby, Lenin Simicich, Kurt Thomas

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Sarah Meiklejohn, Sunny Consolvo, Patrick Gage Kelley, Tara Matthews, Sai Teja Peddinti, Renee Shelby, Lenin Simicich, Kurt Thomas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、博学多才的图书管理员,他几乎无所不知。你去找这位图书管理员并问道:“我的电脑表现得很奇怪,我觉得有人在监视我。我该怎么办?”或者“我收到一封说我中奖了的邮件,但看起来很假。这安全吗?”

这篇名为 HelpBench 的论文就像是这些“图书管理员”(实际上是大型语言模型,简称 LLM)的一份巨大的成绩单,用以测试他们在数字隐私、安全和防护方面回答问题的能力。

以下是研究人员所做的工作及其发现的简单说明:

1. 问题所在:一个危险的图书馆

人们开始向这些 AI 图书管理员寻求解决严重问题的帮助,比如账号被黑、遭遇诈骗或遭受跟踪骚扰。但问题在于:如果图书管理员给了你错误的建议,你可能会损失金钱、身份信息,甚至面临人身安全威胁。

研究人员想要知道:这些 AI 图书管理员在面对这些高风险问题时是否值得信赖?

2. 构建测试: “HelpBench”

为了测试这些图书管理员,团队创建了一个特殊的考试,名为 HelpBench

  • 问题来源: 他们并没有凭空捏造问题。他们进入了一个巨大的数字广场(Reddit),找到了 450 个真实问题,这些都是普通人在遇到麻烦时提出的问题。他们对这些问题进行了脱敏处理以保护隐私,但保留了现实生活中的压力感和困惑感。
  • 涵盖主题: 这些问题涵盖了九个可怕的领域,例如:
    • 找回被锁定的账号。
    • 判断一封邮件是否是诈骗。
    • 处理骚扰或跟踪行为。
      无论是
    • 保护数据不被窃取。
  • 答案解析: 对于每一个问题,一个专家团队(拥有超过 10 年数字安全经验的人员)都编写了一份详细的“标准答案”。这份标准答案不仅仅是判断“对”或“错”,它还会检查:
    • 事实性: 他们是否提供了正确的技术建议?(例如:“不要点击那个链接!”)
    • 语气: 建议是冷静清晰的,还是会让用户感到恐慌?
    • 安全性: 他们是否无意中提出了危险的建议?

3. 考试过程:测试 18 位图书管理员

研究人员选取了目前最智能的 18 个 AI 模型,让它们回答所有 450 个问题。总共产生了 40,500 个答案!他们使用了一个计算机程序(自动评分器)根据人类专家的标准来为这些答案评分。

4. 结果:好消息与坏消息

结果既展示了令人印象深刻的技能,也暴露了危险的错误。

  • 好消息: 平均而言,这些 AI 图书管理员表现得相当不错。它们的综合得分约为 82%。对于简单的问题,比如“这封邮件是诈骗吗?”,它们的准确率通常很高。
  • 坏消息: 平均分掩盖了一个可怕的现实。每十个答案中就有一个是失败的。 这些错误并非只是“哎呀,我漏掉了一个逗号”这种小失误。这些答案的得分低于 65%,意味着它们提供了不准确甚至有害的建议

5. 出了什么问题?(“长尾”失效现象)

论文强调了一些具体的 AI 失效方式,这些失效就像是图书管理员在危险的街区给了你一张错误的地图:

  • 忽视“处于风险中”的情境: 如果用户询问如何从一台被伴侣安装了间谍软件的电脑中移除间谍软件,AI 可能只会给出技术步骤。它未能意识到,突然移除间谍软件可能会引发伴侣的暴力行为。AI 忽略了人类层面的危险。
  • 虚假的安全感: 在一个案例中,用户询问将文件添加到“保险库”是否会删除原始副本。AI 说会,但实际上并不会。这给了用户一种虚假的安全感,使他们的数据处于脆弱状态。
  • 对贫困人群的糟糕建议: 有时 AI 会建议一些过于昂贵或无法实现的解决方案,比如“买一台全新的电脑”或“去另一家银行开户”,仅仅是为了解决一个简单的应用问题。
  • 鼓励违规行为: 当用户询问如何绕过社交媒体网站的禁令时,一些 AI 会说:“好吧,那是你和应用之间的事情。”这实际上是在鼓励他们违规,从而导致再次被封禁。
  • 揣测人心: AI 有时会试图猜测某人为什么拉黑了他们,并编造一些关于对方动机的戏剧性故事,这会让用户感到更加焦虑。

6. 结论

论文得出结论:虽然这些 AI 工具正在变得更好,但它们尚未准备好成为数字安全领域的唯一真理来源。

把它想象成一名飞行学员。在晴朗的日子里(处理常规问题),他们可以驾驶飞机;但如果遇到风暴(复杂的安全问题)或棘手的着陆(高风险情况),他们可能会坠机。因为涉及的代价太高(失去金钱、隐私甚至生命安全),研究人员表示,我们需要不断测试和改进这些模型,直到它们能够做到始终如一的完美,而不仅仅是“大致”正确。

简而言之: AI 是一个得力的助手,但涉及到你的数字安全时,你现在还不能完全把命交给它。它出错的频率仍然太高,且这些错误可能致命。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →