Boundary-targeted Membership Inference Attacks on Safety Classifiers
本文提出了一种针对边界的成员推断攻击策略,该策略利用低置信度预测显著提升了从安全分类器中恢复敏感训练数据的能力,表明尽管存在基于内容的过滤,此类模型仍易受隐私泄露威胁,但现有的噪声策略可有效缓解这一风险。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,在一家大型图书馆的入口处,有一位非常聪明且心地善良的安全员。这位保安的职责是识别那些可能陷入困境或企图造成危害的人,以便在他们进入之前提供帮助或予以阻止。为了学会如何做到这一点,这位保安研究了成千上万条真实、私人的故事,这些故事来自曾经处于危机、感到抑郁或产生自残念头的人。
安东尼·休斯(Anthony Hughes)及其团队撰写的论文提出了一个令人不安的问题:一个陌生人能否推断出这位保安具体学习了哪些私人故事?
以下是他们发现的分解说明,使用了简单的类比:
1. “自信”陷阱
通常,当我们想到安全人员(或人工智能)犯错时,我们会认为他们是因为困惑或不确定。但在这项研究中,作者发现了一个反直觉的现象。
- 旧方法: 攻击者过去试图通过观察保安100% 确信的故事,来猜测某条故事是否包含在训练数据中。他们认为:“如果保安对这条故事完全确定,那一定是因为他们记住了它。”
- 新发现: 作者发现,保安实际上在最不确定的时候最容易“泄露”信息。
- 类比: 想象保安正在看一张模糊的照片。如果照片清晰地显示是一只猫,保安会说:“那是猫!”(高置信度)。如果照片是猫和狗非常奇怪、模糊的混合体,保安就会犹豫。
- 研究人员发现,当保安对模糊、困难的故事犹豫时,往往是因为他们正在从记忆中回忆一个具体的、相似的故事,而不是在使用通用逻辑。这种犹豫是一个“破绽”。这就像保安看到一张脸时,认出它来自某个特定的私人档案,即使他们不确定该如何处理,也会紧张出汗。
2. “边界”策略
该团队发明了一种攻击系统的新方法,称为“针对边界的成员推断”(Boundary-Targeted Membership Inference)。
- 类比: 将保安的决策过程想象成一根走钢丝。一边是“安全”,另一边是“不安全”。大多数人走在远离绳索的坚实地面上,很容易。但“边界”是正中间那段摇晃的部分。
- 研究人员意识到,那些(或那些故事)站在摇晃的钢丝正中间的人,是保安记忆最深刻的。通过仅关注这些摇晃的、不确定的案例,攻击者可以以更高的准确度判断某条特定故事是否包含在保安的私人学习档案中。
- 结果: 使用这种“摇晃的钢丝”策略,攻击者能够识别出保安研究过的19%的具体 distress(痛苦/危机)对话,而标准方法仅能捕捉到约 5%。这意味着近3.5 倍的私人信息被暴露。
3. 为什么内容过滤器不起作用
团队想知道:“我们能否只是从训练数据中移除那些奇怪、模糊的故事来解决这个问题?”
- 类比: 他们试图通过查看文本内容来寻找这些“模糊”的故事,就像试图通过颜色来寻找特定的沙粒一样。
- 结果: 这行不通。这些“模糊”的故事在外观上与“安全”的故事没有任何不同。它们看起来同样正常。你无法通过阅读它们来过滤掉它们,因为“危险”不在于文字本身,而在于人工智能的大脑是如何记住它们的。
4. 解决方案:在信号中添加“静电”
既然无法移除这些危险的记忆,他们尝试让保安的回答变得更加模糊。
- 类比: 想象保安正在对你耳语他们的答案。如果他们耳语得太清晰,你就能确切听到他们在想什么。研究人员建议在保安开口说话之前,在他们的声音中加入一点点“静电”或“白噪音”。
- 结果: 这种“噪音”(数学上称为拉普拉斯扰动)使保安的犹豫变得不那么精确。这足以隐藏对特定私人故事的具体记忆,而不会让保安无法胜任工作。保安仍然可以说“不安全”或“安全”,但他们无法无意中透露他们正在回忆哪一条具体的私人故事。
总结
这篇论文表明,那些基于敏感人类挣扎进行训练的安全人工智能是脆弱的。如果攻击者知道如何观察人工智能不确定的时刻,他们就能确切地找出人工智能是从哪些私人人类故事中学习的。
好消息是,作者发现了一个解决办法:通过在人工智能的最终答案中添加一点点“噪音”,我们可以在不阻止人工智能履行其保护人们安全职责的情况下,保护那些私人故事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。