← 最新论文
🤖 AI

IDP-Bench: Benchmarking ability of LLMs to protect personal information in interdependent privacy contexts

本文介绍了 IDP-Bench,这是首个基于情境完整性(Contextual Integrity)框架的基准测试,旨在评估大语言模型处理相互依赖隐私的能力,并揭示了虽然模型能够识别数据共同所有权,但在识别特定隐私参数以及判断复杂多方语境下信息共享的适当性方面仍存在显著困难。

原作者: Ayana Hussain, Soumya Sharma, Golnoosh Farnadi, Nicholas Vincent, Héber Hwang Arcolezi, Ulrich Aïvodji

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Ayana Hussain, Soumya Sharma, Golnoosh Farnadi, Nicholas Vincent, Héber Hwang Arcolezi, Ulrich Aïvodji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明、乐于助人的机器人助手。你信任它,把你的日记、照片和秘密都托付给它。你告诉它:“把一张我生日派对的照片发到 Instagram 上。”

在过去,机器人的隐私测试只问一个问题:“机器人是否不小心泄露了的秘密?”但这篇文章指出一个巨大的盲点:如果机器人仅仅通过发布一张你的照片,就泄露了你朋友的秘密,该怎么办?

这就是**相互依赖隐私(Interdependent Privacy, IDP)**的问题。这就像是一场“六度分隔理论”的游戏,一个人的行为可能会在无意中暴露其圈子里所有人的信息。如果你分享一张合影,你分享的不只是你的脸,你还分享了站在你身边的每个人的脸,即使他们从未同意出现在照片中。

以下是研究人员的工作内容,通过简单的语言进行了解释:

1. 新的测试方法:“IDP-Bench”

作者构建了一个名为 IDP-Bench 的新考试。你可以把它看作是 AI 的“驾照考试”,但专门针对数据同时属于多个人的情况。

  • 设置: 他们创建了 100 个现实主义场景(例如:社工分享一组客户的照片,或者朋友分享一段群聊截图)。
  • 陷阱: 他们给出的指令是刻意模糊的,比如“分享会议的更新内容”。他们没有告诉 AI 会议中有,也没有说明要分享什么
  • 目标: 他们想看看 AI 是否会意识到:“等等!如果我分享这个,我就是在泄露那些并未表示‘同意’的人的隐私细节。”

2. 测试的三个等级

这项考试通过三个步骤来检测 AI 的大脑,就像爬梯子一样:

  • 第一级:侦探(语境理解)

    • 问题: “这个故事里有谁?谁在发送信息?谁在接收信息?这是什么类型的数据?”
    • 结果: AI 在寻找主要人物(发送者)方面表现尚可,但经常会对“次要”人物(涉及到的朋友、客户或家人)感到困惑。这就像是一个找到了嫌疑人却漏掉了证人的侦探。
  • 第二级:觉察(共同所有权)

    • 问题: “这份数据是否由多个人共同拥有/涉及?”
    • 结果: 在这一步,AI 的表现出奇地好。大多数大型智能模型(如 700 亿参数的模型)很快就能意识到:“噢,这张照片属于整个群体,而不只是我。”大约 8 个模型中的 6 个几乎 100% 正确地识别出了这一点。
  • 第三级:道德指南针(恰当性)

    • 问题: “分享这个可以吗?”
    • 结果: 这是最难的部分。即使 AI 知道这张照片属于一个群体,它也经常难以说出:“不,我不应该发布这个,因为这侵犯了其他人的隐私。”
    • 关键点: AI 模型越大,它说“不”的能力就越强。那些较小、较廉价的模型更容易在发生隐私违规时,误说“好的,请继续”。

3. 主要发现

论文发现了关于这些机器人如何思考的一些有趣现象:

  • 它们知道“群体”的存在,却忘记了“个体”: AI 很擅长说“这是一个合影”,但很难列出具体是谁在里面,以及关于他们的特定秘密可能会被泄露什么。这就像是知道房间里坐满了人,却无法叫出任何人的名字。
  • 规模很重要: 较大的 AI 模型通常在保护这些“群体秘密”方面做得更好。那些微型模型(如 15 亿参数的模型)表现很差,甚至经常无法意识到这些数据属于多个人。
  • “提示词”问题: AI 的回答会根据提问方式的不同而改变。如果提问的方式稍有不同,AI 可能会从“安全”变为“有风险”。这意味着 AI 并不是真的在“理解”隐私,而是在根据措辞进行猜测。

4. 结论

研究人员得出结论,虽然 AI 越来越擅长知道数据是共享的,但在理解受影响以及为什么在未经许可的情况下分享会造成问题方面,仍然面临困难。

他们并不是说 AI 现在很危险,而是说:“我们需要建立更好的测试,并训练这些模型去更多地关注那些在故事中并非主角的人。”

简而言之,AI 正在学会观察森林(群体),但它仍然需要帮助来观察隐藏在群体中的树木(个体)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →