PrivAct: Internalizing Contextual Privacy Preservation via Multi-Agent Preference Training
PrivAct 是一个多智能体偏好训练框架,它将上下文隐私保护内化于大语言模型智能体的生成行为中,在不依赖脆弱的外部干预的情况下,有效地减少信息泄露,同时保持了帮助性并能在多种场景下实现泛化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字时代,人工智能已从简单的问答工具演变为能够处理复杂任务(如起草电子邮件、管理日程或处理个人数据)的高级助手。这些被称为“智能体”(agents)的系统旨在代表用户采取行动,并根据其掌握的信息做出决策。然而,当这些智能体在隐私取决于语境的情况下运行时,会出现一个微妙且危险的问题。与密码或社会安全号码这种明确的隐私不同,我们的许多敏感信息之所以具有隐私性,是因为所处的环境。医生了解患者的病史是恰当的;但如果同一位医生将这些细节分享给邻居,则是对隐私的侵犯。这种被称为“语境完整性”(contextical integrity)的概念意味着,信息的性质并非天生秘密或公开,而是完全取决于参与者是谁、正在发生什么以及规范该特定时刻的社会准则。随着人工智能智能体日益融入我们的日常生活,风险在于它们可能会无意中泄露这些具有语境敏感性的细节,这并非因为它们被黑客攻击,而是因为它们根本不理解情境中那些不成文的规则。
杜克大学和佛罗里达大学的研究人员开发出一种新方法来解决这一问题,他们不再通过为人工智能系统添加外部防护栏,而是转而教导系统从内部理解隐私。在研究中,他们观察到目前保护隐私的方法通常依赖于外部检查,例如在提示词中加入特殊指令,或使用另一个人工智能在输出发送前进行审查。虽然这些方法有效,但它们很脆弱,且往往要求人工智能以一种实际上会在推理过程中暴露敏感信息的方式去显式地思考隐私问题。研究人员提出了另一条路径:训练人工智能智能体将这些隐私规范内化,使保护隐私成为其生成响应时的自然组成部分,而非一个必须被提醒才能执行的独立步骤。
为了实现这一目标,该团队创建了一个名为 PrivAct 的训练框架,该框架利用多智能体系统来教导人工智能如何在保持有用性与保持谨慎之间取得平衡。他们没有依赖单一模型来解决所有问题,而是建立了一个小型的人工智能智能体团队协同工作。一个智能体生成响应,第二个智能体针对隐私违规进行批判,第三个智能体根据批判意见优化输出。至关重要的是,研究人员设计了一套奖励机制,鼓励智能体从这种协作中学习。当最终输出既有用又没有隐私泄露时,整个团队都会获得奖励。如果发生哪怕是微小的泄露,系统也会施加严厉的惩罚,以防止人工智能认为它可以牺牲一点隐私来换取大量的实用性。这种训练过程迫使人工智能明白,成为真正有用的唯一途径就是完全尊重语境。
这些训练结果在包括健康信息、财务数据和民权在内的多种不同人工智能模型和场景中进行了测试。研究人员发现,该方法显著降低了敏感信息意外泄露的概率。在实验中,与现有方法相比,新方法在保持相同水平的有用性的同时,将隐私泄露率降低了高达 12.32%。这是一个显著的进步,因为许多之前的技术被迫在安全性与实用性之间做出选择;而新方法证明了人工智能可以两者兼得。此外,这种训练具有鲁棒性。在某组任务上接受训练的人工智能智能体能够将学到的知识应用到完全不同的场景中,而无需额外指令,这表明它们真正理解了语境隐私的底层原则,而非仅仅记住了特定的规则。
该研究还强调了旧方法的局限性。研究人员证明,依赖外部检查的方法在情况变得复杂或人工智能被要求逐步推理问题时往往会失效,因为推理过程本身可能成为泄露的来源。相比之下,这种内化方法教导模型直接生成安全的响应。在一个涉及牧师与信徒的具体测试案例中,一个标准的 AI 模型在试图回答一个一般性问题时,无意中透露了第三方的机密情况。然而,经过新方法训练的模型成功理解了对话的边界,并提供了一个完全省略了敏感细节的有益响应。这表明人工智能已经学会了识别情境中的社会规范并据此行动。
尽管这项技术展现出了前景,但研究人员指出它并非适用于所有情况的完美解决方案。该方法需要对模型进行微调,而对于无法修改的闭源系统来说,这可能非常困难。此外,研究重点关注了特定类型的隐私风险,现实世界的部署可能需要将这种内部训练与其他安全措施相结合。尽管如此,这项工作代表了我们思考人工智能安全方式的一次重大转变。研究人员展示了,与其在人工智能周围筑起围墙以防止其犯错,不如教导人工智能去理解它所处的景观,从而确保它能像理解任务本身一样,自然地尊重隐私的隐形边界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。