CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment
本文介绍了 CIDER,这是一个源自人类标注的大规模上下文披露边界数据集,旨在通过推理时个性化来评估并提升大语言模型与细微且个性化的隐私偏好之间的对齐。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何成为一个好朋友。你不会只给它一本厚厚的规则手册,上面写着“不要泄露秘密”。那太模糊了。如果你告诉机器人“不要谈论我的生日”,当你在一个大家都在大声欢呼的惊喜派对上时,它可能会感到困惑。但如果你是在一个与陌生人共进的安静晚餐上,同一个秘密应当被紧紧锁住。这就是隐私这个复杂的世界。它不仅仅是一堵写着“禁止入内”的墙;它更像是一组隐形的、移动的门,会根据站在那里的人是谁、天气如何以及你有多信任他们而开启或关闭。
科学家们早就知道,计算机在遵循通用规则方面做得越来越好,比如“不要向陌生人分享医疗记录”。但了解通用规则与理解你个人的特定感受之间存在着差距。你可能是一个喜欢分享午餐照片,但如果有人提到你的薪水就会感到紧张的人。另一个人可能恰恰相反。研究人员试图解决的核心问题是:我们能否教会人工智能理解这些独特的、个人的“隐私边界”,这样它才不会在你想要保持温暖的时候,不小心把你的茶给洒了?
于是有了 CIDER,这是一项新的研究,它就像是一个为人工智能学习这些个人秘密而设立的大型训练营。研究人员收集了 169 名真实的人,并问了他们一个简单但棘手的问题:“如果我以这九种不同的方式讲述关于你的故事,你可以接受吗?”他们每次都稍微改变故事的内容——有时使用你的全名,有时只说“一位朋友”,有时提供每一个微小的细节,有时则保持模糊。他们发现,人们的回答并不是随机的;他们有特定的模式。有些人可以接受模糊的细节,但讨厌使用他们的名字。另一些人可能不在意名字,但会对过于细致的细节感到惊恐。
随后,团队利用这些数据测试了 12 种不同的 AI 模型,要求它们根据一个人过去的抉择,来猜测这个人接下来的反应。这就像是在玩一场“猜规则”的游戏,AI 必须观察你过去的抉择,并弄清楚你个人的隐私风格。结果喜忧参半。最强大、最聪明的 AI 模型(如来自 Anthropic 和 OpenAI 的模型)表现得非常出色。当它们仅获得六个关于一个人过去选择的例子时,它们预测该人未来选择的准确度显著提高——比没有任何历史记录时高出多达 11.41 个百分点。这些聪明的模型似乎理解了情境的“氛围”,而不仅仅是文字本身。
然而,研究也发现并非所有的 AI 都一样优秀。较小、较简单的模型往往依赖于僵化的捷径。它们学会了诸如“如果出现了名字,就说‘不’”或“如果细节太多,就说‘不’”之类的规则,而没有真正理解其中的细微差别。它们就像是那些背下了答案解析却没理解课程内容的优等生。此外,虽然聪明的模型变得更擅长猜测,但它们有时也会在错误的方向上变得过于自信。它们可能会在应该说“不”的时候停止说“不”,或者在不该说“是”的时候说“是”,从而造成一种新的失衡。只有 Claude Sonnet 4.6 一个模型成功地在提高准确度的同时,没有破坏其误差平衡。
最后,CIDER 表明,我们正越来越接近能够真正尊重我们个人隐私的 AI,但这还不是一个已解决的问题。最好的 AI 不仅需要大量的数据,还需要理解我们选择背后微妙的人类语境的能力。这提醒我们,隐私不仅仅是隐藏信息;它关乎于明确知道你在与谁分享,而 AI 也需要像我们一样学会这种舞步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。