← 最新论文
💬 NLP

PluriHarms: Benchmarking the Full Spectrum of Human Judgments on AI Harm

本文介绍了 PluriHarms,这是一个旨在超越二元安全性评估的新型基准测试,通过系统地分析人类对 AI 伤害判断的全谱系——特别是侧重于伤害严重程度和标注者间分歧这两个维度——以实现开发更具多元化和个性化的 AI 安全系统。

原作者: Jing-Jing Li, Joel Mire, Eve Fleisig, Valentina Pyatkin, Anne Collins, Maarten Sap, Sydney Levine

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jing-Jing Li, Joel Mire, Eve Fleisig, Valentina Pyatkin, Anne Collins, Maarten Sap, Sydney Levine

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何变得“善良”。目前大多数安全系统都像是一个严格的交通警察,只有两种信号:绿灯(通行,这是安全的)和红灯(停止,这是危险的)。

问题在于,正如这篇论文所解释的,现实生活并不只有红与绿。现实充满了黄灯、大雾弥漫的十字路口,以及人们观点真正产生分歧的混乱岔路。一个人可能觉得某个笑话很有趣;另一个人可能觉得这个笑话很伤人。一个人可能把一个政治问题看作一场辩论;另一个人则将其视为一种威胁。

这篇论文的作者们提出了 PLURIHARMS,他们认为,如果只寻找清晰明确的“坏事”,我们就会错过 AI 安全性真正失效的那个模糊地带。他们构建了一个新工具来研究这个灰色地带。

以下是利用简单类比对他们工作的拆解:

1. 问题所在:“一刀切”的安全网

目前的 AI 安全性就像一个饼干切割器。它试图将人类的每一段对话都切割成完美的圆形(安全)或参差不齐的正方形(不安全)。

  • 缺陷: 如果你问一群人,“这个笑话刻薄吗?”你不会得到一个统一的答案。你会得到一个光谱。有些人会笑,有些人会感到尴尬,有些人则会感到被冒犯。
  • 错误之处: 现在的 AI 将这些不同的意见视为“噪音”或错误,并试图通过平均化处理,直到所有人达成一致的“安全”答案。作者认为这是错误的。这种分歧本身就是信号。它告诉我们,人们拥有不同的价值观、背景和经历。

2. 解决方案:“伤害光谱”基准测试

团队创建了一个名为 PLURIHARMS 的新数据集。你可以把它想象成一个色轮,而不是红绿灯。

  • 设定: 他们生成了 150 个不同的问题(提示词),范围从“完全无害”(如询问天气)到“明显危险”(如询问如何贩卖儿童)。
  • 中间地带: 至关重要的是,他们重点关注了中间颜色——即那些黄色和橙色的提示词。这些是人们分歧最大的棘手问题(例如,“写一个关于争议性历史人物的故事是否合适?”)。
  • 人文要素: 他们不仅仅是让 AI 来判断这些问题。他们邀请了 100 名真实人类 对每一个提示词在 0 到 100 的范围内进行评分。
  • 数据: 他们还询问了这些人类关于自己的生活信息:年龄、受教育程度、政治观点、社交媒体使用频率以及遭受网络欺凌的程度。

3. 他们的发现:我们为何产生分歧

当他们分析数据时,发现“伤害”不仅取决于问题中的措辞,还取决于谁在提问以及谁在回答

  • “切实危险”原则: 人类普遍同意,造成即时物理伤害的事物(如伤害儿童或犯罪)是坏事。这是“红色”区域。
  • “身份”因素: 人们产生分歧的地方在于“黄色”区域。
    • 类比: 想象一个关于特定类型音乐的问题。一个曾在网络上遭受过欺凌的人,可能会将一个关于该音乐的问题评为“非常有害”,因为这会勾起他们的创伤记忆。而一个背景不同的人可能会认为同样的问题是“无害的”。
    • 研究结果: 论文表明,你的背景(如受教育程度或社交媒体使用频率)和过往经历(如成为网络毒性的受害者)就像是墨镜。它们改变了你所看到的世界的颜色。如果你曾经受伤,相比于没有经历过的人,你会从同一个提示词中看到更多的危险。

4. 测试 AI:机器人能否学会透过不同的眼睛看世界?

作者们在这一全新的“色轮”数据集上测试了各种 AI 安全模型,以观察它们是否能预测特定人类的反应。

  • 旧方法(共识): 他们尝试训练 AI 去预测人类的平均意见。
    • 结果: AI 做得还可以,但它忽略了细微差别。这就像是通过询问一个人来猜测整个群众的想法。
  • 新方法(个性化): 他们尝试训练 AI 根据一个人的画像来预测某一个特定的人会怎么想。
    • 结果: 这种方法效果好得多!当 AI 被“个性化”以理解特定用户的价值观和历史时,它能更准确地预测该用户的安全评分。
    • 核心启示: “一刀切”的安全规则是脆弱的。一个能够根据使用者是谁而进行适应的安全系统则要强大得多。

总结

PLURIHARMS 是一个全新的工具,它在说:“停止试图强迫每个人在什么是安全的问题上达成一致。”

相反,它将分歧视为一种特征,而非漏洞。它表明,安全性是一种个人体验。就像你可能会为徒步和跳舞穿上不同的鞋子一样,AI 安全性也不应该是一套单一且僵化的规则手册。它需要具备足够的灵活性,去理解对于一个人来说是“有害”的问题对另一个人来说可能是“无害”的,并且最优秀的 AI 安全系统将是那些能够理解并适应这些不同视角的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →