← 最新论文
💬 NLP

SHARP: Social Harm Analysis via Risk Profiles for Measuring Inequities in Large Language Models

本文介绍了 SHARP,这是一个多维且具备分布感知能力的评估框架,它超越了标量平均值,通过使用风险剖面和如 CVaR 等尾部敏感指标来衡量大型语言模型的社会危害,从而揭示了传统基准测试所掩盖的显著隐藏不平等和最坏情况下的失效。

原作者: Alok Abhishek, Tushar Bandopadhyay, Lisa Erickson

发布于 2026-01-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Alok Abhishek, Tushar Bandopadhyay, Lisa Erickson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:为什么“平均值”会骗人?

想象一下你正在买车。销售员告诉你:“这辆车的平均时速是 60 英里。”这听起来很棒,对吧?

但如果这个“平均值”隐藏了一个秘密呢?如果这辆车通常以 10 英里的时速行驶,但偶尔会无缘无故地突然加速到 200 英里并发生车祸呢?它的平均时速仍然是 60,但那种最坏的情况却极其恐怖。

这正是这篇论文所指出的大型语言模型(LLM)现状。目前的测试大多关注 AI 的“平均”表现。它们给出一个单一的数值(标量分数)来表示一个 AI 有多“安全”或多“公平”。作者认为这是危险的,因为这掩盖了在招聘、医疗或司法等高风险场景中可能导致真实伤害的罕见且严重的失败。

解决方案:SHARP(AI 的“天气预报”)

作者引入了一个名为 SHARP 的新框架。SHARP 不再问“这个 AI 的平均表现如何?”,而是问:“这个 AI 最坏的情况会是什么样,以及这种情况发生的频率有多高?”

不要把 SHARP 看作是一份只有单一等级的成绩单,而要把它看作是一场风暴的天气预报

  • 旧方法: “今天的平均风速是 10 英里/小时。”(安全、枯燥,却忽略了飓风)。
  • SHARP 方法: “虽然平均风速是 10 英里/小时,但有 5% 的概率会出现 100 英里/小时的阵风,可能会吹倒树木。”

SHARP 如何运作:四个“危险区域”

论文将“伤害”细分为四个特定的类别,就像宇宙飞船上的四个不同传感器一样:

  1. 偏见 (Bias): AI 是否对某些群体存在歧视?
  2. 公平性 (Fairness): 它在回答中是否对待人们不平等?
  3. 伦理 (Ethics): 它是否在说一些在道德上错误的话?
  4. 认识可靠性 (Epistemic Reliability): 它是否在撒谎或编造事实(幻觉)?

SHARP 没有将这些全部混合成一个大的“安全性”数字,而是分别测量它们。这就像是分别检查引擎、刹车和轮胎,而不是仅仅说“这辆车 80% 很好”。

核心秘诀:观察“尾部”

SHARP 最重要的部分是一个叫做 CVaR95(条件风险价值)的指标。

  • 类比: 想象有一排 100 个人。
    • 平均风险: 你观察每个人的身高并找到平均值。
    • SHARP (CVaR95): 你忽略前 95 个人。你只看最高的 5 个人(即“尾部”)。然后,你计算仅针对这 5 个人的平均身高。

为什么要这样做?因为在高风险的 AI 应用中,“最高的 5 个人”(最差的 5% 的回答)才是导致灾难的原因。如果一个 AI 通常很有礼貌,但偶尔会发表仇恨言论,那么它的“平均值”看起来很好,但其“尾部”看起来却很危险。SHARP 完全专注于那个危险的尾部。

他们的发现:“隐藏”的危险

作者测试了 11 个目前最顶尖的 AI 模型。以下是 SHARP 揭示了传统测试所忽略的内容:

  1. “双胞胎”错觉: 两个 AI 模型可能拥有完全相同的“平均”安全性得分。但当你观察它们最差的 5% 的回答时,一个可能只是略有风险,而另一个则可能糟糕 3 到 4 倍。在标准的报告单上它们看起来一模一样,但在危机时刻,它们却截然不同。
  2. 不同的缺陷: 有些模型在公平性方面做得很好,但在避免撒谎(幻觉)方面表现很差。另一些模型在不撒谎方面做得很好,但在偏见方面表现很差。你不能简单地说“模型 A 比模型 B 好”,你必须说“模型 A 在这种特定风险方面更安全,但模型 B 在那种风险方面更安全”。
  3. 偏见是最严重的: 在所有模型中,“尾部”(最坏的情况)最常由偏见引起。当情况变得非常糟糕时,通常是因为 AI 产生了偏见。

结论:停止依赖平均值

论文得出结论,我们不能再把 AI 安全性视为一个只有一个答案的简单数学问题。

  • 旧方法: “这个 AI 有 90% 的安全性。”(太简单了,掩盖了危险)。
  • SHARP 方法: “这个 AI 通常是安全的,但在最坏的 5% 的情况下,它会在偏见和撒谎方面出现严重失败。”

通过使用 SHARP,监管机构和公司可以做出更好的决策。与其选择那个拥有最高“平均”得分的 AI,不如选择那个拥有最安全的最坏情况场景的 AI。这就像是买车时,不是根据最高时速来买,而是根据刹车在紧急情况下的表现来买。

简而言之: SHARP 是一个新工具,它让我们不再被“良好的平均值”所蒙蔽,并迫使我们去关注那些真正重要的、可怕且罕见的错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →