← 最新论文
🤖 AI

Expert Evaluation and the Limits of Human Feedback in Mental Health AI Safety Testing

本文表明,在心理健康人工智能安全测试中,专家人类反馈呈现出系统性且合乎原则的分歧,而非随机误差,这挑战了存在有效真实基准的假设,并表明关乎安全的人工智能评估必须从基于共识的聚合转向能够保留多元专业视角的方法。

原作者: Kiana Jafari, Paul Ulrich Nikolaus Rust, Duncan Eddy, Robbie Fraser, Nina Vasan, Darja Djordjevic, Akanksha Dadlani, Max Lamparth, Eugenia Kim, Mykel Kochenderfer

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Kiana Jafari, Paul Ulrich Nikolaus Rust, Duncan Eddy, Robbie Fraser, Nina Vasan, Darja Djordjevic, Akanksha Dadlani, Max Lamparth, Eugenia Kim, Mykel Kochenderfer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创造性类比对这篇论文的解读。

核心理念:“专家共识”的神话

想象一下,你正在教机器人如何成为一名乐于助人的治疗师。标准做法是请人类专家(精神科医生)给机器人的回答打分。如果专家们一致认为某个回答是“好”的,机器人就会学习多做这类回答;如果他们说回答是“坏”的,机器人就会学习避免这类回答。

这篇论文提出了一个简单却令人不安的问题:如果专家们无法达成一致怎么办?

研究人员在高风险的心理健康领域测试了这一点。他们聘请了三位持牌认证的精神科医生,对 360 个不同的人工智能生成的心理健康问题回答进行评分。他们原本预期专家们会基本达成一致,因为他们都毕业于相同的学校,并遵循相同的医疗规范。

结果: 专家们几乎无法达成一致。事实上,他们的分歧之大,在几乎任何其他科学领域都会被认定为“不可靠”。

类比:三位评委

为了理解发生了什么,想象一场烹饪比赛,有三位评委:

  1. 安全评委:只关心食物是否有毒。只要无毒,即使吃起来像纸板,他们也会给五星好评。
  2. 互动评委:关心食物是否美味,能否让人想继续吃。如果食物安全但乏味,他们只给两星。
  3. 文化评委:关心食物是否尊重用餐者的背景和饮食限制。如果食物忽视了文化背景,即使安全且美味,他们也会给一星。

在这项研究中,三位精神科医生就像这三位评委。他们并非犯了错误或误读了指示,而是看着同一个人工智能回答,却看到了完全不同的东西,因为他们对“什么是好的回答”持有不同的“理念”。

关键发现

1. “安全”悖论
你可能会认为,在自杀或自残等危险话题上,专家们的意见最一致。但你错了。

  • 论文主张: 专家们在最危险的话题(自杀和自残)上分歧最大。
  • 类比: 想象一次消防演习。一位专家想:“别惊慌,慢慢走出去。”另一位想:“立刻跑!”第三位想:“先打 911。”他们都想挽救生命,但在如何做到这一点上想法不同。由于风险极高,他们的分歧变得巨大。

2. “噪音”实际上是“信号”
在训练人工智能系统时,通常会取所有专家分数的平均值。如果评委 A 打了 5 分,评委 C 打了 1 分,人工智能就会学习得到一个"3 分”。

  • 论文主张: 这种平均过程是有缺陷的。它创造了一个“折中”的回答,实际上并不反映任何一位真实专家的意见。这就像把红色颜料和蓝色颜料混合成紫色,然后告诉艺术家:“这是你天空的完美颜色”,而实际上没有任何一位艺术家想要紫色。
  • 结果: 人工智能学习到的是一种“中间立场”,这可能在治疗上毫无用处,因为它忽略了每位专家给出分数的具体且合理的理由。

3. “界限”问题
专家们在人工智能是否应该明确声明“我是机器人,不是医生”这一问题上分歧最大。

  • 论文主张: 一位专家(专家 C)极其严格,几乎给所有回答都打了不及格,因为人工智能没有明确说明“我不是人类”。另一位专家(专家 A)则认为,只要人工智能建议稍后去看真正的医生就可以了。
  • 类比: 这就像老师批改学生的论文。一位老师因为学生没有在顶部写名字而给不及格;另一位老师因为论文精彩而给 A。如果你取这些成绩的平均值,会得到一个 B,这对学生没有任何有用的指导意义。

这对人工智能为何重要

论文认为,我们不能简单地通过“平均”人类分歧来寻找“真相”。

  • 问题所在: 在心理健康领域,不存在像验血那样可以测量的单一“正确答案”。对一个人有益的东西,对另一个人可能是有害的。
  • 后果: 如果我们通过平均这些相互冲突的专家意见来训练人工智能,我们并不是在教人工智能变得安全或有帮助,而是在教它成为一个可能不符合任何人需求的困惑的“中间派”。

论文的建议

作者们并没有说我们应该停止使用专家。相反,他们建议改变使用专家的方式:

  1. 停止假装大家意见一致: 我们需要承认专家拥有不同但有效的理念。
  2. 不要仅仅平均: 与其平均分数,不如将分数分开保留,并告诉人工智能:“专家 A 认为这是安全的,但专家 B 认为这是有风险的。”
  3. 将分歧作为警示信号: 如果专家们对某个答案争论不休,这就表明人工智能需要人类介入,在向真实的人展示之前进行检查。

总结

这篇论文是一次现实检验。它表明,即使是受过高度训练的专家,也无法就什么是“好的”心理健康回答达成一致。由于他们的分歧如此之大,目前通过平均专家意见来训练人工智能的方法存在缺陷。我们原本以为可以忽略的“噪音”,实际上是对如何关怀人们这一问题的深刻、原则性的分歧,我们需要新的方法来处理这种复杂性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →