← 最新论文
💬 NLP

Preferred, Not Safer: Pairwise Preference Is a Poor Proxy for Clinical Safety

本文表明,临床医生的成对偏好是大型语言模型临床安全性不可靠的代理指标,因为排名较高的模型仍可能表现出显著的安全关键型故障,因此有必要采用直接报告故障率并结合临床依据进行准则调整的评估实践。

原作者: Fay Elhassan, David Sasu, Alexandra Kulinkina, Lars Henning Klein, Mary-Anne Hartley

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Fay Elhassan, David Sasu, Alexandra Kulinkina, Lars Henning Klein, Mary-Anne Hartley

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图为一家新的医院食堂挑选最优秀的厨师。你有一份著名厨师的名录,于是你请了一群医生来对他们的菜肴进行品鉴。医生们投票选出哪盘菜看起来最诱人、吃起来味道最好。自然而然地,你会假设那个获得最多票数的厨师就是最安全、最可靠的人选。但如果那道“看起来最棒”的菜其实是用过期食材做的呢?或者那位最“自信”的厨师其实只是非常擅长在端菜时谈论自己的食物,而端出的却是危险的东西呢?这就是大语言模型(LLMs)——这些超级智能的计算机程序,可以像人类一样写作、聊天和解决问题——所处的复杂世界。科学家使用成对偏好(询问专家选“A还是B”)来确定哪个AI是“最好的”。但在医疗等高风险领域,“最受欢迎”并不一定意味着“最安全”。如果一个AI给出了错误的医疗答案,但它的表达方式非常有风格,它可能会赢得选票,即便这可能会伤害病人。这篇论文提出了一个关键问题:当医生们挑选他们最喜欢的AI时,他们选出的真的是那个不会犯危险错误的人吗?

来自瑞士LiGHT实验室的研究人员决定通过一个名为MOOVE(大规模在线验证与评估)的大型平台来测试这一假设。他们召集了来自28个国家的736多名医生担任评委。这些医生观察了13种不同的AI模型,并必须在盲测(成对偏好)中选择哪个回答更好。但这里有一个转折:在投票的同时,医生们还为每个回答给出了严格的安全评分,就像一份从 -2(非常危险)到 +2(非常安全)不等的成绩单。他们检查了两项具体指标:无害性(AI是否提出了任何风险建议?)和准确性(医学事实是否正确?)。

结果令人震惊。研究发现,那些赢得最多“人气票”的AI模型,往往也是那些危险错误率最高的模型。这就像一个学生因为字迹工整且表现自信而获得了A,却因为算错了数字而在数学考试中不及格。事实上,研究人员发现,本研究中排名第一的模型(GPT-OSS)具有 18.0% 的无害性失败率,这意味着它给出的每五个回答中就有一个可能是不安全的。与此同时,数据集中一个更谨慎、没那么“华丽”的模型失败率要低得多,仅为 7.2%,但在人气竞赛中的排名却低得多。研究指出,由于这些模型是在不同类型的医学问题上进行测试的,我们不能说其中一个严格来说比另一个“更好”,但这种差距凸显了一个至关重要的警告:人们“喜欢”的程度最高的模型,并不一定是那些拥有最安全记录的模型。研究表明,医生经常被表面特征所迷惑:那些写得更长、更详细、听起来更自信的AI赢得了选票,即便这些回答在医学上是错误或有风险的。

研究人员进行了更深入的调查,以了解为什么会发生这种情况。他们发现,“安全信号”(实际的医学正确性)往往被“风格信号”(文本的长度和清晰度)所淹没。在他们的分析中,回答的长度和清晰度对医生为何选择某个获胜者的解释力,略高于回答本身的安全性。这就像评委们在投票给那个写了最长菜单描述的厨师,却忽略了汤已经凉了的事实。

更令人担忧的是,研究显示这些风险并非均匀分布,而是集中在特定的“禁区”。例如,当AI尝试读取心电图(ECG)图像时,它的失败率高达惊人的 89.9%。而在其他领域,如普通外科,它的表现几乎完美。这意味着,一个仅仅标榜“模型X是第一名”的全球性“排行榜”是危险的,因为它掩盖了模型X在特定关键情况下可能表现糟糕的事实。

为了解决这个问题,作者提出了一种新的模型排名方法。他们建议使用安全调整后的排行榜,而不是仅仅计算谁赢得了最多的选票。该系统会获取人气投票,然后根据严格的安全评分进行核查。如果一个AI赢得了选票但给出了危险的答案,它的排名就会被降低。当他们应用这一修正方案时,排名发生了剧烈变化。一些此前处于底部的模型因为实际上更安全而跃升至前列,而那些“华丽”的获胜者则跌落了下来。

论文总结道,我们不能依靠“人气竞赛”来告诉我们一个AI是否适用于医疗用途。仅仅因为一个AI听起来不错或看起来聪明,并不意味着它是可靠的。研究人员建议,我们不应寻找单一的“最佳”模型,而需要关注具体的失败率,并诚实地说明AI可能在哪里失效。他们警告说,依赖简单的偏好得分就像是因为飞行员声音平稳就雇佣他,却不去检查他是否真的会开飞机。在医疗AI的世界里,最受喜爱并不等于最安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →