← 最新论文
💻 computer science

Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring

本文揭示,尽管前沿多模态大语言模型在序数量表上对临床图像的评分具有竞争力,但它们表现出系统性的中心趋势偏差,将预测值压缩至量表中间,从而在高低极端引发关键性错误,因此在部署于高风险临床筛查前必须进行校准。

原作者: Jiaqing Zhang, Sandeep Elluri, Bhanu Cherukuvada, Yonah Joffe, Jessica Sena, Miguel Contreras, Scott Siegel, Subhash Nerella, Catherine Price, Parisa Rashidi

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaqing Zhang, Sandeep Elluri, Bhanu Cherukuvada, Yonah Joffe, Jessica Sena, Miguel Contreras, Scott Siegel, Subhash Nerella, Catherine Price, Parisa Rashidi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个全新的、极其聪明的机器人助手。你想用它来批改学生画的时钟——这是医生用来检查记忆或思维问题的常见测试。测试很简单:画一个显示 11:10 的时钟。医生根据这些画作打分,范围从 0 分(一团糟)到 5 分(完美)。

本文的研究人员提出了一个问题:这个机器人助手能否像人类医生或专用计算机程序一样批改这些画作?

以下是他们发现的简要说明:

1. 机器人“过于保守”

这个机器人(一种称为多模态大语言模型的高级人工智能)非常擅长观察图片并理解所见内容。然而,在打分时,它有一个奇怪的习性:它拒绝给出极端分数。

把评分量表想象成收音机上的音量旋钮,从 0(静音)到 5(最大音量)。

  • 人类/计算机专家: 如果画作很糟糕,他们会自信地将旋钮转到 0;如果画作完美,他们会转到 5。
  • 机器人: 即使画作很糟糕,机器人也犹豫是否给 0 分。它会想:“也许没那么糟吧”,于是给了 1 分。当画作完美时,它又犹豫是否给 5 分,心想:“也许还没那么完美”,于是给了 4 分。

机器人总是将分数拉向中间(2 分或 3 分)。这就像一位老师害怕给任何人打"A"或"F",所以为了保险起见,只给每个人都打"B"或"C"。

2. “平均”分数掩盖了问题

如果你只看机器人的整体平均分数,看起来相当不错。它通常与人类分数“足够接近”(相差在一分以内)。

研究人员将这种情况比作天气预报。如果预报每天都说“气温将是 70 度”,而实际温度有时是 60 度,有时是 80 度,那么平均误差很小。但如果你需要知道是否会下雨(一种特定的极端情况),那这份预报就毫无用处。

同样,机器人的“保守”中间分数在纸面上看起来不错,但它们在最关键的案例中却失败了:

  • 危险: 如果患者的画作非常糟糕(0 分或 1 分),机器人可能会说是 2 分。这可能意味着患病者被漏诊,无法获得所需的帮助。
  • 困惑: 如果患者的画作完美(5 分),机器人可能会说是 4 分。这可能导致健康的人产生不必要的担忧或接受额外的检查。

3. 尝试修复机器人并未奏效

研究人员试图通过让机器人在开始评分前观看糟糕和优秀画作的示例,“教导”它变得更加自信(这被称为“少样本提示”)。

  • 结果: 它略有改善,但仍然拒绝给出极端分数。它依然过于谨慎。

他们还尝试从指令中移除所有医学术语,要求机器人只给“艺术作品”打分,而不是给“医学测试”打分。

  • 结果: 这实际上让机器人表现更差。事实证明,医学背景有助于机器人理解任务,但即使有了这种帮助,它仍然不愿给出极端分数。

4. 专用计算机胜出

研究人员还测试了一个专用计算机程序(深度学习模型),该程序专门针对数千张此类时钟画作进行了训练。

  • 结果: 这个专用计算机没有“保守”问题。它自信地给糟糕的画作打 0 分,给优秀的画作打 5 分。它在最关键的极端情况下的准确性要高得多。

结论

该论文得出结论,虽然这些花哨的 AI 机器人令人印象深刻,并且能够“接近”正确答案,但它们天生具有向中间值倾斜的偏见。它们就像一个紧张的学生,害怕举手说“我知道答案”或“我不知道答案”,所以只是猜测中间值。

因此,研究人员表示,我们不应单独使用这些机器人对患者健康筛查做出最终决定。由于它们过于害怕给出极端判断,因此极有可能漏掉最关键的案例(非常糟糕或非常好的情况)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →