← 最新论文
📊 statistics

On the choice of using raw or demographically-corrected scores

本文认为,对于像简易精神状态检查量表(MMSE)这样的认知筛查测试,在特定条件下,原始分数在分类准确性和公平性方面可以优于经过人口统计学修正的分数,从而对常规使用人口统计学调整的做法提出了挑战。

原作者: Ignacio Gonzalez-Perez, Mats Julius Stensrud, Marco Piccininni

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Ignacio Gonzalez-Perez, Mats Julius Stensrud, Marco Piccininni

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名医生,正试图通过一个名为 MMSE 的简单测验来判断患者是否存在记忆问题(如痴呆症)。这个测验根据患者答对的问题数量给出评分。

几十年来,医生们一直在争论一个特定的问题:我们应该看患者得到的原始分数,还是应该根据他们的年龄和受教育程度对分数进行“调整”?

由 González-Pérez、Stensrud 和 Piccininni 撰写的这篇论文深入探讨了这场辩论。以下是他们研究结果的拆解,使用了简单的类比。

两种方法:原始分数 vs. “让步”系统

1. 原始分数(“未调整”法)
把原始分数想象成一名跑者完成比赛。如果一名跑者的成绩是 10 分钟,那这就是时间本身。你看着时钟并决定:“10 分钟够快到能成为冠军吗?”你并不关心他们是 20 岁还是 60 岁;你只看时间。

  • 在论文中: 这指的是原始测试分数(例如 30 分中的 24 分)。

2. 人口统计学修正分数(“让步”法)
这种方法就像高尔夫球的差点(handicap)。如果是一名年龄较大或练习较少(受教育程度较低)的选手参赛,系统会从他们的分数中扣除分数,或者给对手增加分数,以“平衡竞争环境”。其理念是:“好吧,这位 75 岁的选手答对的问题没有 25 岁的选手那么多,但这也许仅仅是因为他们年纪大了,而不是因为他们生病了。让我们调整分数,以便将他们与其他的 75 岁人群进行比较。”

  • 在论文中: 这是“z 分数”或修正后的分数,其中原始分数根据年龄和教育常模进行了数学上的平移。

重大发现:“让步”反而会损害准确性

作者们通过计算发现了一个令人惊讶的事实:有时,给每个人一个“让步”反而会让诊断变得更差,而不是更好。

他们在数学上证明了,如果年龄和教育程度是疾病本身的强有力指标,那么针对它们进行调整就像是在试图移除火灾中的烟雾,却忽略了烟雾本身就是火灾的征兆。

类比:
想象你正在试图探测森林中的火灾。

  • 原始分数: 你观察烟雾。烟雾越多 = 火灾的可能性越高。
  • 修正: 你说:“等等,这个森林在夏天通常会有烟雾。让我们根据季节来调整烟雾的读数。”
  • 问题所在: 如果火灾导致了烟雾,而季节也导致了烟雾,那么尝试在数学上“减去”季节性的烟雾,可能会不小心把火灾产生的烟雾也减去了。最终你会误以为没有火灾,而实际上火灾确实存在。

论文表明,当年龄和教育程度与痴呆症风险密切相关时,使用原始分数通常比使用修正后的分数更能准确地发现疾病。这种修正会“冲淡”疾病留下的重要线索。

“公平性”之争:让步系统更公平吗?

许多医生认为我们必须使用修正,因为这感觉更“公平”。他们担心如果不进行修正,老年人或受教育程度较低的人会仅仅因为得分较低而被不公平地贴上“患病”的标签。他们希望测试具有“人口统计学不敏感性”——即无论你是谁,测试结果都应该是一致的。

论文的反驳:
作者们同意我们追求公平,但他们认为人口统计学修正并不一定能实现人们所认为的公平。

  • 目标: 他们希望测试对所有人都有相同的“假阳性率”(即误判某人为病人的概率)。
  • 现实: 虽然修正可能会使不同群体之间的“假阳性率”趋于一致,但它们往往会破坏“真阳性率”(即正确发现病人的人数)。
  • 隐喻: 想象机场的金属探测器。
    • 原始分数: 它会对所有携带金属的人发出警报。
    • 修正: 你告诉机器:“老年人携带更多金属,所以忽略他们的警报。”
    • 结果: 你可能停止了对无辜老年人的标记(这是好事!),但你也可能开始漏掉他们实际携带的武器(这是坏事!)。论文显示,所谓的“修正后”机器并不真的对年龄“盲视”;它只是改变了它出错的方式。它并没有像人们希望的那样实现真正的“人口统计学不敏感”。

现实世界的测试:OASIS-3 研究

为了证明这不仅仅是纸面上的数学理论,作者们在一个拥有超过 1,300 人样本的真实数据集(OASIS-3)上进行了测试。

  • 他们将原始 MMSE 分数与经过年龄修正后的分数进行了对比。
  • 结果: 数据指向了原始分数更好,因为它能更有效地识别认知障碍。
  • 公平性检查: 他们还检查了修正后的分数是否真正具有“年龄不敏感性”。他们发现,事实并非如此。即使在针对年龄进行了修正后,分数仍然高度依赖于年龄,尤其是在那些真正患有疾病的人群中。

核心结论

论文得出结论:虽然针对年龄和教育进行“修正”的想法听起来很美好且公平,但在识别认知障碍的特定背景下,它往往会降低诊断的准确性。

如果你正在试图在草堆里找一根针(疾病),并且你知道随着年龄增长,草堆会变得更加“多烟”(分数降低),那么你不应该尝试在数学上移除这种“烟雾感”。你应该观察原始的烟雾,因为这些烟雾本身就是针头存在的关键线索。

简而言之:不要过度修正。有时候,原始数字讲述的是最真实的故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →