← 最新论文
📊 statistics

Lord's 'paradox' explained: the 50-year warning on the use of 'change scores' in observational data

本文通过证明由于存在截然不同的偏差,无论是变化评分比较还是基线调整后的随访比较,都无法可靠地估计观测数据中的因果效应,从而解决了洛德(Lord)长达50年的悖论,并强调了明确研究问题以及使用如g-方法等先进因果推断方法的至关重要性。

原作者: Peter W. G. Tennant, Georgia D. Tomova, Eleanor J. Murray, Kellyn F. Arnold, Matthew P. Fox, Mark S. Gilthorpe

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Peter W. G. Tennant, Georgia D. Tomova, Eleanor J. Murray, Kellyn F. Arnold, Matthew P. Fox, Mark S. Gilthorpe

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

洛德悖论(Lord's Paradox)解析:用通俗易懂的语言解释

巨大的谜团:两位统计学家,两个答案

想象一下,一所大学想要了解食堂的食物是否会导致学生体重增加,或者男孩和女孩的增重情况是否不同。他们在九月(学期开始时)和六月(学期结束时)分别称量了每个人的体重。

他们聘请了两名统计学家来分析数据。

  • 统计学家 A 观察的是体重的“变化量”。他发现,平均而言,男孩和女孩在九月的体重相同,在六月的体重也相同。他的结论是:“没有任何变化。饮食和性别都不起作用。”
  • 统计学家 B 观察的是“最终”体重,但根据初始体重进行了调整。他发现,对于初始体重相同的学生,男孩比女孩变得更重。他的结论是:“即使在起始体重相同的情况下,男孩的增重也明显高于女孩。”

这就是洛德悖论。为什么两个聪明的人在看完全相同的数据时,却得出了截然相反的结论?

论文的解决方案:这不是魔术,而是一个陷阱

本文作者认为,这并不是什么神奇的谜团。实际上,这是一个警告信号。这两位统计学家使用的统计方法在观测性数据(即人们并非被随机分配到组别中的数据,例如男孩对比女孩)中是有缺陷的

论文解释说,“变化”是一个复杂概念。要理解它,可以想象一个变量(如体重)的变化是由三种原因引起的:

  1. “习惯”因素(内生变化): 因为你的起点而自动发生的事情。如果你本来就很重,你可能会自然地保持较重,或者仅仅因为存在而增加一点重量。
  2. “噪声”因素(随机变化): 随机的波动,比如你在摇晃的秤上称重,或者由于睡眠不足导致的波动。
  3. “真实”因素(外生变化): 某种新事物产生的实际影响,比如饮食或我们正在研究的暴露因素。

目标: 我们想要测量的是“真实”因素。我们想知道:在排除掉初始体重的影响后,饮食是否真的导致了体重的变化?

为什么统计学家 A 失败了(“变化值”陷阱)

统计学家 A 使用的是变化值(Change Score)。这就像是在计算:最终体重 - 初始体重

类比: 想象你正在试图观察一株植物的生长情况。你测量植物在开始和结束时的状态,然后用结束时的数值减去开始时的数值。

  • 问题所在: 如果“暴露因素”(如性别)导致了初始体重较高,这种方法就会失效。
  • 论文的解释: 当你减去初始体重时,你无意中减去了暴露因素本身产生的影响。如果身为男孩会让你初始体重更高,而你又减去了那个初始体重,你实际上是在“抵消”掉你试图测量的东西。
  • 结果: 统计学家 A 得出了“零变化”的结果,因为数学运算把真实的效应给抵消掉了。论文指出,这种方法在观测性研究中是危险的,因为它经常会掩盖真相,甚至给出错误的答案(比如声称某种药物有效,而实际上无效,或者反之亦然)。

为什么统计学家 B 也有缺陷(“调整”陷阱)

统计学家 B 使用的是 ANCOVA(基于基线的随访分析)。这就像是在说:“让我们比较男孩和女孩,但前提是他们的初始体重必须完全相同。”

类比: 想象你正在测试一种新的肥料是否有效。你观察两株高度相同的植物。但是,你的尺子有点弯曲(测量误差)。

  • 问题所在: 在现实生活中,我们的“初始体重”测量并不完美。它们带有“噪声”(比如摇晃的秤)。
  • 论文的解释: 当你试图针对一个略有偏差的初始测量值进行调整时,数学计算就会变得混乱。这种方法往往会高估效应。看起来男孩增加的体重比实际更多,是因为初始测量中的“噪声”破坏了调整过程。
  • 结果: 统计学家 B 发现了一个巨大的差异,但论文指出,由于测量误差和其他隐藏因素(如运动习惯)未被考虑在内,这个差异可能被夸大了。

结论:一个持续 50 年的警告

论文得出结论:对于观测性数据,这两种方法都不完美。

  • 变化值法(Change Scores)(统计学家 A)倾向于低估或掩盖效应,特别是当暴露因素影响初始点时。
  • 调整法(Adjustment Methods)(统计学家 B)由于测量误差和隐藏的混杂因素,倾向于高估效应。

“完美”的情况:
论文指出,如果这是一个随机对照试验(例如人们被随机分配到不同组别的药物试验),两种方法都能正常工作并得出相同的答案。只有在“观测性”环境下(即组别如男孩与女孩是预先存在的且存在初始差异),才会出现这种悖论。

给所有人的启示

这个持续了 50 年的谜题给出的主要教训是:在处理现实世界的数据时,分析“变化”要非常小心。

  1. 明确定义你的问题: 你到底想要测量什么?
  2. 不要迷信简单的减法: 如果各组的起始点不同,仅仅通过“前后相减”往往会产生误导。
  3. 不要迷信简单的调整: 如果你的测量不精确,或者存在影响结果的隐藏因素(如运动习惯),仅仅通过“调整”初始值并不是万能的解决方法。

论文并没有为所有情况提供一个“万能钥匙”,但它向科学家们发出警告:我们在观察“变化”时最常用的两种方法往往会产生相反方向的偏差,从而导致我们看到的这种令人困惑的“悖论”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →