The anatomy of regression-to-the-mean in simulated epilepsy trials
通过对癫痫患者进行大规模模拟,本研究表明回归均值现象可以通过不同的机制——包括一过性病情加重、更严格的入组标准、测量灵敏度降低以及假警报——人为地夸大表观安慰剂效应,从而为改进临床试验设计和解释终点指标提供关键见解。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正试图弄清楚一把崭新的、高级的雨伞是否真的比你那把破旧的旧伞更能挡雨。为了测试这一点,你决定测量自己会被淋湿到什么程度。但问题在于,你只在一年中最糟糕、最猛烈的暴雨中开始你的测试。自然而然地,接下来的一个小时雨势可能会减小,仅仅是因为这场风暴正在过去。如果你将第一个小时的“极度潮湿”与第二个小时的“仅是潮湿”进行对比,看起来就像你的新雨伞是个奇迹,即便它其实并没有表现出任何特别之处。在科学中,这种思维陷阱被称为“回归平均值”(regression to the mean)。每当我们根据一个极端时刻(比如糟糕的一天)来挑选一组人或物,然后观察它们随后的情况时,这种情况就会发生;它们几乎总是会向其正常的、平均的状态漂移。这在医学领域非常重要,尤其是在像癫痫这类发作具有周期性波动的疾病中。如果临床试验只在患者经历“癫痫风暴”时选取他们,那么随后的好转可能仅仅是因为风暴平息了,而不是药物起到了作用。科学家需要分辨出什么是真正的疗效,什么是统计学上的幻觉,以避免在实际上毫无帮助的治疗上浪费时间和金力。
丹尼尔·戈尔登霍尔茨(Daniel Goldenholz)及其团队的这篇论文就像一个巨大的数字实验室,他们构建了一百万个虚构患者,以观察这种“统计学幻觉”究竟是如何运作的。他们没有测试真人;相反,他们使用了一个名为 CHOCOLATES 的计算机程序,模拟了 1,000,000 名拥有 36 个月每日癫痫记录的患者。随后,他们进行了一场模拟实验:他们挑选了在两个月的“基线期”内癫痫发作次数较高的患者,并在不给予任何实际药物的情况下观察接下来的三个月里会发生什么。目标是观察仅仅通过偶然因素会产生多少“改善”。
研究人员发现,这些试验中观察到的“安慰剂效应改善”并不只是单一的原因;它实际上是三种不同的诡计戴着同一副面具。他们称之为类型 1、类型 2 和类型 3。
类型 1 就像是一种暂时的坏情绪。想象一下,一位患者平时每月只有几次癫痫发作,但在两个月内,由于生病或压力,他们的癫痫发作频率激增。如果试验恰好在这次激增期间选中了他们,那么当他们恢复正常生活时,他们自然会好转,从而让试验看起来像是起到了作用。在模拟实验中,当这种“暂时性疾病”与试验起始期重叠时,这些虚构患者看起来改善了惊人的 92.6%,尽管他们其实只是从一段糟糕时期中恢复过来。
类型 2 是关于游戏规则的概率游戏。想象你在钓鱼,但你只保留捕获到的最大的鱼。如果你改变规则,规定“我们只保留长度至少为 8 英寸的鱼”而不是“4 英寸”,你就是在强迫自己去挑选那些绝对最大、最极端的鱼。在研究中,当他们制定了更严格的规则(要求每月 8 次癫痫发作 而不是 4 次)时,他们选中的是那些正处于绝对最糟糕时刻的患者。因为这些时刻如此极端,患者在随后自然会向平均水平漂移。仅这一规则的改变就让“改善”看起来达到了 29.4%,尽管患者的大脑并没有发生任何变化。
类型 3 是关于测量工具的误差。想象你在数树上的鸟,但你的望远镜模糊不清,或者你不断把叶子误认为是鸟。在模拟实验中,他们调整了用于计数癫痫的“日记”。当他们降低计数的准确性(将灵敏度降至 70%)时,患者看起来有所改善,幅度为 33.3%。更糟糕的是,当他们加入“假警报”(即每天计数 1 次 非癫痫事件)时,虚假的改善幅度跳升到了 46.0%。这表明,如果你的计数方法不完美,它可能会创造出一个虚假的故事。
这项模拟实验的核心启示是,当癫痫临床试验中的安慰剂组变得“更好”时,并不一定意味着他们感受到了心理上的提升,也不意味着有一种神奇的治愈力量在起作用。在这些计算机模型中,没有药物,没有康复的预期,也没有设盲。这种改善纯粹是因为患者的选择方式以及癫痫计数的统计方式而产生的。作者建议,在我们对一种疗法进行评价或赞美之前,我们需要了解这种改善究竟是仅仅因为风暴过去(类型 1)、游戏规则的变化(类型 2),还是计数过程中的失误(类型 3)。通过意识到这些是三种不同的机制,科学家可以设计出更好的试验,从而不被数学逻辑所愚弄。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。