Cohen's f or Mean Standardized Differences? Assessing Covariate Balance with Multivalued Treatments
本文介绍了一个用于扩展 Cohen's f 和标准化均值差 (SMD) 以评估多值处理中协变量平衡性的 Stata 命令,并通过模拟实验证明了 Cohen's f 在追踪估计偏差方面的有效性与平均绝对 SMD 相当,同时为目前盛行但并非最优的最大 SMD 方法提供了一个具有理论依据的替代方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在试图破解谜题的侦探:“新药真的让患者康复了吗,还是他们原本就更健康?”在医学研究的世界里,科学家们经常通过比较不同的群体——比如服用药物 A、药物 B 或安慰剂的人群——来寻找真相。但问题在于,在比较结果之前,他们必须确保这些群体是公平的。如果“药物 A”组全是年轻健壮的运动员,而“安慰剂”组全是患有感冒的老年人,那么这种比较就失效了。这被称为协变量平衡(covariate balance)。
长期以来,当科学家比较仅有的两个群体时,他们有一个完美的工具来检查公平性,叫做标准化均差(Standardized Mean Difference, SMD)。你可以把它想象成一把“公平度量尺”,用来衡量两组之间平均年龄或健康得分的差距。如果数值很小(比如 0.1),则表示两组平衡;如果数值很大,则表示不平衡。但当你拥有三个或更多个群体时,情况就变了。旧的度量尺不再奏效了。你不能仅仅测量 A 与 B 之间的距离,再测量 B 与 C 之间的距离,然后就得出结论。你需要一个单一的、“综合性”的分数——一个能同时告诉你整个群体环境是否公平的总控仪表。直到现在,研究人员一直在尝试如何组合这些成对的测量值,或者使用一种名为 Cohen's f 的统计工具,而该工具最初是为另一种数学问题设计的。本文提出了一个简单而关键的问题:在比较三个或更多种治疗方法时,哪种工具才是最好的“公平度量尺”?
伟大的公平度量尺之战
在这项研究中,Ariel Linden 博士建立了一个庞大的数字模拟实验室,用以测试争夺“最佳多组公平度量尺”头衔的两大主要竞争者。一方面,我们有现状(Status Quo),它基本上就是“所有差异的平均值”法。想象你有三个队伍:红队、蓝队和绿队。现状法会测量红队与蓝队的差距,接着是蓝队与绿队的差距,然后是红队与绿队的差距,最后要么取这些差距的平均值,要么直接报告其中最大的那个。这就像一位老师通过观察每一对学生的身高差异来给班级评分,并说:“好吧,他们之间身高的平均差异很小,”或者“嗯,最高和最矮的孩子差别很大,所以这个班级的水平不统一。”
另一方面是 Cohen's f,这是一个存在了几十年的经典统计工具,通常用于分析实验中的方差。Linden 博士意识到这个工具可以被重新定义为多组情况下的“公平度量尺”。它不是简单地对差距求平均,而是计算差异的“平方根均值”。用一个生动的比喻来说:如果现状法是计算一组跑步者的平均速度,那么 Cohen's f 更像是计算这组人的总能量。它会额外关注那些跑得特别快或特别慢的人,但会根据每组的人数对他们的权重进行调整。
模拟竞赛
为了看哪把尺子真正有效,Linden 博士并没有仅仅观察真实数据,而是创造了一个虚拟世界。他生成了数千名具有不同特征(有些是正态分布,有些是偏态分布,有些是二元特征)的虚构患者,并将他们分配到 3、4 或 6 个不同的治疗组中。然后,他引入了“混杂因素(confounding)”——这是一个描述不公平性的专业术语——即故意让某些组获得更健康或更虚弱的患者。他在两种条件下测试这些组:一种是组间完美平衡的情况(类似于随机抽签),另一种是组间存在偏差的情况(类似于操纵比赛)。
随后,他将这些组通过“倾向评分加权(propensity score weighting)”过程进行了处理。想象这是一个数字天平,试图通过增加代表性不足的人的权重,并减少代表性过剩的人的权重,来重新平衡各组,从而使各组看起来再次变得公平。目标是观察:哪把尺子(Cohen's f 还是 平均/最大 SMD)能更好地预测最终的治疗结果是否真的存在偏差?
结果:并列第一,但带有转折
模拟结果非常有趣。当 Linden 博士检查每把尺子预测实际“偏差”(即最终医学结论中的误差)的能力时,Cohen's f 和 平均 SMD 并列第一。
- 相关性: 这两种工具在追踪偏差方面都表现得极其出色。当组间不平衡时,这两个数值都会上升;当组间平衡时,两者都会下降。在查看所有数据时,这两者与实际误差之间的相关性约为 0.93。即使在仅观察“经过正确加权”的组时,两者也都在 0.79 左右。
- 失败者: “最大 SMD”(即只挑选表现最差的一对组并忽略其他组的方法)是最弱的。它在预测整体偏差方面最不可靠。它就像一位只关心那个考试不及格的学生,却忽略了其他同学表现优异的老师;它对单个糟糕的配对过于敏感,从而错失了大局。
那么,这是否意味着 Cohen's f 是可以取代一切的灵丹妙药呢?并不完全是。 本文明确排除了“Cohen's f 在准确性方面更好”的观点。它的表现与旧方法一样好。然而,本文提出了一个关于**尺度(scale)**的重要发现。
“苹果与橘子”的问题
这是最关键的发现:你不能直接将 Cohen'ের f 的数值与 SMD 的数值进行比较。
想象你有两个温度计。一个测量摄氏度,另一个测量华氏度。如果你在摄氏温度计上看到“20”,你知道那是温暖的天气。但如果你在华氏温度计上看到“20”,那简直是冰天雪地!你不能直接说:“哦,20 在两者中是一样的。”
本文从数学上证明了 Cohen's f 和 平均 SMD 就像这些不同的温度计。
- 如果你有 3 个组,Cohen's f 的大小大约是平均 SMD 的 0.63 倍。
- 如果你有 6 个组,Cohen's f 的大小大约是平均 SMD 的 0.77 倍。
这意味着,如果一名研究人员习惯于看到 SMD 为 0.10 并认为“好的,这是一个很小的、可接受的不平衡”,那么他不能看到 Cohen's f 为 0.10 时也做同样的判断。事实上,取决于你有多少个组,一个 0.10 的 Cohen's f 可能代表着比 0.10 的 SMD 更大的不平衡。本文明确警告不要将旧的“0.10 准则”直接套用到 Cohen's f 上。
“组规模”陷阱
还有一个转折。Cohen's f 有一个旧方法所没有的内置特性:它根据组的大小进行加权。
- 大组: 如果最大的组(例如占 80% 患者的那一组)出现轻微的不平衡,Cohen's f 会大声疾呼。
- 小组: 如果一个极小的组(例如仅占 5% 患者的那一组)出现了剧烈的不平衡,Cohen's f 可能会低声细语,因为它被较少的人数“压低了权重”。
论文用一个现实世界的病例研究说明了这一点:一项关于心力衰竭的研究。在加权之前,最大的不平衡出现在巨大的“对照组”与较小的“远程监测组”之间。旧方法(平均 SMD)将其视为一个大问题(0.134)。Cohen's f 也看到了这一点,但因为对照组规模巨大,显示的数值较小(0.065)。两者都同意各组是不平衡的,但数值却不同。
作者认为,这种加权是一种“实质性的选择”。如果你关心的是整个人群,那么 Cohen's f 非常出色,因为它专注于最重要的部分(大组)。但如果你关心的是某种只有少数人接受的罕见疗法,Cohen's f 可能会掩盖这些少数人受到不公平对待的事实。
结论
那么,研究人员应该怎么做?
- 不要惊慌: Cohen's f 是一个有效且在理论上站得住脚的工具,用于检查多组研究中的平衡情况。它追踪偏差的能力与旧方法一样强。
- 不要混淆度量尺: 永远不要将旧的“0.10”截断值用于 Cohen's f。它们的数值尺度是不同的。
- 查看细节: 本文建议,如果你使用 Cohen's f,你必须同时报告数值的分解情况。你需要看到“逐层(per-level)”的分数(即每个特定组的表现如何)以及“成对(pairwise)”的分数(即每对组之间的表现如何)。如果你只看单一的“Cohen's f”数值,你可能会错过某个正处于困境中的特定组。
最后,本文表明 Cohen's f 是侦探工具箱中的一个强力新成员,它提供了一种在数学上优雅的方式来同时观察多个组。但就像任何好的工具一样,它也附带了说明书:了解如何读取刻度,并在宣布案件破获之前,务必检查细节。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。