Two-Phase Sampling Designs and Analysis Approaches for Ordinal Outcomes
本文通过将三种结果导向的抽样策略引入序数结局研究并开发相应的分析方法,将两阶段抽样设计扩展至序数结局研究,模拟研究和真实世界脓毒症试验应用表明,这些方法相较于简单随机抽样显著提高了估计效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,试图解开一个谜团:某个特定且昂贵的线索(我们称之为“黄金线索”)如何影响患者的健康结局。你拥有一份庞大的嫌疑人名单(研究队列),对于名单上的每个人,你都已经掌握了一些基础且廉价的信息,例如年龄、性别和总体健康史。然而,为名单上的每一个人获取“黄金线索”既昂贵又耗时。你只有足够的预算,仅能对一小部分人进行检测。
本文是一份指南,教导你如何明智地挑选这一小部分人,以及如何正确分析结果,从而避免得出错误的结论。
问题:“全有或全无”的陷阱
过去,如果研究人员必须挑选一小群人进行昂贵线索的检测,他们可能会像从帽子里抽签一样随机选择(简单随机抽样)。但这效率低下。如果你随机挑选一组人,可能会错过最有趣的案例。
例如,如果你正在研究一种按阶段恶化(轻度、中度、重度、危重)的疾病,随机挑选一个人可能会得到一个具有“中度”症状的人,这并不能告诉你太多关于极端情况的信息。你想要找到严重程度量表上处于最顶端和最底端的人,以观察“黄金线索”在极端情况下的表现。
解决方案:三种明智的组队策略
作者提出了三种新策略,用于从大名单(第一阶段)中挑选你的小组(第二阶段),以使你的侦探工作更高效:
结果依赖抽样 (ODS):“极端策略”
- 比喻: 想象你在寻找学校里成绩最好和最差的学生。你不是随机挑选学生,而是专门查看成绩单上排名前 10% 和后 10% 的学生。
- 运作方式: 你查看每个人已经拥有的健康结局(即成绩单)。你刻意挑选更多具有非常轻微结局和非常严重结局的人,而较少挑选具有平均结局的人。这让你在未检测所有人的情况下,获得了更“宽广”的数据视野。
协变量分层 ODS (CSODS):“分组极端策略”
- 比喻: 有时,“成绩单”会受到其他因素的强烈影响,比如学生的年级。如果你只是从全校挑选最高和最低的学生,你可能会意外地只挑到一年级和十二年级的学生,而错过了中间的年级。
- 运作方式: 你首先根据已知因素(如年龄或特定健康评分)将嫌疑人分成不同的组。然后,在每个组内,你挑选极端值。这确保你能在所有不同类型的人群中获得关于“黄金线索”的平衡视图,而不仅仅是整个群体的极端值。
残差依赖抽样 (RDS):“意外因素策略”
- 比喻: 想象你有一个水晶球,可以根据学生的学习习惯预测他们的成绩。大多数学生符合预测。但有些学生是“意外”——他们努力学习却得了低分,或者没有学习却得了 A。这些“意外”是最有趣的。
- 运作方式: 你利用廉价数据构建一个预测模型。然后,你寻找那些实际健康结局与模型预测值差异很大的人(即“残差”)。你挑选这些“意外”案例,因为它们包含了关于“黄金线索”的更多新信息。
分析:如何在不作弊的情况下解开谜题
一旦你挑选了明智的小组,你就不能像分析普通小组那样分析他们。如果你忽略了你特意选择了他们这一事实,你的数学计算就会产生偏差(就像法官只听最吵闹的证人的证词)。
作者开发了三种数学“工具”来修正这个问题:
- ACML(“校正”工具): 这种方法仅查看你挑选的人,但添加了一个数学“校正因子”,以解释你是特意挑选他们的事实。这就像在说:“我知道我挑选了更多极端案例,所以我会调整我的计算,假装我也看到了那些平均案例。”
- 多重插补(“填空”工具): 这种方法更聪明。它利用你未挑选的人(他们仍拥有廉价信息)的数据,来推测他们的“黄金线索”值可能是什么。它多次填补谜题中缺失的部分以创建完整图景,然后对结果取平均值。
- 筛法最大似然估计(“灵活网”工具): 这是一种复杂的方法,它不假设“黄金线索”遵循特定的形状。相反,它使用灵活的“网”(数学样条)来捕捉数据的真实形状,即使数据杂乱无章,也能使其非常稳健。
他们的发现
作者运行了数千次计算机模拟来测试这些想法。他们发现:
- 效率: 使用这些明智的挑选策略(ODS、CSODS、RDS)比随机挑选要好得多。你用同样的资金获得了更准确的答案。
- 最佳组合: 当已知因素(如年龄或健康评分)能强烈预测结局时,“分组极端”(CSODS)和“意外因素”(RDS)策略效果最佳。
- 最佳数学: “填空”(多重插补)和“灵活网”(筛法)方法通常比简单的“校正”方法提供更精确的答案,特别是当你拥有未挑选人员的数据时。
现实世界测试:CLOVERS 试验
为了证明这在现实生活中有效,他们将这些方法应用于一个真实医学试验 CLOVERS 的数据。该试验研究了脓毒症(一种严重感染)患者。
- 目标: 他们想看看血液中的特定蛋白质(白细胞介素 -6,或 IL-6)是否与患者 14 天后的病情严重程度相关。
- 结果: 他们将 1,351 名患者的完整群体视为“第一阶段”名单。然后,他们模拟仅挑选 400 名患者,使用新策略检测 IL-6。
- 结果: 明智的策略(特别是 CSODS 和 RDS)使他们能够几乎像检测了所有人一样,重建蛋白质与疾病之间的关系。他们用更少的数据获得了更清晰的图景。
总结
本文为那些资金有限、无法检测昂贵指标的研究人员提供了一套新规则。你不必猜测该检测谁,而是可以利用已有的数据挑选信息量最大的人。然后,你使用特殊的数学方法确保你的结论准确无误。这既节省了金钱和时间,又获得了更好的科学答案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。