Evaluating the impact of outcome delay on the efficiency of sample size re-estimation
本文评估了具有样本量再估计设计的临床试验中,结果延迟如何通过增加平均样本量和检验效能来降低效率,特别是在再估计的样本量小于原计划时,会导致成本高昂的过度检验试验。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在筹备一场盛大的派对,以测试一道新菜谱。你需要邀请足够多的人,以确保这道菜谱大受欢迎,但又不想邀请太多人,否则你会在无人食用的食物上浪费金钱。
在临床试验(测试新药)的世界里,科学家们面临着完全相同的问题。他们必须猜测需要招募多少患者来证明药物有效。这个猜测取决于一个“干扰参数”——这是一种花哨的说法,意指“一个我们不确定的变量”,例如结果在人与人之间可能产生的变异程度。
解决方案:“内部预试验”(即“试吃”)
为了修正他们的猜测,研究人员采用了一种称为**样本量重估(SSR)**的策略。你可以将其想象为派对进行到一半时的“试吃”。
- 他们先邀请一小群人(第一阶段)。
- 他们检查数据,查看结果的变异程度。
- 基于此,他们调整所需的总人数。如果结果非常一致,他们可能需要更少的人;如果结果参差不齐,他们可能需要更多的人。
问题:“管道”(即“慢炖”)
问题就出在这里。在许多医学试验中,“结果”(患者是否好转)并不会立即出现。可能需要数月时间才能看到药物是否有效。这被称为结果延迟。
想象一下,你是派对的主人。你邀请了 60 人参加试吃。在决定还要邀请多少更多人之前,你正在等待他们的反馈结果。
- 理想情况: 在等待反馈期间,你停止邀请新人。
- 现实情况: 由于邀请流程是自动化的,你继续邀请新人。当你等待第 60 个人的反馈(这需要 8 个月)时,你仍在邀请新客人。
等到反馈到来时,你可能总共已经邀请了 100 人。但试吃告诉你,你只需要 80 人就能得到一个好的答案。现在你有了 20 个“管道”客人——这些人虽然在派对上,但他们的反馈不会计入你的决策。你在效能过高的试验(人数过多,成本过高)上浪费了资源。
本文的发现
本文作者运行了数千次计算机模拟,以观察这种“等待游戏”究竟有多糟糕。他们使用了三种主要方法来衡量损害:
“延迟影响”(我们 Overshoot 的频率有多高?):
- 他们发现,等待结果的时间越长,你意外邀请过多人的可能性就越大。
- 最大的惊喜: 当药物效果优于预期(或数据变异程度低于你的设想)时,这个问题最为严重。在这些情况下,“试吃”会告诉你削减宾客名单。但由于你在等待期间继续邀请,你最终还是会迎来一大群人。
- 相反,如果数据混乱且你需要更多人,延迟的影响就没那么糟糕。你在等待期间多邀请的人实际上有助于你达到所需的高人数。
“均方根误差(RMSE)”(我们偏离了多远?):
- 这衡量最终宾客人数与“完美”人数之间的偏差程度。
- 研究表明,随着延迟时间变长,最终宾客人数偏离理想值的程度就越大。试验的效率因此降低。
“成本”(惩罚分数):
- 作者创建了一个特殊分数,对“效能不足”的试验(人数不足以证明药物有效)的惩罚比“效能过高”的试验更为严厉。
- 他们发现,虽然延迟通常会导致效能过高(浪费金钱),但延迟的具体“成本”在很大程度上取决于最初的猜测。如果你猜测变异程度很高(需要很多人),但结果发现变异程度很低(需要很少人),延迟会导致成本急剧飙升,因为你招募的人数远远超过了必要数量。
成功的秘诀
本文最后提出了处理这种“等待期”的具体建议:
- 不要等待太久才检查: 你进行“试吃”的时机很重要。
- 最佳平衡点: 作者建议,对于连续数据(如血压读数),在每组 35 人之后检查数据是最佳平衡点。
- 如果你检查得太早(人数太少),你的猜测可能会非常离谱且不准确。
- 如果你检查得太晚(人数太多),在等待结果期间,你冒着邀请一大群不必要的“管道”客人的风险。
一言以蔽之
在继续招募患者的同时延迟临床试验的结果,就像在炖汤时,一边等待汤煮沸,一边让锅里的水保持满溢。如果你需要的水比预想的少,你就浪费了大量水分。本文表明,这种浪费在试验结果比预期“更容易”时最为危险。为了避免这种情况,研究人员应在每组招募约 35 名患者后进行“试吃”(重估),而不是等到招募了庞大的人群之后。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。