← 最新论文
📊 statistics

Bayesian sample size calculations for external validation studies of risk prediction models

本文提出了一种用于二元结局风险预测模型外部验证的通用贝叶斯框架,通过显式量化模型性能的不确定性,确立了基于期望精度、保障概率及信息价值(VoI)的多准则样本量计算规则,并在 COVID-19 患者恶化风险模型的案例研究中证明,相较于传统基于精度的方法,该框架能更灵活地确定样本量并可能显著降低所需样本量。

原作者: Mohsen Sadatsafavi, Paul Gustafson, Solmaz Setayeshgar, Laure Wynants, Richard D Riley

发布于 2026-02-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohsen Sadatsafavi, Paul Gustafson, Solmaz Setayeshgar, Laure Wynants, Richard D Riley

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章提出了一种更聪明、更灵活的方法,用来决定在验证一个新的医疗风险预测模型时,我们需要调查多少人(样本量)。

为了让你更容易理解,我们可以把整个过程想象成**“在开一家新餐厅前,如何决定需要多少位试吃员”**。

1. 背景:为什么要做这个研究?

想象你开发了一款新的“健康食谱预测器”(风险预测模型),它能根据一个人的生活习惯预测他未来生病的概率。
现在,你想把这个模型推广到另一个城市(目标人群)。在正式推广前,你必须先在这个新城市做**“外部验证”**:找一批人,看看这个模型准不准。

核心问题是:我们需要找多少人来做这个测试?

  • 找太少:结果不准,大家不敢信。
  • 找太多:浪费钱、浪费人,甚至耽误时间。

2. 旧方法(Riley 等人的方法):像“死记硬背”的考试

以前的方法(传统频率学派)有点像**“死记硬背”**:

  • 研究者必须先一个具体的数字,比如:“我觉得这个模型在新城市的准确率大概是 76%"。
  • 然后设定一个目标:“我要让结果的误差范围控制在 0.1 以内”。
  • 最后套公式算出人数。

缺点是什么?
这就好比你猜“新城市的人平均身高是 175 厘米”,但你其实并不确定。万一猜错了呢?或者万一运气不好,你抽到的那群人刚好比较矮,导致算出来的误差很大,达不到目标怎么办?
旧方法假设你的“猜测”是绝对真理,忽略了**“不确定性”。而且,它只关心“误差条有多宽”,却不关心这个模型到底有没有用**(比如能不能帮医生做出更好的治疗决定)。

3. 新方法(贝叶斯方法):像“经验丰富的老厨师”

这篇论文提出的贝叶斯方法,就像一位经验丰富的老厨师
老厨师不会死记硬背一个数字,他会说:“根据我以前在其他城市的经验,这个模型的表现可能在 74% 到 78% 之间波动,但我也不完全确定。”

这种方法有三个核心优势:

A. 拥抱不确定性(把“猜测”变成“概率云”)

  • 旧方法:假设模型表现是固定的(比如 76%)。
  • 新方法:承认我们不知道确切值,所以给出一团**“概率云”**。比如:“有 90% 的把握,准确率在 74%-78% 之间”。
  • 比喻:就像天气预报。旧方法说“明天肯定是晴天”;新方法说“明天有 80% 概率是晴天,20% 概率下雨”。做决策时,新方法更靠谱。

B. 追求“保险”(Assurance)

  • 旧方法:只要“平均”能达到目标就行。
  • 新方法:问自己:“我想有多大的把握(比如 90%)确保这次实验一定能成功?”
  • 比喻
    • 旧方法:只要平均来说,试吃员觉得菜好吃就行。
    • 新方法:我要确保90% 的情况下,试吃员都会觉得好吃,而不是偶尔好吃偶尔难吃。如果为了达到这个“高把握”,需要多找几个人,那就多找几个,求个心安。

C. 关注“价值”(Value of Information, VoI)

这是最精彩的部分。对于净收益(Net Benefit)(即模型能不能帮医生省钱、救人命),作者认为光看“误差条”没意义。

  • 旧方法:不管模型有没有用,先要把误差条缩到很窄。
  • 新方法:问自己:“多找一个人来测试,能给我带来多少额外的价值?”
  • 比喻
    • 如果你已经找了 500 个人,模型准不准基本确定了。这时候再找第 501 个人,虽然能让误差条再窄一点点,但对医生做决定的帮助微乎其微
    • 新方法会告诉你:“别找了,再找人的成本(花钱、花时间)已经超过了它能带来的收益。”
    • 这就叫**“价值信息分析”。它帮你找到那个“性价比最高”**的样本量,而不是盲目追求“最精确”。

4. 案例研究:新冠患者的“病情恶化预测器”

作者用了一个真实的例子:预测新冠住院患者是否会病情恶化。

  • 旧方法算出来:需要 1056 人(因为要满足校准斜率的精度要求)。
  • 新方法算出来
    • 如果只看“保险”(Assurance),可能需要 1181 人。
    • 但如果看**“价值”(VoI),发现从 522 人增加到 1181 人,虽然精度提高了,但对临床决策的额外帮助**非常小(就像为了最后 1% 的完美,多花了一倍的钱)。
    • 结论:新方法建议,522 人就足够了。既省钱,又足够好用。

5. 总结:这到底意味着什么?

这篇论文就像是在告诉科研界:

“别再死板地套公式了!在决定做实验需要多少人时,要承认我们不知道一切(利用不确定性),要追求稳稳的幸福(高把握度),更要算算这笔账划不划算(价值分析)。”

一句话概括:
以前的方法是**“为了把尺子量得最准,不惜一切代价”
现在的新方法是
“为了做出最好的决定,用最小的代价找到最合适的尺子”**。

这种方法不仅更科学,还能帮医院和科研机构省下大笔冤枉钱,把资源用在刀刃上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →