The boundaries of biomedical result appraisal: mapping the gap between a result and its interpretation
这一概念性分析认为,尽管现有的生物医学评估工具能有效评价研究结果的技术可靠性,但它们未能常规性地验证从这些结果中得出的更广泛解释是否确实得到了研究所作特定比较的支持,从而在结果的有效性与其应用之间造成了关键性的差距。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在试图破解谜团的侦探。你拥有一台完美的、高科技的照相机,它拍下了一张嫌疑人的清晰照片。这张照片是无瑕的:光线充足,对焦精准,相机也没有出现任何故障。但随后,有人看着这张照片说:“啊哈!这证明了城市里所有的罪犯都戴着红帽子!”
照片是真的。相机工作完美。但结论是错误的,因为照片只展示了一个人,而那个人恰好戴着红帽子。照片从未展示过其他 99% 戴着蓝帽子、绿帽子或没戴帽子的罪犯。
这正是 Ozren Polašek 在其论文中指出的问题。他认为,在医学科学领域,我们已经建立了精妙的工具来检查研究的“照片”(结果)是否高质量。我们检查相机是否稳固(偏倚风险)、照片是否聚焦在正确的目标上(因果图)以及设置是否正确(估算量)。这些工具都很棒。
但这里存在一个缺口: 这些工具并没有例行询问最重要的那个问题:“这张特定的照片是否真的支持人们正在讲述的那个宏大故事?”
该论文指出,一项研究可以非常干净、无偏且值得信赖,但仍然会被用来讲述一个它从未讲述过的故事。其结果是“干净”的,但其解读是“松散”的。
五个“松散”的故事
为了说明这种情况是如何发生的,作者观察了五项著名的医学试验。在每一个案例中,研究本身做得都很正确,但人们讲述的故事却走得太远了。以下是他们出错的方式:
1. “虚假”的战斗 (PLCO 试验)
想象一场拳击赛,目标是看戴上一种新头盔是否能帮你获胜。但“对照”组(没戴新头盔的人)其实已经戴着自己的头盔了,而且其中 86% 的人都戴着!
- 研究: 比较了“有组织的头盔分配”与“已经拥有头盔的人”。
- 人们讲述的故事: “戴头盔并不能防止你受伤。”
- 现实情况: 该研究从未真正测试“戴头盔 vs 不戴头盔”。它测试的是“更多次的筛查 vs 高频次的筛查”,而不是“筛查 vs 无筛查”。论文指出,在对照组中,86% 的人曾接受过检测,46% 的人每年都有一次。
2. 未被接受的“邀请” (NordICC 试验)
想象一所学校向 100 个孩子发出了观看魔术表演的邀请。结果只有 42 个孩子真正出席了。学校随后说:“魔术表演不起作用,因为那些来的孩子并没有变得更好。”
- 研究: 比较了“发送邀请”与“没有邀请”。
- 人们讲述的故事: “结肠镜检查(魔术表演)并不能预防死亡。”
- 现实情况: 该研究实际上只测试了邀请,而不是实际的操作过程。由于只有 42% 的受邀者真正参与了,该研究从未真正测试当结肠镜检查实际进行时会发生什么。论文强调,参与率仅为 42%。
3. 被误认为是“结果”的“方案” (Look AHEAD 试验)
想象一家健身房提供了一节“趣味舞蹈课”来帮助人们减肥。这节课很有趣,但人们减掉的体重很少(最初为 8.6%,后来缩减至 6.0% 对比对照组的 3.5%)。健身房随后说:“减轻体重对心脏没有帮助。”
- 研究: 比较了“行为生活方式方案”与“标准糖尿病支持”。
- 人们讲述的故事: “刻意减轻体重并不能降低心脏风险。”
- 现实情况: 该研究仅测试了一个产生适度减重的特定方案。它从未测试过手术、药物或大幅度的减重。论文指出,体重的差距很小且在缩小,但故事却扩大到了声称所有的减重都是徒劳的。
4. “断裂”的路径 (CIRT 试验)
想象一名机械师试图通过向发动机注油来修理汽车,但发动机却没有油盖。机械师说:“油并不能修复汽车。”
- 研究: 测试了一种药物(甲氨蝶呤)以观察它是否能降低炎症从而阻止心脏病发作。
- 人们讲述的故事: “炎症不会导致心脏病发作。”
- 现实情况: 该药物从未真正降低炎症指标(IL-1β, IL-6 或 hsCRP)。路径从未被激活。该研究证明了该药物无效,而不是证明了理论(炎症导致心脏病发作)是错误的。
5. “特殊”的尺子 (SPRINT 试验)
想象一位医生使用一台特殊的、高科技的机器来测量患者的血压,读数是 120。医生随后告诉所有人:“如果你的血压在常规诊室尺子上是 120,那么你是安全的。”
- 研究: 使用了一种非常特定、严格的测量方法(坐姿、休息、自动设备、多次读数取平均值)。
- 人们讲述的故事: “常规诊室读数为 120 mmHg 的目标与此一致。”
- 现实情况: 论文指出,在实际诊所中,读数比该试验中高出 4.6 到 7.3 mmHg。该研究中的“120”是一个来自特殊机器的特殊数字,而不是你在用普通听诊器时会得到的数字。
缺失的一步
作者认为,我们拥有所有检查“照片”(数据)的工具,但我们缺少一个检查“标题”(故事)的工具。
- 我们现在的做法: 我们检查研究是否存在偏倚,数学是否正确,以及结果是否适用于特定人群。
- 我们应该的做法: 我们需要一个“反向检查”。在研究完成后,我们需要审视正在被提出的宏大主张,并询问:“这项研究是否真的进行了支持这一特定主张所需的比较?”
该论文建议,这种差距并非因为研究做得不好。事实上,这些研究通常非常出色。差距在于阅读方式。那个修正比较的“特征”(如 PLCO 中的 86% PSA 检测或 NordICC 中的 42% 参与率)就摆在发表的报告中,但没有人利用它来阻止故事变得过于庞大。
总结
该论文并不是说我们要抛弃现有的工具。它说这些工具是不完整的。我们需要增加一个新步骤:权利检查(Entitlement Check)。
在让我们接受一项研究的结果成为适用于所有人的规则之前,我们必须询问:“这个结果是否赋予了我们做出此类主张的权利?”如果答案是否定的,即使研究本身是完美的,我们也必须承认,这个故事已经讲得太过了。差距不在于证据,而在于我们如何解读它。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。