← 最新论文
🤖 machine learning

One Score, Two Decisions: Selective Prediction on the Rare-Disease Tail

本文表明,针对罕见病的选择性预测面临着根本性的限制,即在极罕见疾病上较低的召回率使得即使在具有完美置信度的情况下也无法实现高准确率,并且仅依赖于最高分是不充分的,因为基于边际的信号虽然有时能改善选择,但也可能丢弃用于验证候选列表中是否存在正确诊断的关键信息。

原作者: Zhaoyang Jiang, Zhizhong Fu, Yunsoo Kim, Zicheng Li, Xuanqi Peng, Fei Teng, Jiacong Mi, Honghan Wu

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhaoyang Jiang, Zhizhong Fu, Yunsoo Kim, Zicheng Li, Xuanqi Peng, Fei Teng, Jiacong Mi, Honghan Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

当医生面对一种罕见且令人困惑的疾病时,任务不仅仅是猜测一个名字,而是要从成千上万种可能性中筛选出符合实际的那一个。这是一个排序问题:医生必须将一份长长的潜在疾病清单按可能性从高到低进行排序。近年来,被称为大语言模型的强大计算机系统在这一领域展现出了前景,它们能够阅读患者的症状并生成一份广泛的可能诊断列表。然而,一个关键的问题仍然存在:医生何时应该信任计算机的首选建议,又何时应该忽略它并进行更深入的探寻?答案取决于系统如何决定是否“发声”。如果系统过于急于求成,它可能会自信地建议一个错误的疾病,导致不必要的检查和焦虑;如果它过于谨慎,即使它已知答案也可能拒绝提供建议,让医生求助无门。挑战在于构建一个知道何时应当认可其首选猜测,以及何时应当退后的系统。

研究人员着手测试了这些计算机系统在诊断最罕见疾病时的表现,这类疾病极其罕见,发病率低于百万分之一。他们收集了数千份真实的患者记录,每份记录都包含一组观察到的身体特征,并要求各种计算机模型对可能的疾病进行排序。他们发现了一个残酷的现实:对于最罕见的疾病,即使是最先进的小型计算机模型,也仅在每百次尝试中正确四到五次。由于模型在列表顶端的正确率如此之低,无论如何进行微调或置信度校准,都无法使其在高度自信的情况下达到安全使用的水平。研究人员证明,如果一个系统在首选位置获得正确答案的概率低于一半,那么无论医生如何巧妙地过滤其输出,在数学上都不可能达到安全的准确度水平。限制因素不在于模型缺乏信心,而在于最初缺乏正确的答案。

随后,研究转向了一种不同的工具,这种工具专门设计用于将患者症状与已知的疾病特征进行匹配。这种专门的系统在处理最罕见的病例时表现得好得多,其正确率约为百分之二十六。但研究人员发现,该系统传达置信度的方式与它的准确性同样重要。他们发现,系统的原始得分(仅表示某种疾病与症状的匹配程度)是判断是否信任首选结果的一个糟糕指标。相反,系统需要观察其第一选择与第二选择之间的差距。通过比较前两个选项,系统可以抵消影响列表中所有疾病的共同背景噪声,从而留下一个清晰的信号,表明哪种特定疾病是最合适的匹配。这种基于差距的信号使得系统能够安全地认可其首选结果约百分之三十的罕见病例,相比之下,原始得分无法提供任何可靠的指导,这相比之下是一个显著的进步。

然而,研究人员也表明,这种观察差距的方法也有弊端。虽然差距在判断“首选是否正确”方面表现出色,但在判断“列表中是否存在任何正确选项”时却表现糟糕。如果疾病列表完全错误,那么前两个错误答案之间的差距可能看起来依然很大且具有说服力。要了解列表中是否包含有效答案,系统需要观察整体得分水平,而不是前两名之间的差异。这意味着单一的数字无法承担两种不同的职责。一个系统不能使用同一种信号来同时决定“第一个猜测是否正确”以及“是否存在正确的猜测”。研究人员通过其他任务(如寻找相关的科学文章或关联医学术语)证明了这一点,即针对一种决策的最佳信号往往在另一种决策上会失效。

这项工作的最终教训是,你无法仅仅通过观察计算机产生的数字来判断该使用哪种信号。研究人员证明,在不知道真实答案的情况下,无法确定使用“差距”还是“原始得分”会带来更好的结果。你必须使用已知案例来测试系统,以找到正确的规则。对于应对罕见病的医生来说,这意味着依赖计算机的首选建议需要进行两步检查。首先,你必须验证计算机在寻找正确答案方面的能力是否足以使目标成为可能。其次,你必须选择一种与你正在做的决策相匹配的特定置信度衡量方式。如果目标是信任首选猜测,请观察第一和第二选择之间的差距;如果目标是判断该列表是否值得查阅,请观察整体得分。如果没有这些明确的检查,即使是最先进的计算机系统也可能在最需要帮助的关键时刻误导医生。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →