Conformal Risk Minimization for Semi-Supervised Domain Adaptation via Optimal Transport
本文提出了一种用于半监督领域自适应的端到端框架,该框架通过将符合风险最小化与最优传输相结合来生成伪标签,从而使模型能够在目标域有标签数据有限的情况下,训练出能够生成紧凑且覆盖有效的预测集的模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在医疗诊断的高风险领域,机器学习模型通常是在一组患者的数据上进行训练,但必须用于诊断另一组不同的患者。这种人口统计学的偏移创造了一个隐藏的差距:模型可能会识别出它从未见过的模式,从而导致可能伤害患者的错误。为了建立信任,医生需要的不仅仅是一个单一的猜测;他们需要知道模型的确定程度。一种被称为“符合预测”(conformal prediction)的方法提供了一种解决方案,它提供的是一份可能的诊断列表,而非单一结果。这份列表被保证在特定百分比的时间内包含正确答案,为临床医生提供了安全网。然而,一个主要问题在于,当这些列表在模型已经训练完成后才生成时,问题就会出现。由于训练过程并未考虑这些列表将如何形成,导致生成的列表往往过于庞大而无法使用,其中包含的可能性之多,以至于医生无法做出决策。
杜克大学的研究人员开发了一种新方法来解决这个问题,特别是针对标注数据稀缺的新患者群体。他们创建了一个系统,在模型学习的过程中,教导模型去思考其未来诊断列表的大小。通过将一种对齐不同患者群体的方法与一种优化更小、更精确列表的方法相结合,他们构建了一个能够产生紧凑且可靠的潜在诊断集合的模型。他们的工作表明,通过在训练阶段而非事后添加不确定性来规划不确定性,医疗人工智能可以变得既准确又实用。
该团队解决的核心挑战被称为“半监督领域自适应”(semi-supervised domain adaptation)。想象一下,一位医生在一家医院学习了数千张皮肤图像,但现在必须在另一家医院诊断患者,而那里的标记图像寥寥无几。新医院的患者可能有不同的肤色、光照条件或设备,这种“分布偏移”会让模型感到困惑。传统方法试图通过教导模型忽略两家医院之间的差异,仅关注对诊断至关重要的特征来弥合这一差距。然而,这些方法通常只旨在寻求单一的最可能答案。它们并不关心模型最终提供的“安全网”的大小。
当研究人员将符合预测作为最后一步应用于这些预训练模型时,安全网往往会变成一张捕捉一切的巨网。这是因为模型从未被训练去最小化它所提供的选项数量。杜克大学的团队意识到,要获得一个有用的列表,模型必须从一开始就带着这个列表的目标进行训练。他们提出了一个名为 CP-JDOT 的框架,该框架将创建小型、高效列表的目标直接整合到训练过程中。这使得模型能够学习一种数据表示,这种表示能自然地导致更紧凑、更自信的预测。
为了使这一过程在目标医院标注样本极少的情况下依然奏效,研究人员使用了一种称为“最优传输”(optimal transport)的数学工具。可以将这个工具想象成一种匹配方式,将新医院中每个未标记的患者与旧医院中相似的患者进行匹配,从而有效地“借用”旧患者的诊断来引导新患者。这创建了一组“伪标签”(pseudolabels),它们充当了桥梁,让模型能够利用源医院丰富的数据,同时适应目标医院的具体需求。随后,系统利用来自目标医院的少量实际标注样本来设定预测列表的大小阈值。
研究人员在两种不同的场景下测试了他们的方法。首先,他们使用了一个标准的物体识别基准测试,涉及来自四个领域(艺术、剪贴画、产品和真实照片)的图像。他们模拟了极其困难的情况,即目标域中每个类别仅有一到三个标注样本。在这些测试中,他们的方法始终产生比现有最佳方法更小的预测列表,将平均选项数量减少了约 5% 到 10%。即使在领域转换非常困难的情况下,这种改进也十分显著,表明该方法具有鲁棒性。
他们还将该方法应用于一项更关键的医疗任务:皮肤病变分类。他们使用来自 HAM10000 数据集的图像作为源数据,并在代表五种不同皮肤成像条件的各种目标数据集上测试了该模型。在这里,结果更加令人瞩目。与之前的方法相比,新方法将预测列表的平均大小减少了高达 12%。这意味着对于观察皮肤病变的医生来说,模型会提供一份更短的潜在病症列表,使诊断更快、更具可操作性,同时仍保持了正确诊断被包含在列表中的严格保证。
除了缩小列表规模之外,研究人员还展示了他们的框架可以经过调整以遵循特定的医学规则。在皮肤癌诊断中,如果一个列表同时包含良性和恶性的可能性,是非常危险的,因为这会给医生提供混乱的信号。团队修改了训练损失函数,以惩罚这种矛盾的列表。这样做之后,这种混乱的、混合性质的列表数量在不同数据集中大幅下降了 60% 到 75%。虽然这导致列表总体大小略有增加,但结果是一套不仅在统计上有效,而且在语义上连贯且具有临床实用价值的预测。
研究结果表明,传统的训练 AI 模型的方式——即优化单一正确答案,然后在事后尝试修复不确定性——存在根本性的局限。通过将高效不确定性量化的目标直接整合到学习过程中,模型学会了产生本质上更适合高风险决策的输出。研究人员证明,即使在数据匮乏的情况下,训练一个能够感知自身局限性和未来预测结构的模型的做法是可行的。这种方法为开发不仅准确而且值得信赖、并符合临床医生实际需求的医疗人工智能提供了一条充满前景的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。