← 最新论文
📊 statistics

Multimodal domain adaptation under label shift and blockwise missing modalities

本文提出了一种以参考为锚点的领域自适应框架,该框架通过目标定义的典型相关分析和岭回归来估计目标结果分布并对齐块状缺失的多模态数据,从而在标签偏移和分布偏移下实现鲁棒预测。

原作者: Zebin Wang, Ziang Dou, Molei Liu, Tianxi Cai

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Zebin Wang, Ziang Dou, Molei Liu, Tianxi Cai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

混合混乱医疗线索之谜

想象一下,你是一名试图破解谜题的侦探,但你手中的线索散落在不同的犯罪现场,用不同的语言书写,而且有些甚至完全缺失。这正是现代医学研究人员在预测癌症等疾病时面临的日常现实。他们可以接触到海量的财富:电子健康记录、医生笔记、MRI 扫描图像和基因检测。因为这些数据来自多种不同的形式或“模态”,所以被称为“多模态”数据。

然而,问题在于:一家医院可能拥有优秀的 X 光片但没有基因数据,而另一家医院可能有基因数据但没有 X 光片。此外,“旧”医院(源数据)的患者可能与需要进行实际预测的“新”医院(目标数据)的患者不同。也许新医院接诊的病人病情更重,或者疾病的表现方式略有不同。这种差异被称为“标签偏移”(label shift)。如果你试图在没有计划的情况下,将这些混乱、不完整且各异的数据源混合在一起,你的预测将会像一个试图用异国地图来破案的侦探一样困惑不已。这项研究的目标是研究如何将这些零散、不完美的线索结合起来,从而对一组新的人群做出准确的预测,即使游戏的规则已经发生了变化。

“参考锚点”解决方案

在本文中,作者提出了一种巧妙的新方法来解决这个谜题,他们称之为“参考锚定领域自适应”(reference-anchored domain adaptation)。你可以把它想象成尝试翻译一个由几种不同方言编写的故事,其中一些副本还缺少了几页。

首先,作者意识到你不能简单地将所有数据揉在一起。如果你试图直接将 A 医院的“X 光”线索与 B 医院的“基因”线索进行对齐,你可能会出错,因为这两家医院的患者是不同的。这就像是在没有根据运动项目进行调整的情况下,直接比较篮球队员的身高与游泳运动员体重的关系。作者认为,你必须首先弄清楚在新的目标群体中,“结果”(例如患者是否生病)是如何分布的,然后调整旧数据以匹配这种新现实,之后再尝试合并这些线索。

为了实现这一点,他们使用了一个“参考模态”。想象一下,每一家医院(无论是旧的还是新的)都有一张包含年龄、性别等基本信息的标准身份证。这就是“参考”。作者利用这张共同的身份证来估计新目标组中的疾病发生率。一旦知道了目标的“氛围”,他们就会重新加权旧数据,使其看起来像是来自新群体。

接下来是棘手的部分:缺失的碎片。有些医院有 X 光片,有些有血液测试,但没有人同时拥有两者。作者使用一种叫做“典型相关分析”(CCA)的数学工具,来寻找目标组中参考身份证与其他线索(如 X 光或血液测试)之间的隐藏联系。这创造了一种“通用语言”或一张共享地图。然后,他们使用一种名为“岭回归”(ridge regression)的技术,将源医院的线索翻译成这种新的通用语言。这就像拥有一位完美掌握目标组方言的翻译官,能够将旧医院那些零散的笔记进行改写,使之符合新的地图。

最后,他们使用这些对齐后的线索来预测结果。论文还引入了一个“代理”(surrogate)技巧,用于处理旧医院没有完美标签(如确诊诊断)的情况。他们使用一种更粗略、更容易获得的信号(如计算机的猜测)来帮助搭建桥梁,然后利用仅有的少量完美标签进行微调。

他们的发现

作者通过两种方式测试了这一想法:计算机模拟和来自肾细胞癌(一种肾癌)患者的真实数据。

在模拟实验中,他们创建了数据以块状缺失且组间疾病率不同的虚拟世界。他们发现,与直接将所有数据投入标准机器学习模型的做法相比,他们的方法在预测结果方面表现得更好。具体而言,与未使用其特殊对齐技巧的流行模型 XGBoost 相比,他们的方法将预测准确度提高了约 20%,并将概率估计的误差降低了近 52%。他们还展示了即使在只有少量完美标签且大多是粗略“代理”标签的情况下,其表现仍能非常接近拥有全部完美标签时的水平。

在实测中,他们研究了 7,713 名肾癌患者。他们使用 2000 年至 2016 年间治疗的患者数据作为“源数据”,并使用 2017 年至 2022 年间的患者数据作为“目标数据”。数据非常杂乱:有些患者只有基本记录,有些有 CT 扫描,有些则两者兼有。此外,疾病复发率也随时间发生了偏移。他们的方法成功预测了哪些患者会在 12 个月内复发。该方法在预测复发概率(通过 BSS 分数衡量)方面是最准确的方法,并且在匹配新组中实际疾病率(校准度)方面表现最佳。虽然其他方法在排序(谁比谁更重症)方面还可以,但在实际风险数值上往往出错。而作者的方法则同时做对了排序和风险数值。

论文明确排除了“直接汇总所有数据”或“在未先修正疾病率差异前进行数据对齐”的可能性。他们证明了采用“旧方法”会导致预测的校准度极差。他们还证明了即使当不同来源的数据完全不同(块状缺失)且标签稀疏时,其方法依然有效。

简而言之,作者建议,通过使用一个共同的参考点来首先理解目标组,然后仔细地将其他组的零散线索翻译到这一语境中,我们可以做出更可靠的医疗预测。这种方法不仅仅是在猜测,它是在不同数据世界之间搭建一座坚实的桥梁,确保对未来的预测是植根于当下的现实之中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →