← 最新论文
📊 statistics

SSLfmm: An R Package for Semi-Supervised Learning with Mixed Missingness

R 语言中的 SSLfmm 包引入了一种基于似然的高斯有限混合框架,用于半监督学习,该框架通过对类别分布和标签缺失机制(包括 MCAR、MAR 及混合场景)进行联合建模,从而在标签可用性本身包含信息信号时提升分类性能。

原作者: Geoffrey J. McLachlan, Jinran Wu

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Geoffrey J. McLachlan, Jinran Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数据科学领域,研究人员经常面临一个令人沮丧的差距:即他们所知道的信息与他们能够测量到的信息之间的鸿沟。想象一项医学研究,医生记录了每位患者的症状,但只成功确认了其中一部分患者的最终诊断。其余的部分仍然是一个谜,这并非因为数据丢失了,而是因为确认过程对于某些病例来说成本太高、速度太慢,或者根本无法实现。这就是半监督学习(semi-supervised learning)的领域,这是一个致力于教计算机利用已知答案和未知答案的混合进行模式识别的领域。传统上,统计学家将这些缺失的答案视为随机事故,假设标签缺失的原因与数据本身无关。然而,在许多现实世界的情况下,标签缺失的原因本身就是一个线索。一名患者可能因为症状模糊而难以进行精确诊断,或者一位调查受访者可能因为问题令人不适而跳过某个问题。如果计算机忽略这种联系,它就会错过拼图中的关键碎片。

昆士兰大学的一个研究小组开发了一种新工具,旨在帮助计算机解决这个特定的问题。他们创建了一个名为 SSLfmm 的软件包,该软件允许机器从两种不同方式缺失标签的数据中学习:要么是完全随机缺失,要么是因为数据本身导致标签难以获取。该软件基于一个框架,该框架不仅将缺失的标签视为一个空白空间,还将其视为一个特定过程的结果。通过将这一过程与数据一同建模,系统可以区分出是由于偶然发生的随机缺失,还是由于数据点具有歧义或难以分类而导致的缺失。这种方法让计算机能够利用“标签缺失”这一事实本身来提高其对试图识别的群体的理解。

研究人员通过创建一个我们完全了解标签如何缺失的模拟数据世界,测试了他们的软件。他们生成了一千个代表两个重叠群体的观测点,然后特意移除了其中约百分之三十二的标签。他们将这些缺失的标签分为两类:一些是随机移除的,另一些则是专门因为数据点难以相互区分而移除的。随后,他们要求软件使用两种不同的策略来确定这些群体。在第一种策略中,软件被告知哪些缺失的标签是随机的,哪些是由于难度导致的。在第二种策略中,软件仅被告知标签缺失,而不知道原因。结果显示,即使在不知道缺失标签具体原因的情况下,该软件仍能有效地进行学习。当在那些隐藏了标签的数据点上进行测试时,已知原因的版本达到了约百分之八十一的准确率,而必须猜测原因的版本也达到了几乎相同的、约百分之八十一的准确率。这证明了该软件处理缺失信息的内部逻辑是稳健的,即使缺失来源是隐藏的也是如此。

为了在更现实的环境中观察其运作方式,团队将该软件应用于一个关于输血的数据集。他们提取了七百四十八名捐赠者的完整记录,并人为地移除了其中一些人的标签。他们保留了易于分类的捐赠者的标签,随机移除了另一部分人的标签,并为第三组专门因难以分类而被选中的人移除了标签。这创造了一个缺失标签由随机事件和困难案例混合而成的场景。研究人员随后在三种假设下运行了该软件:假设所有缺失标签都是随机的,假设所有缺失都是由于难度导致的,以及假设两者皆有。假设两者皆有的软件表现最好。它对困难案例的识别准确率约为百分之六十一,优于那些假设只有一种缺失类型的模型。该软件还估计大约有百分之十的缺失标签是随机的,这一数字与实验的实际设置非常吻合。

除了获得正确答案之外,该软件还提供了一种检查自身工作的方式。它会计算每一次预测的不确定度度量,本质上是在询问计算机它对每次分类的信心程度。当研究人员观察这些置信度分数时,他们发现了一个清晰的模式:最初难以标记的数据点比容易或随机的数据点具有更高的不确定度分数。这证实了该软件已成功学会将缺失的标签与数据的难度联系起来。该工具现在作为 R 语言的一个免费包提供,R 是统计计算的标准环境。它允许研究人员在无需从头编写复杂代码的情况下拟合模型、进行预测和运行诊断。该软件包包含了用于模拟数据、检查模型运行效果以及可视化缺失标签与分类不确定度之间关系的函数。

这项工作的意义在于它处理数据收集中混乱现实的能力。在许多领域,从医学到社会科学,获取标签的过程很少是随机的。通过承认缺失本身就携带信息,SSLfmm 软件包提供了一种更诚实、更准确的学习不完整数据的方法。它并不声称能解决所有关于缺失信息的问题,也不暗示所有的缺失数据都具有信息量。相反,它提供了一个灵活的框架,让研究人员可以测试关于数据为何缺失的不同假设,并观察哪种假设能带来最好的结果。作者强调,虽然软件在测试中表现良好,但具体数值取决于所分析的数据。该工具的真正价值在于,它给了科学家一个提问的方式:“我不知道这个答案,是否意味着这个答案本身在向我传递某种信息?”,并能得到一个基于数据的回应。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →