← 最新论文
💻 computer science

Domain-Agnostic Feature Modulation for Semi-Supervised Domain Generalization

本文针对具有挑战性的域标签无关的半监督域泛化任务,提出了一种特征调制策略以构建鲁棒的域不变表示,并引入动态损失缩放函数以缓解域噪声并提升伪标签准确性,从而在不依赖域标签的情况下于主要基准测试上实现了显著的性能提升。

原作者: Venuri Amarasinghe (University of Moratuwa), Kalinga Bandara (University of Moratuwa), Isun Randila (University of Moratuwa), Asini Jayakody (University of Moratuwa), Chamuditha Jayanga Galappaththige
发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Venuri Amarasinghe (University of Moratuwa), Kalinga Bandara (University of Moratuwa), Isun Randila (University of Moratuwa), Asini Jayakody (University of Moratuwa), Chamuditha Jayanga Galappaththige (Queensland University of Technology), Ranga Rodrigo (University of Moratuwa)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对该论文的解读。

核心难题:“新城市”挑战

想象一下,你正在训练一个机器人来识别动物。你给它看了数千张在阳光明媚的公园里拍摄的的照片(源域)。机器人学得完美无缺。

但随后,你把这个机器人带到一片黑暗、多雨的森林(目标域)进行测试。光线不同,树木不同,动物看起来也不同。机器人变得困惑起来。它可能会因为“多雨森林”的特征扰乱了它的大脑,而把湿漉漉的狗误认为是猫。

这被称为域偏移(Domain Shift)。在现实世界中,我们往往没有针对每个新环境(比如多雨的森林)的完美标注数据。我们只有一小部分标注数据,以及大量未标注数据(没有名字的照片)。

本文的目标是教导机器人利用大部分未标注数据来处理这些新的、未见过的环境,而无需确切知道每张照片来自哪个环境(域)。

两大主要障碍

作者指出了现有方法存在的两个大问题:

  1. “猜谜游戏”(伪标签): 由于我们没有新数据的标签,机器人必须猜测标签(例如:“我有 90% 的把握这是一只狗”)。这些猜测被称为伪标签(Pseudo-Labels)。如果机器人被“多雨森林”的背景搞糊涂了,它就会做出错误的猜测。如果你用错误的猜测来训练机器人,它会变得更糟。
  2. “过于严格”的规则: 为了避免错误的猜测,现有方法非常严格。它们只允许机器人从那些它有 95% 把握的猜测中学习。这意味着它们丢弃了 90% 的未标注数据,因为机器人的置信度不够高。这就像一位老师只允许学生学习最简单的问题,而忽略了其余部分。

解决方案:一个两步魔法

作者提出了一种名为**域无关特征调制(Domain-Agnostic Feature Modulation)**的新方法。把它想象成一个修复机器人大脑的两步魔法。

第一步:“搅拌机”(特征调制)

类比: 想象你正在教某人识别一只

  • 问题: 在“照片”世界里,狗有毛发。在“素描”世界里,狗只是线条。如果机器人专注于“毛发”,它在素描世界里就会失败。如果它专注于“线条”,它在照片世界里就会失败。
  • 解决方法: 作者创建了一个特征调制器。把它想象成一个搅拌机。
    • 他们提取图片的具体特征(毛发、线条)。
    • 将其与“相似平均表示”(SAR)混合。想象 SAR 是一个“超级平均狗”,它是通过将所有不同世界(照片、素描、卡通)中狗的最佳部分混合在一起而创造出来的。
    • 这个搅拌机调低了那些在不同世界间变化太大的部分(如背景或光线),并调高了那些保持不变的部分(如吻部的形状)。
  • 结果: 机器人不再关注“多雨森林”的背景,而是开始专注于“狗的形状”。这使得机器人的猜测(伪标签)更加准确。

第二步:“智能音量旋钮”(损失缩放)

类比: 既然机器人现在能做出更好的猜测,作者意识到他们可以不再那么严格。

  • 旧方法: “只听从那些你有 95% 把握的猜测。”(这忽略了大量数据)。
  • 新方法: 他们引入了一个损失缩放函数(Loss Scaling function)。想象一个音量旋钮。
    • 如果机器人非常有把握(95%),音量就很大(高权重)。
    • 如果机器人比较有信心(75%),音量就低一些,但仍然可听
    • 至关重要的是,他们还会检查“不确定性”(机器人的手有多抖)。如果机器人手抖(不确定),他们会把音量调得更低,以防止它学到错误的东西。
  • 结果: 机器人现在可以从更多数据中学习(包括那些“比较有信心”的猜测),而不会被噪声搞糊涂。

为何这很重要(结果)

作者在四个主要数据集(如 PACS、OfficeHome 等)上测试了这种方法,这些数据集就像不同的图像“宇宙”。

  • 无需域标签: 与其他需要标签说明“这来自照片世界”的方法不同,这种方法可以盲用。它不在乎数据来自哪里。
  • 更高的准确率: 通过清理特征(第一步)并更明智地利用更多数据(第二步),他们的方法以显著优势(约 3-6% 的提升)击败了之前的最佳方法(如 FixMatch)。
  • “保留率”胜利: 他们成功地在训练循环中保留了更多数据(更高的“保留率”),同时仍保持猜测的准确性。这就像让一个学生多学习 20% 的问题,而不会让他们感到困惑。

一句话总结

本文教导计算机视觉模型忽略不同环境的“背景噪声”,专注于核心物体,使其能够从更大的未标注数据池中学习,而无需确切知道这些数据来自何处。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →