The Impact of CutMix on Reliability and Robustness in Semantic Segmentation
本研究表明,尽管 CutMix 对语义分割模型的原始准确率影响微乎其微,但它能持续增强其可靠性、校准度和不确定性估计,尤其是在分布偏移的情况下,使其成为安全至上部署场景中的关键工具。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在自动驾驶领域,摄像头不仅仅是在观察道路,它必须理解道路。它需要清晰无误地识别出行人、停止标志或是一块冰面。这项被称为“语义分割”的任务,涉及教计算机为图像中的每一个像素都贴上正确的物体标签。为了确保这些系统的安全性,它们不仅要能正确猜测,还必须知道自己何时并不确定。如果一辆自动驾驶汽车遇到一个从未见过的陌生雾天场景,系统表现出“自信的错误”远比表现出“不确定且谨慎”要危险得多。这种对“可靠性”的需求——即模型使其置信水平与实际准确度相匹配的能力——与预测本身的原始准确率同样至关重要。
德国卡尔斯鲁厄理工学院的研究人员最近着手调查了一种用于训练这些视觉系统的特定工具。他们专注于一种名为 CutMix 的技术,这种方法因能帮助计算机学习得更快而变得流行。简单来说,CutMix 的工作原理是取一张图像的一部分并将其粘贴到另一张图像上,同时混合描述图像内容的标签。想象一下,一位老师向学生展示一张狗的照片和一张猫的照片,然后剪下狗的头并把它放在猫的身上,告诉学生这张新图像既是部分狗又是部分猫。这迫使计算机去观察整幅图像,而不是仅仅死记硬背特定的位置。虽然这种方法已被证明可以提高计算机识别简单图像的能力,但目前尚不清楚它如何影响驾驶所需的复杂、逐像素标注过程。更重要的是,近期的研究表明,使用 CutMix 的先进训练框架实际上可能会降低这些系统的可靠性,导致它们在应该谨慎时表现得过度自信。
为了查明真相,研究人员将 CutMix 从所有其他复杂的训练方法中分离出来。他们使用标准的城市街道图像训练了两种不同类型的计算机视觉模型——一种基于传统的图像处理结构,另一种基于较新的 Transformer 设计。随后,他们在晴天和浓雾天气下对这些模型进行了测试,后者代表了一种环境的显著变化。其目标是观察这种“剪切与粘贴”的训练方法是帮助模型保持准确,还是保持良好的校准,或者仅仅是让模型更好地了解自己在进行猜测。
结果呈现出一个微妙的局面,挑战了 CutMix 是一个简单万能解决方案的观点。研究发现,使用 CutMix 并未显著改变模型对道路或物体的标注准确度。无论模型是否使用该技术进行训练,正确识别的像素数量基本保持不变。然而,差异出现在模型表达其置信度的方式上。经过 CutMix 训练的模型在识别自身不确定性方面变得更加出色。当模型出错时,经过 CutMix 训练的版本更有可能将该错误标记为“不确定”,而不是自信地宣布其正确。即使在视觉条件恶劣且陌生的浓雾测试中,这一改进依然成立。
或许最令人惊讶的是,研究人员发现,即使两者都使用相同的技术进行训练,传统的旧式计算机视觉模型在整体可靠性方面实际上仍优于更复杂的新型 Transformer 模型。研究表明,在某些先进训练框架中看到的可靠性问题并非由 CutMix 本身引起。相反,“剪切与粘贴”的方法似乎是一个增强模型信任其自身置信水平能力的工具,使其成为现实世界应用中更安全的伙伴。研究人员得出结论:虽然 CutMix 不能让模型看得更清楚,但它让模型对自己所见之物更加诚实。对于像自动驾驶这样的安全至上的系统而言,这种区别至关重要:一个知道自己何时感到困惑的系统,远比一个仅仅准确但盲目自信的系统更有价值。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。