Beyond Nearest Neighbor Interpolation in Data Augmentation
本文提出了一种针对卷积神经网络的改进型数据增强流程,该流程摒弃了最近邻插值以避免像素级标注误差和高频细节退化,转而采用基于均值的类别过滤机制与离线生成方法,从而在医学及X射线图像分割数据集上实现了性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人识别照片中的特定物体并勾勒其轮廓,比如在 X 光片中寻找肿瘤,或在电子垃圾堆中定位电池。为了让机器人变聪明,你会给它展示成千上万张图片。但若要让它变得真正聪明,你还需要展示更多图片:将原始图片进行扭曲、翻转、拉伸和旋转。这被称为数据增强。
根据这篇论文,问题在于我们如何创建这些经过扭曲的新图片。
旧方法:“像素完美”的模仿者
传统上,当我们旋转一张物体(如肿瘤)的图片时,计算机必须决定如何填充旋转后产生的新空白区域的颜色。
- 对于照片:计算机通常采用平滑、艺术化的方法(如颜色混合),以使图像看起来自然。
- 对于轮廓(掩膜):为了避免混淆,计算机历史上一直使用“最近邻”方法。这就像是一个像素化的模仿者。如果一个像素是红色的,新像素就只是最近的一个红色像素的复制品。它不进行混合,只是直接“吸附”到最近的邻居上。
缺陷:作者认为,这种“吸附”方法就像试图仅用方形乐高积木来画一个平滑的圆。它会产生锯齿状、阶梯状的边缘。这些锯齿边缘会让机器人感到困惑,因为它们与真实物体的平滑曲线不匹配。这就像给机器人一张边缘锯齿状、不准确的地图;它学会画锯齿状边缘,而不是平滑边缘。
新方法:带有“安全网”的“平滑画家”
作者提出了一种新方法:停止在轮廓上使用那种“咔哒”作响的模仿者。相反,即使是轮廓,也应使用与照片相同的平滑、艺术化混合方法。
风险:如果在轮廓上混合颜色,可能会产生奇怪的“未定义”颜色(例如一个像素是 50% 红色和 50% 蓝色)。机器人不知道该如何处理“半红”的肿瘤。
解决方案:作者发明了一个安全网(称为全局滤波器)。
- 平滑绘制:首先,使用平滑混合方法对轮廓进行旋转和拉伸。这保留了“咔哒”方法所破坏的精细细节和高频结构(那些微小、锐利的边缘)。
- 安全网:绘制完成后,安全网会检查每个像素。如果一个像素明显属于某一种颜色,就保持原样。如果一个像素是令人困惑的“一半一半”混合色,安全网会检查周围区域的平均颜色,并强制将其变为完全属于某一种颜色。
类比:想象你在拉伸一张画有图案的橡皮筋。
- 旧方法:你拉伸它,但图案变得块状且像素化,失去了形状。
- 新方法:你平滑地拉伸它,使图案保持清晰,然后使用印章修复拉伸过程中出现的任何模糊痕迹,确保线条依然锐利清晰。
尝试后的结果如何?
作者在三个不同的医学图像数据集(脑部扫描、乳腺组织和结肠息肉)以及一个电池检测数据集上测试了这种方法。他们使用了三种不同的“学生”机器人(名为 U-Net、SegNet 和 DeepLabV3+ 的神经网络)以及一个目标检测器(YOLO)。
结果:
- 对于“学生”(分割任务):在大多数情况下,使用“平滑画家 + 安全网”方法训练的机器人表现更好。它学会了绘制更清晰、更准确的轮廓。具体而言,对于 U-Net 和 SegNet 模型,对轮廓使用平滑混合方法(双三次插值)是明显的赢家。
- 对于“检测器”(目标检测):在寻找电池时,平滑方法也帮助机器人更可靠地找到物体,且置信度更高,尽管与其他方法相比,它有时找到的物体总数略少。
核心结论
该论文得出结论:只要我们有一个安全网在事后清理任何混淆,就不必害怕使用“平滑”的数学方法来处理物体轮廓。通过这样做,我们可以阻止机器人养成坏习惯(如锯齿状边缘),并帮助它保留其试图识别的物体中那些微小而重要的细节。
简而言之:在扭曲训练数据时,不要只是复制粘贴像素。先平滑地混合它们,然后用滤波器修复混乱。这会让 AI 更聪明、更准确。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。