每天都有数十亿人在对吃什么做出选择,这些选择会波及他们的健康、精力和长期福祉。几十年来,追踪这些选择一直依赖于人类的记忆和手动记录,这一过程容易出错且令人疲劳。近年来,科学家们转向利用计算机来解决这个问题,教机器通过观察一张食物照片来准确识别盘子里到底是什么。这一被称为“食物图像识别”的领域,旨在实现饮食监测的自动化,帮助人们管理体重、预防慢性疾病,并在无需承担持续手动输入的负担下了解其营养摄入情况。然而,教计算机区分两种非常相似的菜肴是极其困难的。一碗面条可能会根据光线、相机角度或背景中勺子和餐巾纸的杂乱程度而呈现出不同的外观。此外,人类用来区分食物的视觉线索——例如酱汁的具体纹理或食材的排列方式——往往分散在不同的视觉数据层中,这使得标准的计算机程序很难将它们拼凑成一个清晰的画面。
为了应对这些持久的挑战,江南大学的研究人员开发了一种名为 HACI-Net 的新系统。该系统旨在像细心的观察者那样观察食物图像:通过专注于盘中最重要的部分并忽略干扰性的背景,以及通过仔细结合不同的视觉线索来形成完整的理解。团队将他们的系统建立在一个被称为 ConvNeXt 的现代基础之上,该基础在识别图像模式方面已经表现得相当出色。然而,他们发现仅靠这个基础不足以处理相似食物类别之间的微妙差异。为了解决这个问题,他们在系统中添加了两个特定的工具。第一个是混合注意力机制,它就像一个聚光灯。它扫描图像以寻找最重要的区域,例如食物的主体部分,并调暗背景(如盘子或桌布)的噪音。这确保了计算机是在观察食物本身,而不是周围的环境。
第二个工具是通道交互模块,它有助于系统连接不同类型的视觉信息。当计算机分析图像时,它会将图片分解成许多独立的通道,每个通道捕捉特定的方面,如颜色、形状或纹理。在旧系统中,这些通道通常孤立工作,无法彼此分享所学到的信息。新模块则强制这些通道进行交流,使系统能够意识到某种特定的红色和某种特定的光滑纹理属于同一种食材。通过将这些信号混合在一起,系统创建了一个更加丰富且准确的食物描述。研究人员在两个大型食物照片集上测试了这种新方法:一个包含来自各种用餐环境的 172 种不同类型的菜肴,另一个包含 208 种在视觉上通常非常相似的常见中餐菜肴。
结果表明,这种结合的方法比以往的方法效果显著更好。在第一组图像集上,新系统正确识别食物的准确率达到了 94.17%。在更具挑战性的第二组图像集(其中菜肴看起来几乎一模一样)中,它实现了 85.46% 的准确率。这些数字代表了对其他领先计算机模型的提升,因为那些模型很难达到如此高的精确度水平。研究人员通过创建视觉热图验证了这一成功,热图展示了计算机在做出决策时究竟在看哪里。这些地图显示,新系统锐利地聚焦在食物项目上,而旧模型经常会被背景物体分散注意力。虽然该系统目前规模较大,需要强大的计算机才能运行,但研究人员承认,未来的工作将侧重于使其变得更小、更快,以便最终能在智能手机等日常设备上运行。目前,这项研究证明了通过教计算机更好地关注信息并更有效地共享信息,我们可以构建出能够以以往被认为难以实现的细节水平来理解我们饮食的工具。
技术摘要:用于食物图像识别的 HACI-Net
1. 问题陈述
食物图像识别是自动化饮食管理、营养评估和健康监测的关键组成部分。然而,由于以下因素,该任务仍然具有高度挑战性:
- 视觉多样性与相似性: 食物类别表现出巨大的类内差异(例如,摆盘、形状、颜色),同时往往共享细微的类间相似性,使得精细化区分变得困难。
- 环境复杂性: 现实世界的图像是在多样化的光照条件、视角和背景下捕获的,这导致了强烈的背景干扰,从而遮蔽了关键的食物区域。
- 特征局限性: 现有的卷积神经网络(CNN)通常难以处理长程依赖关系,而视觉 Transformer(ViT)则可能受到特征分散和对局部精细细节关注不足的影响。此外,这两种架构通常都缺乏有效的通道交互机制,导致表示冗余和特征融合欠佳。
2. 方法论
本文提出了 HACI-Net(混合注意力与通道交互网络),这是一种基于 ConvNeXt 骨干网络的深度学习架构。该模型旨在协同卷积的局部特征提取能力与先进的注意力及通道交互机制。
2. 1 整体架构
HACI-Net 由四个层次化的特征提取阶段组成。每个阶段包括:
- 一个下采样层。
- 若干个用于核心特征提取的 ConvNeX 基础块。
- 在每个阶段末端嵌入一个 混合注意力模块(HAM) 以增强特征显著性。
在四个阶段之后,在最终分类器之前应用一个 通道交互模块(CIB) 以优化全局特征融合。
2.2 混合注意力模块 (HAM)
HAM 设计用于通过集成三种互补的注意力机制与残差连接,来抑制背景噪声并聚焦于显著的食物区域:
- 空间注意力(Spatial Attention): 沿通道维度进行平均池化,随后使用 7×7 卷积来捕获全局上下文信息并识别具有信息量的空间位置。
- 坐标注意力(Coordinate Attention): 使用全局平均池化将空间特征分解为水平和垂直方向。它利用多层感知器(MLP)对方向依赖性进行建模,从而保留精确的位置信息。
- 通道注意力(Channel Attention): 通过全局平均池化压缩空间维度,并使用 MLP 学习通道间的相关性,根据重要性对通道进行重新加权。
- 残差集成(Residual Integration): 这些分支的输出通过元素级乘法结合,并通过残差连接加回到原始特征中,以稳定训练并防止特征分布偏移。
2.3 通道交互模块 (CIB)
为了解决 ConvNeX 在建模通道间依赖关系方面的局限性,CIB 促进了跨通道的动态信息交换:
- 逐点分组卷积(Pointwise Grouped Convolution): 扩展通道维度以实现初步的跨通道交互,同时降低计算复杂度。
- 通道洗牌(Channel Shuffle): 在组之间重新排列通道,以缓解通道隔离并促进全面的信息交换。
- 深度卷积(Depthwise Convolution): 为每个通道独立捕获局部空间上下文,保持通道独立性并减少参数量。
- MLP 与归一化: 第二个 1×1 分组卷积压缩特征,随后进行层归一化(Layer Normalization)、残差连接以及使用 MLP 来建模复杂的非线性通道间依赖关系。
3. 核心贡献
作者将其贡献总结如下:
- 新颖架构: 提出了专门为食物图像识别定制的基于 ConvNeX 的网络 HACI-Net。
- 混合注意力设计: 开发了一个集成空间、坐标和通道注意力并结合残差连接的模块,以增强对关键区域的关注并提高训练稳定性。
- 通道交互机制: 引入了一个利用逐点分组卷积和通道洗牌的模块,以实现有效的跨通道信息交换。
- 实证验证: 在两个主要数据集上展示了竞争力的准确率和强大的泛化能力。
4. 实验结果
该模型在两个公共数据集上进行了评估:VireoFood-172(172 个类别,真实用餐环境)和 ChineseFoodNet(208 种中国菜肴,具有高视觉相似性)。
- 性能指标: HACI-Net 在 VireoFood-172 上实现了 94.17% 的识别准确率,在 ChineseFoodNet 上实现了 85.46% 的准确率。
- 对比: 该模型的表现优于最先进的基准模型,包括 ResNet、TResNet、EfficientNet、ViT、Swin Transformer 和 DeiT 变体,以及之前的食物特定方法如 MSMVFA 和 MVANet。
- 消融实验: 实验证实,混合注意力和通道交互模块均对性能有积极贡献。两个模块的结合产生了最高的准确率,验证了它们的协同效应。
- 可视化: 热图分析(Grad-CAM)表明,与基准 ConvNeX 相比,HACI-Net 能更准确地聚焦于主要食物成分,且较少受到背景元素的干扰。
5. 意义与未来工作
论文声称,HACI-Net 有效地解决了食物图像识别中的背景干扰、类别相似性和弱语义相关性等挑战。通过集成混合注意力和通道交互,该模型在复杂场景下实现了卓越的判别能力。
局限性与未来方向:
作者承认 HACI-Net 的模型复杂度相对较高,给在资源受限的移动或边缘设备上的部署带来了挑战。提出的未来工作重点在于:
- 轻量化设计: 探索神经架构搜索、知识蒸馏、通道剪枝和低比特量化,以降低计算成本。
- 多模态集成: 从单一模态的视觉输入转向整合辅助信息,如成分组成、营养标签和食谱文本,利用图像-文本对齐和跨模态注意力。这旨在将系统从简单的识别扩展到全面的营养理解和个性化饮食建议。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。