← 最新论文
💻 computer science

HACI-Net: A Hybrid Attention and Channel Interaction Network for Food Image Recognition

本文提出了 HACI-Net,这是一种基于 ConvNeXt 的混合网络,通过集成空间、坐标和通道注意力机制以及通道交互模块,有效解决了食物图像识别中的挑战,并在 VireoFood-172 和 ChineseFoodNet 数据集上实现了最先进的准确率。

原作者: Zhiyong Xiao, Chaoliang Liu, Zhaohong Deng

发布于 2026-09-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiyong Xiao, Chaoliang Liu, Zhaohong Deng

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

每天都有数十亿人在对吃什么做出选择,这些选择会波及他们的健康、精力和长期福祉。几十年来,追踪这些选择一直依赖于人类的记忆和手动记录,这一过程容易出错且令人疲劳。近年来,科学家们转向利用计算机来解决这个问题,教机器通过观察一张食物照片来准确识别盘子里到底是什么。这一被称为“食物图像识别”的领域,旨在实现饮食监测的自动化,帮助人们管理体重、预防慢性疾病,并在无需承担持续手动输入的负担下了解其营养摄入情况。然而,教计算机区分两种非常相似的菜肴是极其困难的。一碗面条可能会根据光线、相机角度或背景中勺子和餐巾纸的杂乱程度而呈现出不同的外观。此外,人类用来区分食物的视觉线索——例如酱汁的具体纹理或食材的排列方式——往往分散在不同的视觉数据层中,这使得标准的计算机程序很难将它们拼凑成一个清晰的画面。

为了应对这些持久的挑战,江南大学的研究人员开发了一种名为 HACI-Net 的新系统。该系统旨在像细心的观察者那样观察食物图像:通过专注于盘中最重要的部分并忽略干扰性的背景,以及通过仔细结合不同的视觉线索来形成完整的理解。团队将他们的系统建立在一个被称为 ConvNeXt 的现代基础之上,该基础在识别图像模式方面已经表现得相当出色。然而,他们发现仅靠这个基础不足以处理相似食物类别之间的微妙差异。为了解决这个问题,他们在系统中添加了两个特定的工具。第一个是混合注意力机制,它就像一个聚光灯。它扫描图像以寻找最重要的区域,例如食物的主体部分,并调暗背景(如盘子或桌布)的噪音。这确保了计算机是在观察食物本身,而不是周围的环境。

第二个工具是通道交互模块,它有助于系统连接不同类型的视觉信息。当计算机分析图像时,它会将图片分解成许多独立的通道,每个通道捕捉特定的方面,如颜色、形状或纹理。在旧系统中,这些通道通常孤立工作,无法彼此分享所学到的信息。新模块则强制这些通道进行交流,使系统能够意识到某种特定的红色和某种特定的光滑纹理属于同一种食材。通过将这些信号混合在一起,系统创建了一个更加丰富且准确的食物描述。研究人员在两个大型食物照片集上测试了这种新方法:一个包含来自各种用餐环境的 172 种不同类型的菜肴,另一个包含 208 种在视觉上通常非常相似的常见中餐菜肴。

结果表明,这种结合的方法比以往的方法效果显著更好。在第一组图像集上,新系统正确识别食物的准确率达到了 94.17%。在更具挑战性的第二组图像集(其中菜肴看起来几乎一模一样)中,它实现了 85.46% 的准确率。这些数字代表了对其他领先计算机模型的提升,因为那些模型很难达到如此高的精确度水平。研究人员通过创建视觉热图验证了这一成功,热图展示了计算机在做出决策时究竟在看哪里。这些地图显示,新系统锐利地聚焦在食物项目上,而旧模型经常会被背景物体分散注意力。虽然该系统目前规模较大,需要强大的计算机才能运行,但研究人员承认,未来的工作将侧重于使其变得更小、更快,以便最终能在智能手机等日常设备上运行。目前,这项研究证明了通过教计算机更好地关注信息并更有效地共享信息,我们可以构建出能够以以往被认为难以实现的细节水平来理解我们饮食的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →