Vision-Based Calorie Estimation for Bangladeshi Street Food: A Comparative Study of Detection and Regression Models
本文提出了一种专为孟加拉国街头美食设计的基于视觉的热量估算系统,该系统结合了高性能的 YOLO11n 检测模型与随机森林回归算法,并利用一枚 5 塔卡硬币作为比例尺,在包含 3,885 张图像的自建数据集上实现了 96.1% 的 mAP 和 95.0% 的 R² 分数。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
肥胖是全球范围内日益严峻的健康挑战,影响着数亿人并使医疗系统承受压力。管理体重的关键在于了解我们摄入的食物中含有多少热量。几十年来,科学家们一直试图开发能够通过观察一顿饭的照片来计算其能量含量的计算机程序。这些系统依赖于一种被称为“计算机视觉”的人工智能分支,它能让机器像人类一样“看到”并识别图像中的物体。然而,大多数现有的工具都是基于西方食物(如汉堡或沙拉)进行训练的,这类食物的份量通常较为标准,或者食物位于边界清晰的盘子中。面对世界其他地区色彩斑斓、种类繁多且往往形状不规则的街头小吃时,这些工具表现得非常吃力——在这些地方,一份量可能是一个炸球、一个酥皮点心或一叠薄饼,而且每家摊位的份量大小差异极大。由于缺乏针对这些特定食物的准确数据,像孟加拉国这样的地区的人们无法轻松追踪每日摄入量,从而失去了一个做出更健康选择的关键工具。
来自孟加拉国吉大港总理大学(Premier University in Chattogram)的一个研究小组致力于解决这一特定问题,他们设计了一套专门针对该国街头小吃的系统。他们意识到,仅仅识别食物类型是不够的;计算机还需要知道每一块食物的具体大小,才能准确估算热量。为了实现这一目标,他们开发了一种使用每个人口袋里都有的常见物品——五达卡硬币(five Taka coin)作为内置标尺的方法。通过在照片中将这枚硬币放在食物旁边,系统可以计算出食物的真实尺寸,无论拍摄时相机距离食物有多远或多近。这种方法避开了对复杂3D传感器或严格拍照规则的需求,使得这项技术在标准的智能手机上具有日常使用的实用性。
研究人员首先开始构建一个新的图像库,即一个此前并不存在的数据库。他们收集了近四千张包含六种流行街头小吃的照片:Singara、Somusa、Puri、Peaju、Beguni 以及作为参照物的硬币本身。这些照片是在各种条件下拍摄的,从专业的摄影棚灯光到实际街头摊位中混乱、昏暗的环境,以确保系统能在现实世界中正常工作。随后,他们测试了五种不同的先进计算机视觉模型,以观察哪一种能最好地识别并勾勒出每种食物的形状。这些模型充当“数字眼睛”,在图像中为每件食物绘制精确的边界。通过对比性能,团队发现一种被称为 YOLO11n 的特定模型最为准确。即使在食物堆叠在一起或部分被遮挡的情况下,它也能可靠地识别食物及其边界。
一旦计算机识别了食物并绘制了轮廓,下一步就是进行测量。系统检测到了图像中的五达卡硬币,其直径已知为 25.5 毫米。通过比较硬币在像素中的大小与食物在像素中的大小,软件计算出了一个缩放因子。这使其能够将数字图像转化为现实世界的维度,确定零食的实际高度、宽度和表面积。有了这些物理测量数据后,研究人员将数据输入到另一组旨在寻找模式并进行预测的数学工具中。他们测试了多种不同的预测引擎,以观察哪一种能根据食物的大小和类型最好地推测热量值。结果显示,一种被称为“随机森林”(Random Forest)的方法产生了最准确的估算,该方法通过结合许多简单决策者的判断来达成一个单一且稳健的结论。
最终的系统证明是非常高效的。在测试中,这种结合了最佳视觉模型和最佳预测引擎的组合,能够以极小的误差估算这些街头小吃的热量含量:估算热量与实际计算值之间的平均差异小于 6 卡路里,且该系统解释了数据中 95% 的变化。这种准确度水平表明,该方法足以可靠地用于饮食监测的移动应用程序。研究人员还指出,他们的系统效率足够高,可以在标准硬件上运行,避免了通常使此类技术难以普及的高昂计算成本。通过专注于当地美食并使用简单易得的参照物,这项工作填补了营养技术领域的一个重要空白,为孟加拉国人民理解每日摄入食物的能量含量提供了一种实用的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。