Food Portion Estimation: From Pixels to Calories
本文探讨了包括辅助输入和深度学习技术在内的各种策略,旨在解决从二维图像中估算三维食物份量量大小的挑战,以实现准确的饮食评估和慢性疾病预防。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图仅仅通过看一张平面的照片来猜一盘食物有多少。这有点像试图通过看一张纸上的山脉图画来猜测真实山脉的大小。你知道那座山很大,但它是一个小土丘还是一个巨大的高峰?如果没有尺子或已知的参照物进行比较,是不可能确定大小的。
这篇题为**《食物份量估算:从像素到卡路里》("Food Portion Estimation: From Pixels to Calories")**的论文,是一篇关于科学家如何试图解决这个“平面照片 vs. 真实食物”问题的综述。其目标是帮助人们追踪饮食以保持健康,但仅仅通过拍照来完成这项工作非常困难,因为相机在拍摄二维照片时会丢失“深度”(物体离多远)。
以下是论文中讨论的策略,使用了简单的类比:
1. 旧方法:使用“魔法尺”和特殊相机
在开始阶段,科学家们试图通过添加额外的工具来解决“平面照片”问题,就像木匠在锯子上安装水平仪一样。
- 特殊深度传感器: 一些系统使用特殊的相机(如旧款 Microsoft Kinect),这些相机可以通过向食物投射不可见的可见光图案来“看到”深度。
- 难点: 这就像尝试用激光去测量镜子或一碗汤一样;光线会发生反射或消失,从而干扰传感器。此外,这些笨重的相机并不是你希望在每顿饭时都随身携带的东西。
- 360度扫描: 另一种方法是要求用户绕着盘子走动并拍摄多张照片,就像摄影师围绕雕像环绕拍摄一样。然后,计算机将这些照片缝合在一起,构建出一个 3D 模型。
- 难点: 对于一个饥肠辘辘的人来说,这太费事了。此外,如果食物是软的或者被其他食物遮挡(遮挡问题),计算机就看不见隐藏的部分,只能进行猜测,从而导致误差。
- 模板匹配: 这种方法就像是尝试把饼干模具套在面团上。计算机拥有一个“标准”汉堡或苹果的完美 3D 模型,并尝试缩放或拉伸这个模型以匹配照片。
- 难点: 真实的食物是杂乱无章的。如果有人咬了一口汉堡,或者面包皮折叠得很奇怪,完美的饼干模具就对不上了,从而导致测量错误。
2. 新方法:“超级智能猜测”(深度学习)
最近,科学家们不再试图构建完美的 3D 模型,而是开始教计算机如何成为优秀的“猜测高手”。这就是“深度学习”的转变。
- 单目深度预测: 无需特殊相机,计算机只需观察一张照片,并利用它从数百万张其他食物照片中“学到”的知识来猜测深度。
- 类比: 这就像一位经验丰富的厨师,只需看一眼堆在一起的意面,就能仅凭形状和阴影立刻知道有多少量,而不需要进行测量。计算机通过海量数据集学习这些“阴影与形状”的规则。
- 直接能量回归: 一些系统完全跳过了 3D 猜测的过程。它们观察照片后直接给出结论,比如:“这看起来大约有 300 卡路里。”
- 类比: 这就像品酒师品尝葡萄酒后,能立即说出年份和价格,而不是先分析其化学成分。
- 神经辐射场 (NeRFs): 这是最前沿的技术。它不是构建一个实心的 3D 网格,而是将食物视为一个连续的颜色和密度云。
- 类比: 想象一个可以填补空白的全息图。即使你只看到了汤碗的前部,这项技术也能根据它所学到的关于汤通常长什么样的知识,来“想象”出背面和内部的液体,比旧方法能更好地处理蒸汽或透明液体等复杂情况。
3. 仍然存在的障碍
即便有了这些智能 AI 工具,论文指出仍有三个大问题需要解决:
- 尺度问题(“尺子在哪儿?”的问题): 如果你在照片中看到一个微型披萨,它是靠近相机的迷你披萨,还是一个远离相机的巨大披萨?除非照片中有已知物体(如信用卡)作为尺子,否则计算机无法得知。论文指出,当没有熟悉物体进行对比时,目前的 AI 会面临困难。
- 遮挡问题(“看不见的底部”问题): 你看不见接触盘底的食物底部,也看不见卷饼内部的馅料。计算机必须猜测隐藏的部分。
- 未来的想法: 论文建议,未来的 AI 可能会使用“非模态补全”(amodal completion),这就像侦探利用线索重建一个未被完全看到的犯罪现场。它还可能通过学习你的个人饮食习惯,来对内部构造做出更好的猜测。
- 密度差距(“蓬松 vs. 坚硬”的问题): 体积并不等于重量。一个蓬松的可颂面包虽然占据很大的空间,但其热量比同样大小的结实贝果要少。
- 未来的想法: 论文建议使用先进的 AI(大语言模型),让它们能够结合文本描述(如“低碳水”或“致密”)与照片一起阅读,从而更准确地判断重量和卡路里。
总结
论文得出结论,我们已经从需要笨重、昂贵的硬件转向使用适用于标准手机相机的智能软件。虽然这让人们更容易使用,但目前还不完美。技术正在变得越来越擅长于猜测隐藏部分和食物重量,但在没有明确参考物来告知食物实际大小的情况下,它仍然表现挣扎。目标是让追踪食物摄入变得像拍张照一样简单,帮助人们在无需繁琐手动记录的情况下管理健康。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。