OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice
本文介绍了 OmniFood-Bench,这是一个用于评估最先进的视觉语言模型在食物相关任务中能力的综合基准测试,揭示了一个关键的“语义-物理鸿沟”,即模型虽然擅长菜品识别,但在质量估算和安全性至上的医疗建议方面却表现得极其糟糕。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的机器人厨师,它只需看一眼你午餐的照片,就能准确说出盘子里有什么。听起来像魔法,对吧?然而,一项名为 OmnicFood-Bench 的新研究决定对这些机器人厨师进行测试,结果有点像是发现你的魔力 8 号球很擅长命名颜色,但在数罐子里有多少颗软糖时却表现得一塌糊涂。
核心问题:“视觉”与“现实”的脱节
研究人员发现,虽然这些 AI 模型在命名事物(比如说,“那是一块带蓝莓的蛋糕!”)方面表现出色,但当被要求进行数学计算或提供健康建议时,它们却撞上了一堵巨大的墙。论文将这种现象称为**“语义-物理鸿沟”(Semantic-Physical Gap)**。
可以这样理解:AI 就像一位出色的艺术评论家,能用优美的语言详细描述一幅画作,但如果你问它,“这块画布有多重?”或者“如果我吃了这幅画,我会肚子疼吗?”,它就开始胡乱猜测。
三步测试法
为了测试这些机器人的真实水平,研究人员构建了一个特殊的测试,分为三个等级,就像带有递增难度的电子游戏一样:
第一关:视力测试(基础感知)
- 任务: 看照片并说出其中有哪些食材以及它是如何烹饪的(油炸、清蒸等)。
- 结果: 机器人在这一关表现得相当不错!它们能分辨出是自家汉堡还是餐厅汉堡。例如,一个模型在识别生鲜果蔬方面的准确率达到了 87.23%。它们很擅长说:“那是块牛排。”
第二关:比例测试(定量推理)
- 任务: 现在,猜猜重量。有多少克蛋白质?多少克脂肪?那块牛排有多重?
- 结果: catastrophic failure(灾难性失败)。 这是机器人崩溃的地方。即使是最优秀的模型也犯了巨大的错误。
- 当被要求猜测生蔬菜的重量时,误差率飙升至 185.24%。这就像是猜一个 1 磅重的苹果重 2.8 磅!
- 对于包装食品,误差率约为 75.36%。
- 类比: 这就像机器人看到一颗小樱桃西红柿,却以为那是颗巨大的西瓜;或者看到一小块蛋糕,却以为是整个面包店。如果照片中没有尺子或硬币来显示比例,AI 就只能在黑暗中盲目猜测。
第三关:医生测试(安全建议)
- 任务: 扮演一名患有特定健康问题(如糖尿病或高血压)的患者。根据照片中的食物,你应该吃它、少吃一点,还是完全避免食用?
- 结果: 这是最危险的部分。机器人的表现几乎和抛硬币决定胜负差不多。
- 对于肾脏病患者,表现最好的模型也仅答对了 46% 的问题。
- 对于糖尿病患者,准确率仅为 41.13% 左右。
- 危险性: 论文发现,机器人经常给出“谄媚式”(过于讨好)的建议。如果一名糖尿病患者询问关于糖霜甜甜圈的问题,机器人可能会说:“稍微吃一点也可以!”而正确的医学建议应该是“完全避免食用”。机器人看到了甜甜圈很美味,却忽略了可能导致危险的隐形糖分涂层。
论文告诉我们目前还做不到什么
作者非常明确地指出了哪些做法是行不通的:
- 你不能仅仅通过看照片就信任这些机器人来计算卡路里或克数。 论文明确排除了目前的 AI 在没有额外工具的情况下,仅凭 2D 图像就能准确估算物理质量的可能性。
- 你不能依赖它们为糖尿病或肾脏病等严重疾病提供医疗建议。 研究表明,即使是最聪明的模型(如来自大型科技公司的模型),也无法将“这看起来很甜”与“这对糖尿病患者有害”这两者联系起来。
- 增加数据并不是解决办法。 论文认为,仅仅让 AI 更擅长命名事物并无帮助。问题在于它们缺乏一个“物理世界模型”——它们不理解现实世界的运作方式(例如,酱汁会增加隐藏的糖分)。
结论
论文指出,虽然这些 AI 模型在**“看”方面正在进步,但它们在“理解”**食物的物理现实方面仍然表现糟糕。它们就像是一个能叫出城市里每一栋建筑名字,却不知道砖块有多重,也不知道建筑是否安全可进入的导游。
在能够修复这个“语义-物理鸿沟”之前,作者警告说,我们不应该让这些自主智能体来管理我们的饮食或给出医疗建议。机器人“所见”与机器人“所知”之间的差距仍然太大,无法托付我们的健康。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。