OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet
本文介绍了 OliveGemma,这是一个拥有 30 亿参数的视觉语言模型,它在统一的欧洲饮食数据集上进行了微调,在识别地中海及欧洲菜肴及其成分方面实现了卓越的准确率,不仅超越了传统的 CNN 基准模型,还显著优于规模大得多的商业前沿模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你的手机只需看一眼你午餐的照片,就能瞬间知道你吃了什么,甚至精确到酱汁中使用了哪些特定的香料。这不仅仅是一个酷炫的派对小技巧,它更是一场关于我们如何追踪健康的潜在革命。几十年来,科学家们一直试图教会计算机识别食物,但这却是一项极其繁琐的工作。把它想象成试图在一堆长得一模一样的双胞胎中进行分类:一份加了额外的芝士的披萨看起来和一份芝士较少的披萨几乎一样,而且一个国家的“希腊沙拉”在另一个国家看起来可能完全不同。传统的计算机程序就像是刻板的规则遵循者,经常会被这些微小的差异所迷惑。然而,一种被称为“视觉语言模型”(VLM)的新型技术正在改变游戏规则。这些模型不再仅仅是死记硬背图片,它们更像是读过数百万本关于食物的书籍、并看过数百万张照片的超级聪明学生。它们能理解一道菜是“披萨”,不仅是因为它的圆形形状,还因为它们理解面团、芝士和番茄酱是如何共同作用的。这篇论文深入探讨了我们是否可以教导这样一位“聪明学生”,让其在不需要像房子一样大的超级计算机的情况下,成为地中海和欧洲美食领域的顶尖专家。
欢迎来到 OliveGemma,这是一个由伊阿尼纳大学研究人员开发的新型、专门化的食物识别专家。你可以将 OliveGemma 想象成一个构建在名为 PaliGemma-2-3B 的庞大开源基础之上的微型、高效的大脑。虽然原始大脑拥有约 30 亿个“神经元”(参数),但研究人员并不想重新训练整个模型——那就像是为了更新一份千层饼的食谱而去重写整部百科全书一样。相反,他们使用了一种被称为 LoRA(低秩自适应)的巧妙技巧。想象一下,那个巨大的大脑是一个巨大的图书馆,而 LoRA 是研究人员贴在书架上的一个小型的便签本。他们只在这个便签本上写下新的笔记,教导图书馆如何识别像“希腊沙拉”或“提拉米苏”这样的特定菜肴,而无需改变原有的书籍。
团队在这个“便签式”大脑上进行了训练,使用了包含 17,340 张地中海和欧洲食物照片的大规模集合,并将这些照片清理并组织成了 216 个特定类别。他们不仅仅是问它“这是什么?”;他们还教会了它如何推理。他们会问类似这样的问题:“这道菜可能包含哪些成分?”以及“哪些视觉线索能告诉你这是披萨而不是一种扁平面包?”结果是一个极其微小且轻量化的模型——大小仅为 90 MB 左右。这个体积非常小,以至于它可以在配备标准处理器的普通计算机和 16 GB 内存的设备上运行,这意味着它不需要将你的食物照片发送到巨大的云端服务器才能工作。这对于隐私保护具有重大意义,尤其是在必须确保患者数据安全的医院环境中。
当研究人员对 OliveGema 进行测试时,结果令人惊叹。在与最先进的传统图像识别程序(称为 CNN)进行的正面交锋中,OliveGemma 脱颖而出,实现了 92.96% 的正确识别率。这比最强的传统竞争对手高出了 7.31%。但真正的震撼在于,当他们将 OliveGemma 与人工智能界的“巨头”进行比较时:即来自 Google (Gemini)、OpenAI (GPT) 和 Anthropic (Claude) 的那些庞大的专有模型。尽管这些巨头规模更大,且阅览过整个互联网,但在被要求从相同的 216 种特定菜肴列表中进行选择时,它们却显得力不从心。OliveGemma 轻松击败了它们,其表现比最好的巨头高出约 18%,有些甚至高出 64%。
论文指出,这发生的原因在于这些巨型模型过于通用;它们就像是全科医生,虽然博学多才,但在某一特定领域并非专家。相比之下,OliveGemma 是一个专家。它经过专门的微调,能够理解地中海相似菜肴之间的细微差别。此外,OliveGemma 不仅仅是猜测菜肴的名字,它还能以极高的准确度列出可能的成分,其准确预测成分列表的成功率约为 90.79%。它能告诉你“提拉米苏”含有马斯卡彭芝士和浸泡过咖啡的海绵蛋糕,甚至能猜出即使在照片中看不见的隐藏成分,如蛋黄和马萨拉酒。
作者们谨慎地指出,虽然这是一个重要的进步,但它并不是解决所有食物问题的万灵药。该模型目前仅限于其训练过的 216 种欧洲和地中海菜肴;它无法识别来自中亚的某种特定类型的面条。然而,这项研究有力地证明了,你并不需要一台价值数十亿美元、基于云端的超级计算机来获得顶尖水平的结果。通过使用一个小型的开源模型,并用数百万个参数进行正确的教学,研究人员可以创造出不仅更准确,而且更具私密性、可复现性且任何人使用标准计算机即可触达的工具。OliveGemma 证明了,有时,一个训练有素的小型专家每次都能战胜一个庞大的全才。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。