← 最新论文
🤖 machine learning

What Images Cannot Say: Language-Guided Olfactory Representation Learning

本文介绍了 SCENT,这是一个利用视觉语言模型中的语言引导语义描述符来弥合视觉场景与电子鼻信号之间差距的多模态框架,在 New York Smells 数据集上实现了最先进的跨模态检索和可解释的嗅觉表示学习。

原作者: Eleftherios Tsonis, Xi Wang, Vicky Kalogeiton

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Eleftherios Tsonis, Xi Wang, Vicky Kalogeiton

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题: “盲视”的照相机

想象一下,你正在看一张繁忙城市街道的照片。你的眼睛会告诉你场景的具体样子:汽车、行人、混凝土和蓝天。但你的鼻子知道相机捕捉不到的东西:汽车尾气的味道、热沥青的气味,或是附近面包店散发出的淡淡香气。

这篇论文的作者指出,目前的计算机在“观察”世界的方式上存在一个重大缺陷。相机擅长捕捉视觉信息,但它们在嗅觉上是“盲目”的。即使计算机拥有一张场景的照片和同一位置的传感器嗅觉读数,它也很难将两者联系起来。为什么?因为气味往往来自于照片画框之外的事物。

  • 类比: 想象你站在一个关着门的房间里。你可以看到房间内部(照片),但你能通过门缝闻到厨房里正在烘焙披萨的味道(嗅觉传感器)。一个只盯着房间照片看的计算机完全不知道披萨的存在。这就像仅仅通过看一张勺子的照片,就试图猜测汤的味道一样。

解决方案:SCENT(“侦探”框架)

为了解决这个问题,研究人员构建了一个名为 SCENT(语义上下文感知电子鼻 Transformer)的系统。他们并没有强迫计算机仅仅将图片与气味进行匹配,而是引入了第三个助手:语言

把计算机想象成一个试图破解谜题的侦探:

  1. 视觉线索: 照片(可见的部分)。
  2. 感官线索: 电子鼻读数(空气中的化学混合物)。
  3. 语言线索: 一个充当“世界专家”的智能 AI 助手。

它是如何工作的:“智能助手”

研究人员使用了一种强大的 AI(称为视觉-语言模型或 VLM),它阅读过数百万本书籍并见过数百万张图像。这个 AI 了解“世界的规则”。

  1. 观察照片: AI 查看一张厨房的照片。
  2. 思考像素之外: 它不仅仅会说“我看到了一个咖啡机”。它会利用其世界知识进行思考:“我看到柜台上有一个咖啡机。因此,空气中极有可能存在咖啡残渣电子设备的塑料味以及灰尘的味道,即使这些特定的气味在照片中是看不见的。”
  3. 搭建桥梁: 系统将这些文本描述(“咖啡”、“塑料”、“灰尘”)作为语义桥梁。它教会计算机:“当你闻到这种化学混合物时,它对应的是‘咖啡厨房’的概念,而不仅仅是那张咖啡机的照片。”

“解混器”(理清气味)

现实世界中的气味是杂乱无章的。一次嗅闻可能包含特定物体(如香蕉)的味道,同时也混合了背景环境(如公园)的味道。

论文引入了一个巧妙的技巧,称为潜变量分解(Latent Decomposition)

  • 类比: 想象一杯由草莓和菠菜组成的奶昔。如果你只是品尝奶昔,很难分辨出里面到底有多少草莓味和多少菠菜味。
  • SCENT 方法: 系统学习如何“解构”气味。它将“物体特有气味”(如草莓)与“背景环境气味”(如菠菜)分离开来。它通过使用文本描述来告诉自己应该寻找什么,从而实现这一点。这使得计算机能够理解“咖啡”的味道属于那台机器,而“灰尘”的味道属于整个房间。

结果:闻得比看得更准

团队在“纽约气味(New York Smells)”数据集上进行了测试,该数据集包含数千对城市照片和气味读数。

  • 旧方法: 以前的系统试图将气味直接与照片匹配。由于照片并未显示气味的来源,这些系统经常感到困惑。
  • SCENT 方法: 通过使用语言“提示”(即 AI 对“应该有什么味道”的理性推断),该系统在寻找正确匹配方面表现得更加出色。
    • 如果你给系统一种“雨水落在热沥青上”的味道,即使照片本身没有显示降雨,它也能找到正确的城市街道照片,因为语言桥梁理解了其中的上下文。
    • 它还擅长在不需要照片的情况下,将气味与文本描述(例如“图书馆的气味”)进行匹配。

“魔术戏法”测试

为了证明 AI 不是在瞎猜或“幻觉”(编造虚假气味),研究人员进行了一项特别测试。

  • 他们向 AI 展示了视角 1(一张带有电脑的办公桌照片),并让它猜测气味。
  • AI 猜出了诸如“纸张灰尘”和“塑料”之类的东西。
  • 接着,他们向其展示了视角 2(同一房间的另一个角度,AI 此前从未见过)。
  • 结果: 视角 2 真的显示了一叠纸和一把塑料椅子——完全符合 AI 此前的猜测!这证明了 AI 正在利用现实世界的逻辑来推断隐藏的细节,而不是进行随机猜测。

总结

简而言之,这篇论文通过给计算机提供一个语言指南,教会了计算机如何“闻味”。计算机不再仅仅盯着一张照片和一个传感器读数,而是询问智能 AI:“基于我所看到的景象,这里应该是什么味道?”这种额外的常识层帮助计算机将不可见的嗅觉世界与可见的图像世界联系起来,使其能更深入地理解我们的环境。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →