New York Smells: A Large Multimodal Dataset for Olfaction
本文介绍了“纽约气味”(New York Smells),这是一个包含 7,000 个来自多样化真实场景的图像-嗅觉对的大规模多模态数据集,该数据集证明了视觉数据有助于跨模态嗅觉表示学习,并在检索和分类等任务中优于传统的对手工设计特征。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:计算机看到一张玫瑰的照片,就能立刻知道它闻起来很甜。几十年来,机器已经成为了视觉、听觉甚至触觉的大师,能够以惊人的速度学习识别照片和音频剪辑中的模式。但有一种感觉对它们来说仍然是一个谜:嗅觉。虽然像狗这样的动物利用鼻子在世界中导航、寻找食物并探测危险,但机器却一直难以“嗅”到任何东西。其主要原因并非技术上不可能实现,而是数据缺失。要教会计算机嗅觉,你需要一个庞大的示例库,其中特定的气味必须与产生该气味的物质精确配对。直到现在,大多数气味数据都是在无菌、安静的实验室中收集的,且仅针对单一物体,这并不能反映现实世界中混乱而复杂的真实情况。
这篇论文介绍了一个被称为“纽约气味”(New York Smells)的巨大新进展。研究人员——来自哥伦比亚大学、康奈尔大学和 Osmo Labs 的一个团队——走进了野外——字面意义上地走在纽约市的公园、图书馆、健身房和城市街道上。他们制作了一个特殊的背包装置,将一个高分辨率摄像头紧挨着一个电子鼻(一种检测空气中化学物质的设备)。当他们行走时,他们记录了数千对图像和气味,捕捉从一片披萨到一簇苔藓、一张木凳以及一个塑料袋的一切。他们不仅仅是拍了一张快照;他们记录了随时间变化的气味,捕捉了物体的气味如何随着周围空气的流动而变化。通过将这些现实世界中的气味与它们所嗅到的视觉数据进行配对,他们创建了一个拥有 7,000 个独特气味-图像对的数据集,涵盖了 3,500 种不同的物体。这大约是之前任何气味数据集的 70 倍。
该团队利用这个新库来教计算机如何理解气味。他们尝试了一种称为“对比学习”的方法,这就像是在玩一个巨大的匹配游戏。计算机同时看到一本书的照片和书的气味,并学习将两者联系起来。然后,通过测试来观察它是否能通过一种新的气味找到匹配的图片,或者通过一张图片猜出气味。结果令人惊讶且充满希望。计算机发现,原始的、未经处理的气味数据(来自传感器的杂乱、实时信号)比科学家通常使用的“清理后”的摘要更适合学习。事实上,计算机学会了仅凭气味就能识别物体和材料,但这仅仅是因为它在训练过程中使用了视觉信号作为监督者。它甚至可以分辨出公园里并排生长着的两种非常相似的草。
论文指出,通过给机器一个视觉“老师”,我们可以帮助它们学习现实世界中的气味,而不只是在实验室里。研究人员发现,当计算机利用图片来引导其学习时,它发展出了比仅尝试从气味数据中学习时更敏锐的嗅觉。这并不意味着计算机现在能闻起来像狗一样,但这证明了将视觉和嗅觉联系起来是教会机器了解化学世界的强大方式。团队谨慎地指出,他们的数据来自一个城市,且他们的传感器无法检测每一种化学物质,但他们打开了一扇门。他们展示了,如果给予机器一个多样化的、现实世界的气味与视觉库,它们就可以开始建立起对我们周围这个隐形世界的理解。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。