COLIP-2: Olfaction-Vision-Language Embeddings
该论文介绍了 COLIP-2,这是一种整合了嗅觉、视觉和语言的多模态嵌入模型,旨在使机器人能够以概率方式将气味定位到物体上,同时强调了当前开源数据的局限性以及对新数据集以推进嗅觉感知的需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你的智能手机不仅能看到你所看的内容,听到你所说的话,还能“闻”到空气中的气味。几十年来,计算机在识别照片中的人脸和理解书本中的句子方面表现得非常出色,但在嗅觉方面却完全是“嗅觉失灵”的。即使它们正盯着看,也无法分辨新鲜烘焙的曲奇饼和燃烧轮胎之间的区别。这篇论文深入探讨了嗅觉(sense of smell)这个奇妙而无形的领域,并试图教会计算机如何将一种气味与产生该气味的物体联系起来。
为了理解其工作原理,可以将计算机的“大脑”想象成一个巨大的图书馆,其中的每一个概念都在书架上的特定位置。通常情况下,狗的照片会放在“狗”这个词附近,猫的照片会放在“猫”这个词附近。这被称为共享空间(shared space)。科学家们已经为视觉和文字建立了庞大的图书馆,但从未有足够的关于气味的书籍来建立类似的板块。核心问题在于:我们能否教会机器人通过闻到一种气味,观察一个房间,然后猜出:“啊,这种味道是来自咖啡机,而不是烤面包机”,即使它以前从未见过闻起来像咖啡的咖啡机照片?这篇论文正是对此进行了探索,试图弥合分子化学结构、气体传感器以及我们拍摄的照片之间的鸿沟。
“嗅觉-视觉”之桥:介绍 COLIP-2
认识一下 COLIP-2(对比性嗅觉-语言-图像预训练 2),这是由 Scentience, Inc. 开发的一种新型计算机大脑。把它想象成一个能同时使用四种语言的通用翻译官:分子(微小的化学构建模块)、传感器(探测空气的电子鼻子)、文字(如“柑橘味”或“烟熏味”的描述)以及图像(你的相机所看到的画面)。
在此之前,如果你想让机器人寻找某种气味,你必须逐一教它每一种特定的气味,就像训练一只猎犬寻找特定的毒品一样。COLIP-2 则不同。它试图学习气味的“概念”。它获取分子的化学结构、气体传感器的读数以及文本描述,并将它们全部压缩进其大脑中已有的、存放世界图像的同一个隐形“书架”中。
工作原理:“无照片”技巧
这里是聪明之处:研究人员并没有拥有数百万张“有味物体”的照片来进行训练。这类数据目前并不存在。因此,他们使用了一个巧妙的捷径。他们意识到,由于计算机理解图像和文本的方式,诸如“花香”或“烧焦”之类的词汇已经存在于计算机的大脑中了。
想象你有一张世界地图,其中“花朵”靠近“花园”,“火”靠近“烟雾”。COLIP-2 获取一种气味(例如一个分子),并询问:“哪些词可以描述这种气味?”如果这种气味是“柑橘味的”,模型就会将这种气味直接放置在地图上“柑橘”这个词的旁边。既然计算机已经知道“柑橘”这个词靠近柠檬和橙子的图片,那么这种气味突然间就“知道”柠檬在哪里了,尽管它从未见过柠檬!这就像是得知了一种新口味尝起来像“柠檬”,于是你的大脑立刻就能在从未去过的森林里找到柠檬树的位置。
两个版本:云端 vs 边缘
论文描述了这种大脑的两个版本:
- 云端巨兽(The Cloud Giant): 一个拥有 11.5 亿参数的超大规模、高精度的版本,运行在强大的服务器上。它就像一位顶级大厨,能够品尝出一道菜并描述出其中的每一种香料。
- 边缘口袋(The Edge Pocket): 一个只有 1.01 亿参数的微型、轻量化版本,旨在运行在机器人的大脑或移动电话上。它的准确度稍低,但足够快,可以离线运行,让机器人能够实时闻到气味并指向来源。
它实际能做什么
当你给这个模型一张凌乱厨房的照片和一份“酒精”的传感器读数时,它不仅仅会说“检测到酒精”。它会在图像上绘制一张热力图。它会用温暖且发光的颜色高亮显示伏特加酒瓶,向机器人展示气味究竟是从哪里散发出来的。
论文显示,对于测试过的约 90% 的分子,该模型能在其前五个猜测中找到正确的气味描述。当涉及到识别图像中气味的来源时,对于精确匹配,它的正确率约为 72%;如果只是询问大致类别(例如“水果”而不是“特定的苹果”),其正确率则达到 90%。
局限性:它在哪里跌倒
作者非常诚实地说明了这个模型不能做的事情。它不是一根魔杖。
- 它是“家族”寻找者,而非侦探: 该模型擅长说“那是柑橘味”,但在区分“那是柠檬而不是橙子”方面表现挣扎。它在“家族”层面(例如“烟熏味”、“花香”)表现最好,而不是识别单一、独特的分子。
- 对新事物没有魔法: 如果你喂给它一个它从未见过的全新化学物质,它无法完美命名。它会猜测该物质所属的“家族”,但不会知道其确切身份。
- 不可用于安全领域: 论文明确警告:不要将其用于检测有毒气体泄漏或检查食物是否安全。 该模型提供的是排名和概率,而非精确的测量值。如果机器人认为某种气味“可能”是煤气泄漏,它可能会出错,而这可能会导致危险。它是一个研究工具,而非安全设备。
未来:共同学习
论文指出,最大的障碍并不是计算机的智能,而是数据的匮乏。我们还没有足够的“气味-视觉”结合案例来完美地教导模型。为了解决这个问题,团队正在使用一种叫做**联邦学习(Federated Learning)**的方法。想象一下,全球成千上万的机器人和传感器都在闻东西,并相互学习,而无需分享它们的私人照片或原始数据。它们只发送学到的“教训”给中央大脑,中央大脑再将更聪明的版本发回给每个人。通过这种方式,整个机群可以在保持数据隐私的同时共同变得更加聪明。
总结
COLIP-2 迈出了重要的一步,证明了我们可以利用已知的词汇来教会计算机将气味与视觉联系起来。它表明,通过合适的架构,机器人可以观察一个场景并说:“我闻到那边的烤架传来一股烟熏味。”然而,作者强调这仅仅是个开始。该模型只是一个原型,向我们展示了现有开放数据所能达到的极限。要实现真正完美的“嗅觉-视觉”机器人,我们需要建立新的数据集,并收集数百万个更多气味与图像配对的实例。在那之前,COLIP-2 是研究人员构建未来“机器人鼻子”的一个强大且具有启发性的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。