← 最新论文
💬 NLP

Connecting Speech to Words through Images

本文提出了一种视觉驱动的无监督方法,该方法仅利用图像及其描述,即可学习书写词汇与语音表达之间的映射关系,并在没有任何显式文本监督的情况下,在语音词汇检索和关键词检测方面取得了卓越的性能。

原作者: Gabriel Pirlogeanu, Dan Oneata, Horia Cucu, Herman Kamper

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Gabriel Pirlogeanu, Dan Oneata, Horia Cucu, Herman Kamper

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的照片库,对于每一张照片,都有人录下了他们描述所见内容的音频。然而,这里有一个限制:你拥有照片和录音,但你没有书面文本。你无法阅读描述,只能听到声音。

这篇论文的研究人员提出了一个大问题:我们能否通过观察图片,教会计算机识别出那些录音中哪些声音对应于特定的书面词汇?

你可以把它想象成一场以视觉为线索的“猜词游戏”。以下是他们解决问题的步骤,通过简单的步骤进行了拆解:

1. 构建词典(“菜单”)

首先,计算机需要知道它正在寻找哪些词。由于他们没有原始文本,他们使用了一个智能工具(AI 图像标注器)来自动观察照片并写下描述。

  • 类比: 想象一名服务员看着一张海滩的照片,并在上面写下“沙子”、“海洋”和“阳光”。研究人员收集了所有这些自动生成的词汇,从而创建了一个词汇量的“菜单”。他们挑选了最常见的词,比如“男人”、“道路”或“人们”。

2. 过滤器(寻找正确的宾客)

现在,计算机有了一个目标词,比如“道路”。它需要找到那些确实提到了“道路”这个词的录音。

  • 类比: 计算机查看它的“菜单”并说:“好吧,我在找‘道路’。哪些照片的描述中包含了‘道路’这个词?”然后,它过滤掉所有其他的录音,只保留那些图像描述中提到过道路的录音。这缩小了搜索范围,锁定了一小组极具可能性的候选对象。

3. 侦探工作(寻找声音)

这是最难的部分。计算机拥有一堆可能包含“道路”这个词的录音,但它不知道这个词在录音中的确切出现时间。

  • 类比: 想象你面前站着 10 个人,你知道他们都在某个时刻说了“道路”这个词,但你无法分辨出他们各自说话的声音。你让他们所有人同时说话。计算机就像一个在人群中倾听的侦探。它将所有的录音重叠在一起(就像堆叠透明胶片一样)。
  • 在录音完美重合的地方,很可能就是“道路”这个词被说出的地方。如果一个人在第 2 秒说了“道路”,而其他所有人也都在那个时刻说了,计算机就知道:“啊哈!就是这里!”它会忽略那些人们说了不同内容(比如“自行车”或“蓝色”)的部分。

4. 两种聆听方式

研究人员尝试了两种不同的“堆叠与匹配”方法:

  • 离散法(破译代码): 这种方法将声音转化为一系列简单的代码(类似于 1 和 0),并寻找匹配的模式。它非常快,就像快速扫描一样。
  • 连续法(精细调节): 这种方法会更详细地观察声波,比较声音的精确形状。它速度较慢,但更精确,就像高分辨率显微镜一样。

结果

研究人员在包含 20,000 对图像-语音的数据集上测试了这一方法。

  • 胜出者: “精细调节器”(连续法)在寻找单词出现的准确位置方面表现得最为出色。
  • 对比: 他们将自己的方法与之前的“神经”方法(一种试图直接学习两者之间联系的 AI 类型)进行了比较。他们的新方法显著优于前者——在寻找单词位置的准确性上提高了约 23%,在判断单词是否存在方面提高了 31%
  • 局限性: 该系统并非完美。有时它会被经常一起出现的词汇所迷惑,比如“盒子(box)”和“环(ring)”(源自“拳击场 boxing ring”)。如果图片显示的是一个拳击场,计算机可能会在难以决定说话者说的是“box”还是“ring”。

为什么这很重要

论文声称,这是朝着教计算机在不需要书面转录文本的情况下学习语言迈出的重要一步。这对于那些只有口头语言而没有书面语言,或者编写书面文字成本过高的语言来说意义重大。通过利用图片作为桥梁,计算机可以开始理解声音与意义之间的联系,即使它以前从未见过这些词的书面形式。

简而言之:他们教会了计算机通过听取人们对图片的描述来学习单词,并以图片本身作为唯一的引导。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →