← 最新论文
⚡ electrical engineering

PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs

该论文介绍了 PhaseCoder,一种与几何结构无关的 Transformer 编码器,它能将原始多通道音频和麦克风坐标转换为空间嵌入,使多模态大语言模型能够在多种设备配置下实现鲁棒的定位和复杂的空间推理。

原作者: Artem Dementyev, Wazeer Zulfikar, Sinan Hersek, Pascal Getreuer, Anurag Kumar, Vivek Kumar

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Artem Dementyev, Wazeer Zulfikar, Sinan Hersek, Pascal Getreuer, Anurag Kumar, Vivek Kumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正身处一个嘈杂的派对上。即使音乐声震耳欲聋,人群喧闹,你也能轻松地从房间另一头辨别出朋友的声音。这就是人类拥有一种被称为“鸡尾酒会效应”的超能力。我们不仅是在听声音,我们还能感觉到声音来自哪里。我们知道声音是在身后、在左边,还是在远处。这种空间感知能力对我们来说如此自然,以至于我们很少去思考它,但对于机器人和智能助手来说,这却是一个巨大的谜团。目前,大多数智能设备在定位方面都是“听觉盲”的;它们听到的是一段单一且平坦的声音流,就像通过单只耳机听广播一样。它们能告诉你说了“什么”,但完全不知道说话人站在“哪里”。

为了解决这个问题,科学家们一直试图教会计算机理解声音的方向。然而,这里有一个难点:大多数这类“空间听觉”程序就像是定制的鞋子,只适合特定的一双脚。如果一个设备有四个呈正方形排列的麦克风,程序就能运行;如果另一个设备的八个麦克风呈圆形排列,程序就会失效。这是因为该软件是针对一种特定的形状进行训练的,无法适应新的形状。此外,这些程序通常只能指指方向说“在那儿”,但它们无法围绕这个位置进行对话,也无法利用该位置信息来帮助机器人在房间里导航。它们擅长“指路”,但并不擅长“思考”。

于是,由 Google DeepMind 和 MIT 研究人员开发的全新发明——PhaseCoder 登场了,它充当了声音的通用翻译官。把 PhaseCoder 想象成一对神奇的耳朵,它不在乎麦克风的“耳朵”是以什么形状连接在一起的。无论麦克风是散乱地排成一圈、排成一行,还是以奇特的模式固定在机器人的头上,PhaseCoder 都能准确判断出声音究竟来自何处。它通过倾听声波撞击每个麦克风时极其微小的“时间差”(或称“相位”)来做到这一点,就像你的大脑利用左右耳之间微小的时间延迟来定位声音一样。

但 PhaseCoder 不仅仅停留在“指路”层面。研究人员将其连接到了一个强大的“大脑”——大型语言模型(LLM),具体是 Gemma 的一个版本。想象一下给这个大脑赋予一种新的感官:一种在 3D 音频中感知世界的能力。现在,AI 不再只是听到“你好”,它还能理解“你好,我站在你的左侧三米处”。研究人员使用数百万个计算机生成的音频场景来训练这个系统,教它忽略麦克风阵列的形状,而只专注于声音本身。

测试结果令人印象深刻。在利用不同设备的真实世界录音进行测试时,PhaseCoder 在一个极具挑战性的数据集上实现了约 7.44 度的定位精度,击败了以往那些受限于特定麦克风形状的最先进模型。更重要的是,当研究人员向 AI 提出复杂问题时,它能够对声音进行推理。它可以回答“说话人在我的左边吗?”或者“只转录站在我身后的人”,并成功地忽略了其他人。该系统适用于拥有 3 到 8 个麦克风的任何配置,证明了它真正理解的是声音的几何结构,而非仅仅死记硬背某种特定的布局。虽然该系统在判断精确距离方面仍有些吃力(仅靠音频进行距离判断是一项公认的难题),但它已成功弥合了原始音频数据与智能推理之间的鸿沟,赋予了机器真正“聆听”周围世界的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →