✨ 要点🔬 技术摘要
想象一下你正身处一个嘈杂的派对上。即使音乐声震耳欲聋,人群喧闹,你也能轻松地从房间另一头辨别出朋友的声音。这就是人类拥有一种被称为“鸡尾酒会效应”的超能力。我们不仅是在听声音,我们还能感觉到声音来自哪里。我们知道声音是在身后、在左边,还是在远处。这种空间感知能力对我们来说如此自然,以至于我们很少去思考它,但对于机器人和智能助手来说,这却是一个巨大的谜团。目前,大多数智能设备在定位方面都是“听觉盲”的;它们听到的是一段单一且平坦的声音流,就像通过单只耳机听广播一样。它们能告诉你说了“什么”,但完全不知道说话人站在“哪里”。
为了解决这个问题,科学家们一直试图教会计算机理解声音的方向。然而,这里有一个难点:大多数这类“空间听觉”程序就像是定制的鞋子,只适合特定的一双脚。如果一个设备有四个呈正方形排列的麦克风,程序就能运行;如果另一个设备的八个麦克风呈圆形排列,程序就会失效。这是因为该软件是针对一种特定的形状进行训练的,无法适应新的形状。此外,这些程序通常只能指指方向说“在那儿”,但它们无法围绕这个位置进行对话,也无法利用该位置信息来帮助机器人在房间里导航。它们擅长“指路”,但并不擅长“思考”。
于是,由 Google DeepMind 和 MIT 研究人员开发的全新发明——PhaseCoder 登场了,它充当了声音的通用翻译官。把 PhaseCoder 想象成一对神奇的耳朵,它不在乎麦克风的“耳朵”是以什么形状连接在一起的。无论麦克风是散乱地排成一圈、排成一行,还是以奇特的模式固定在机器人的头上,PhaseCoder 都能准确判断出声音究竟来自何处。它通过倾听声波撞击每个麦克风时极其微小的“时间差”(或称“相位”)来做到这一点,就像你的大脑利用左右耳之间微小的时间延迟来定位声音一样。
但 PhaseCoder 不仅仅停留在“指路”层面。研究人员将其连接到了一个强大的“大脑”——大型语言模型(LLM),具体是 Gemma 的一个版本。想象一下给这个大脑赋予一种新的感官:一种在 3D 音频中感知世界的能力。现在,AI 不再只是听到“你好”,它还能理解“你好,我站在你的左侧三米处”。研究人员使用数百万个计算机生成的音频场景来训练这个系统,教它忽略麦克风阵列的形状,而只专注于声音本身。
测试结果令人印象深刻。在利用不同设备的真实世界录音进行测试时,PhaseCoder 在一个极具挑战性的数据集上实现了约 7.44 度的定位精度,击败了以往那些受限于特定麦克风形状的最先进模型。更重要的是,当研究人员向 AI 提出复杂问题时,它能够对声音进行推理。它可以回答“说话人在我的左边吗?”或者“只转录站在我身后的人”,并成功地忽略了其他人。该系统适用于拥有 3 到 8 个麦克风的任何配置,证明了它真正理解的是声音的几何结构,而非仅仅死记硬背某种特定的布局。虽然该系统在判断精确距离方面仍有些吃力(仅靠音频进行距离判断是一项公认的难题),但它已成功弥合了原始音频数据与智能推理之间的鸿沟,赋予了机器真正“聆听”周围世界的能力。
技术摘要:PhaseCoder
问题陈述
目前的多种模态大语言模型(LLMs)通常将音频处理为单声道流,这使得它们对现实世界声音中固有的丰富空间信息表现出“音频盲”(audio-blind)。虽然空间感知对于具身智能(例如机器人、下一代助手)至关重要,但现有的空间音频模型受限于固定的麦克风几何结构。这导致必须为每种新的设备配置训练单独的编码器,从而阻碍了 LLM 的泛化优势在空间音频领域的应用。相反,像 Ambisonics 这样与麦克风无关的表示法则需要专门且笨重的硬件,这在消费级设备中并不常见。目前缺乏一种通用的空间音频编码器,能够处理来自任意麦克风阵列的原始多通道音频,并与 LLM 无缝集成以进行复杂的推理任务。
方法论
作者提出了 PhaseCoder ,一种旨在实现本质上与麦克风几何结构无关的纯 Transformer 空间音频编码器。该系统主要分为两个阶段运行:
1. PhaseCoder 编码器架构
输入处理: 模型接收原始多通道音频以及阵列中每个麦克风的笛卡尔坐标。它在 250 毫秒窗口(33 帧)上计算短时傅里叶变换(STFT),以提取幅度和相位信息。
嵌入生成: 为每个麦克风和时间帧创建一个补丁嵌入(patch embedding),并将这些嵌入展平为一个序列。
位置嵌入: 为了处理可变的麦克风数量和几何结构,系统对三种类型的位置嵌入进行求和:
序列位置嵌入: 用于展平序列位置的标准 1D 正弦嵌入。
帧位置嵌入: 基于时间帧索引的正弦嵌入。
麦克风位置嵌入: 借鉴自 GI-DOAEnet,通过相位调制从麦克风坐标(转换为相对于阵列质心的球坐标)中导出。
骨干网络: 一个 Transformer 编码器(5 个块,600 万参数)处理该序列。一个可学习的 [CLS] 标记用于聚合空间信息。
输出头: [CLS] 标记通过一个 MLP 生成用于与 LLM 集成的“空间音频标记”(软嵌入)。此外,三个独立的分类头分别预测方位角 、仰角 和距离 的离散区间。
2. 训练策略
监督训练: 编码器在纯合成数据上进行训练,这些数据是使用 LibriSpeech 数据集与模拟房间脉冲响应(RIR)卷积生成的。数据集具有随机的麦克风几何结构(3–8 个麦克风)、变化的房间尺寸以及噪声增强。
课程学习: 采用两阶段策略:
在纯净、无噪声的语音上进行训练。
使用干扰声音和变化的信噪比(SNR)进行微调。
LLM 集成: 作者对 Gemma 3n (40 亿参数)进行微调。一个可训练的投影层将 PhaseCoder 的 256 维空间标记映射到 LLM 的 2048 维嵌入空间。这些空间标记被添加在标准单声道音频标记序列之前,并由特殊标记([BSA]、[ESA])进行界定。
LLM 微调任务: LLM 使用课程学习方法执行四项任务:
声源定位: 输出检测到的说话人坐标。
空间推理: 回答关于空间关系的二元(是/否)问题。
空间转录: 在提供位置数据的情况下进行语音转录。
定向转录: 仅转录来自特定空间方向的语音(例如,“左侧的说话人”)。
核心贡献
PhaseCoder 编码器: 一种新型的、纯 Transformer 的编码器,在麦克风无关的定位方面达到了最先进水平(SOTA)。它处理原始音频和坐标,无需特定设备的波束成形器或硬件。
空间音频标记: 证明了该编码器可以产生鲁棒的、与几何结构无关的表示(即“空间音频标记”),适用于下游 LLM 任务。
LLM 集成: 首次展示了通过微调 Gemma 3n 来理解这些空间标记,从而实现复杂的任务,如定向转录和空间推理,且适用于任意麦克风阵列。
结果
定位基准测试: 在真实世界数据集(RSL2019 和 LOCATA)上,PhaseCoder-6M 在具有挑战性的 LOCATA 数据集上优于 SOTA 麦克风无关模型 GI-DOAEnet(86.96% Acc@10 对比 82.48%)。虽然 GI-DOAEnet 在 RSL2019 上表现略好(归因于 PhaseCoder 使用 10 度分类分辨率而非 GI-DOAEnet 的 1 度回归),但 PhaseCoder 提供了更丰富的多任务表示(距离和仰角)。
麦克风扩展性: 随着麦克风数量从 3 个增加到 8 个,性能显著提升,方位角平均绝对误差(MAE)从 80.24° 降至 3.03°。
LLM 性能: 使用空间标记微调 Gemma 在空间推理方面较基准模型(包括零样本 Gemma 和 Gemini 3 Flash)取得了实质性提升(在“是/否”问题上的准确率从约 48% 提高到约 76%)以及定向转录能力的提升。空间标记充当了有效的“集聚/分段提示”(diarization prompts),在多说话人场景下降低了字错率(WER)。
效率: 与 GI-DOAEnet 和 Spatial-AST 等混合模型相比,PhaseCoder 展示了卓越的内存效率和推理速度,这归功于其纯 Transformer 架构。
意义与主张
论文声称填补了通用空间音频编码与 LLM 理解之间的鸿沟。通过使 LLM 能够处理来自任意麦克风阵列的“空间音频标记”,PhaseCoder 允许具身智能体感知并推理其声学环境,而无需受到硬件特定约束。作者断言,这种方法为以下领域开辟了新途径:
无障碍辅助: 通过隔离嘈杂环境中的特定说话人,增强针对听障人士的辅助设备(即“鸡尾酒会效应”)。
硬件无关性: 实现跨越从旧款手机到定制机器人的多样化设备的通用空间理解,而无需重新训练编码器。
具身智能: 为 AI 助手提供通过声音感知并推理物理环境的能力,这是实现自然人机交互的关键一步。
作者指出了一些局限性,包括对全向麦克风的假设(忽略了设备遮挡效应)以及目前侧重于单主导语音源而非完整的声源定位与检测(SELD)。他们建议未来的工作可以整合视觉深度估计,以解决距离歧义问题。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。