← 最新论文
⚡ electrical engineering

BAT: Learning to Reason about Spatial Sounds with Large Language Models

本文介绍了 BAT,这是一个将名为 Spatial-AST 的双耳音频编码器与大语言模型(LLaMA-2)相结合的新型框架,旨在实现先进的空间声音感知与推理,并由一个新合成的数据集和专门的问答基准测试提供支持。

原作者: Zhisheng Zheng, Puyuan Peng, Ziyang Ma, Xie Chen, Eunsol Choi, David Harwath

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhisheng Zheng, Puyuan Peng, Ziyang Ma, Xie Chen, Eunsol Choi, David Harwath

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正闭着眼睛走在一条繁忙的城市街道上。你听到的不仅仅是“噪音”;你听到左边传来汽车鸣笛声,身后远处传来警笛声,耳边还有狗吠声。你的大脑是一位顶尖的侦探,利用声音撞击双耳时极其微小的差异,在从未看见世界的情况下构建出一幅3D地图。这种超能力被称为空间音频推理(spatial audio reasoning)。长期以来,计算机只能像在安静房间里使用单个麦克风那样聆听声音,只能告诉你声音是什么(比如狗叫),但无法告诉你声音在哪里或距离有多远。最近,我们赋予了计算机被称为“大语言模型”(LLMs)的“大脑”,它们擅长阅读和写作,甚至我们也教会了它们理解图像和常规音频。但存在一个巨大的鸿沟:这些聪明的计算机大脑仍然无法仅通过聆听来理解一个嘈杂、有回声的房间的3D布局。它们就像是能读懂书本却无法在黑暗森林中穿行的人。

这正是名为 BAT 的新项目发挥作用的地方。BAT 的研究人员希望教会计算机像人类一样去“聆听”世界,使用的是一种模仿我们双耳的特殊音频(称为双耳音频/binaural audio)。他们意识到,要教会计算机这项技能,不能只使用旧数据;他们必须建立一个全新的“游乐场”。因此,他们利用计算机图形学和物理学创建了一个大规模的模拟世界,用以生成数千小时逼真的、带有回声的声景。他们将此与一种被称为 SPATIAL-AST 的新型“老师”相结合,这是一种能够分解声音以寻找其方向和距离的专业化大脑。最后,他们将这个声音专家大脑与一个大型语言模型(LLaMA-2)相连,从而创造出了 BAT。其结果是一个不仅能说出“我听到狗叫”,还能回答复杂问题,如“狗离我比音乐更近吗?音乐是从沙发后面传来的吗?”的系统。

团队发现这种方法效果惊人地好。在测试中,仅靠 SPATIAL-AST 编码器就能以极高的准确度识别声音事件(平均精度 mAP 为 50.03%),并能以约 17.94 度的平均误差推测声音的方向。当他们将此与语言模型结合时,BAT 成为了空间推理的冠军。在需要比较两种不同声音位置的难题上(例如判断喘息声是否比鸟类拍翅声更近),它达到了 76.89% 的准确率。研究人员发现,教导模型的顺序至关重要。如果试图直接教授复杂的推理,模型会感到吃力。但通过使用一种从简单任务(寻找一个声音)开始,然后逐渐过渡到更难任务(寻找两个声音,然后进行比较)的“课程表”,模型学会了有效地分离并推理多个声源。

然而,论文谨慎地指出,这是一种基于模拟的突破,而非尚未实现的现实世界魔棒。数据是在一个名为 SoundSpaces 2.0 的工具中生成的,该工具模拟了声音如何在 3D 建筑中通过墙壁反射。虽然结果很强,但作者承认现实环境是混乱且不可预测的,模拟环境可能无法完全捕捉这些特性。他们还指出,目前的模型最擅长处理同时最多两个声源的情况,并且高度依赖特定的“双耳”格式。他们明确反对仅仅向标准语言模型喂入音频数据的观点;如果没有专门的空间编码器和正确的训练步骤,模型无法理解声音的 3D 特性。论文表明,虽然 BAT 是向前迈出的重要一步,但通往能够纯粹通过声音在现实世界中导航的计算机之路仍在继续,未来的工作仍需处理更复杂的、多声源的环境,并弥合模拟训练与现实应用之间的差距。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →