← 最新论文
⚡ electrical engineering

Array-Agnostic Ambisonics Encoding via Diffusion Posterior Sampling

该论文介绍了 ADEPS,这是一个利用扩散后验采样(diffusion posterior sampling)来实现在任意麦克风阵列几何结构下的零样本 Ambisonics 编码的生成式框架,它通过显式地对物理采集约束进行建模,从而在空间和频谱保真度方面超越了传统方法。

原作者: Amit Milstein, Nir Shlezinger, Boaz Rafaely

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Amit Milstein, Nir Shlezinger, Boaz Rafaely

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图捕捉一个房间在三维空间中真实存在的声场——不仅仅是来自单一点的平面录音,而是一个完整的球形音频,让听者能够清晰地听到声音究竟来自何处、如何从墙壁反射,以及空间本身是如何塑造声音的。这就是空间音频(spatial audio)所承诺的愿景,这项技术正在改变我们体验音乐、电影和虚拟现实的方式。为了实现这一目标,工程师通常使用一种称为 Ambisonics(高保真立体声/全景声)的格式,它通过一组系数在数学上描述声场,这些系数就像是 3D 声音的一种通用语言。理论上,这种语言无论声音是如何录制的都应该适用。然而在实践中,用于捕捉音频的物理麦克风会引入其独特的失真。麦克风排列的具体形状、麦克风的数量,甚至声波绕过硬件时的衍射方式,都会产生使录音变得浑浊的伪影。多年来,解决方案一直是为每种特定的麦克风设置构建定制软件,这种僵化的方法在硬件发生变化或录制环境变得复杂时就会失效。

内盖夫本·古里安大学的一组研究人员开发出了一种新方法来解决这个问题,使得几乎任何麦克风排列都能实现高质量的 3D 音频录制,而无需为每个新设置重新训练软件。他们将该系统称为 ADEPS,这是一个将录制过程视为一个拼图的框架,其目标是从有缺陷的现实世界录音中重建出完美的、理想的声场。研究人员并没有试图去学习每种可能麦克风阵列的特性,而是利用完美的理论声音数据训练了一个计算机模型。该模型学习了洁净、无失真的 3D 声场应当呈现出的样子,完全忽略了物理麦克风带来的混乱现实。在处理实际录音时,该系统使用一种复杂的数学技术来引导模型。它从嘈杂、不完美的录音开始,要求模型逐步进行精细化处理,直到结果既符合学习到的理想声音,又符合麦克风捕获的实际测量值。这个过程有效地剥离了由特定硬件引起的失真,留下了清晰、准确的 3D 音频表现。

研究人员将这种方法与传统方法进行了对比测试,涵盖了广泛的模拟和现实场景。他们将新系统与标准的线性编码(一种常见但往往存在缺陷的数学方法)以及尝试推测声源方向的参数化方法进行了比较。在涉及不同数量麦克风(从仅有的 4 个到复杂的阵列)以及具有不同回声程度的房间进行的测试中,新方法始终能产生更清晰、更准确的结果。它降低了声音频率方面的误差,并提高了听者感知音频的方向感和深度感的能力。即使当系统被要求处理从未见过的麦克风排列,或者录制设置比模型训练时更为复杂时,它仍然优于现有的解决方案。该系统在消除常困扰小型麦克风阵列的低频噪声,以及抑制因麦克风数量不足以捕捉完整细节而产生的高频失真方面,表现得尤为出色。

这项工作的意义在于其灵活性。以往的数据驱动方案要求每当麦克风数量或排列发生变化时都要重新训练软件,这使得它们在动态环境中变得不切实际。而这种新方法通过将声音捕获的物理定律直接嵌入到重建过程中,使其能够即时适应任何配置。研究人员证明,即使在麦克风数量有限的情况下(这是智能手机或虚拟现实头显等消费级设备的常见限制),该方法依然有效。虽然目前的系统版本旨在处理可由现有麦克风解析的声场,但这一方法的成功预示了处理更复杂声学挑战的一条路径。通过将“声音应当是什么”的学习与“如何捕获声音”的机制相分离,研究人员创造出了一种工具,使 Ambisonics 的理论纯粹性更接近于现实应用,提供了一种稳健、灵活且极其清晰的沉浸式声音捕捉方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →