Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models
本文介绍了 ST-OmniQA,这是一个包含 4 万个全景视频和 Ambisonics 音频的大规模时空音视频基准测试,并提出了 ST-Omni-R1,该模型通过渐进式课程学习和强化学习将定向音频线索与视觉上下文相结合,以对声源的身份、位置和运动进行推理,从而显著优于基准模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你闭着眼睛走在一条繁忙的街道上。你听到狗在吠叫、汽车在鸣笛、有人在笑。你的大脑并不仅仅是听到“噪音”;它能瞬间分辨出是什么发出了声音、声音从哪里传来以及它正向哪里移动。它知道那只狗正向左跑,汽车正从右侧驶来,而笑声则来自一个你尚未看见的人。这种将听觉与视觉结合起来追踪移动物体的能力是人类的一种超能力,但对计算机来说却是一场噩梦。
长期以来,理解音频的计算机程序(音频-语言模型)就像是闭着眼睛的人:它们能告诉你有一只狗在叫,但无法告诉你这只狗是在向你跑来还是在远离你。另一方面,理解视频的程序(视觉-语言模型)则像是塞住了耳朵的人:它们能看到一只狗,但不知道这只特定的狗是否正在叫,还是只是静静地站在那里。目前的科学挑战在于构建一个能够同时完成这些工作的机器人大脑——既能听声音,又能看视频,并弄清楚声音源在空间和时间中是如何移动的。这篇论文正是针对这一问题,试图教机器如何同时实现“听、看、追踪”。
问题所在:“盲人”与“聋子”机器人
本文作者注意到当前智能计算机思维中的一个差距。有些模型擅长理解音频,但它们将整个视频片段视为一个巨大的、模糊的声音事件。它们忽略了声音来自“哪里”或如何移动的细节。其他模型则擅长观察视频,但它们依赖的音频过于简单,缺乏足够的“空间”信息(如方向或距离)来感知位置。
这就像是在拥挤的公园里寻找朋友。如果你只有声音的描述(音频),你可能知道他们在那里,但你无法指明他们的位置。如果你只有一张照片(视频),你可以看到他们,但你不知道他们是否就是那个说话的人。要真正理解场景,你需要将声音与人匹配起来,并追踪他们在走过树后或绕过拐角时的移动轨迹。现有的模型在处理这种“绑定”问题时表现挣扎——它们难以轻松地将移动的声音与视频中移动的物体联系起来。
解决方案:一个新的游乐场和一个新的大脑
为了解决这个问题,研究人员创建了两样东西:一个巨大的全新测试集 ST-OmniQA 和一个新的 AI 模型 ST-Omni-R1。
1. 测试集:ST-OmniQA
想象一个巨大的视频游戏,摄像机进行 360 度旋转(全景视频),且声音是由能够精确记录声音来源位置的特殊麦克风(称为一阶汉米尔顿音频,即 FOA)录制的。研究人员构建了一个包含 40,000 个此类视频片段和 400,000 个相关问题的数据库。
问题难度分为四个等级,就像视频游戏一样:
- 等级 A(基础): “这是什么声音?”或“它离多远?”
- 等级 B(人群): “有两只狗在叫;哪一只在左边?”
- 等级 C(追逐): “哪个声源正朝着站在那里的人移动?”
- 等级 D(谜题): “在 2 到 3 秒之间听到了一种声音,但声源当时还不可见。它在 3 到 5 秒之间从左侧门进入。它是谁?”
这个测试迫使 AI 不仅仅是猜测,而是要对时间、空间以及声音与视觉如何契合进行推理。
2. 大脑:ST-Omni-R1
研究人员构建了一个新的 AI 模型来应对这项测试。该模型并非仅仅处理一段平面的音频文件,而是使用一种特殊的“翻译器”(STA 编码器),将 3D 音频数据转化为一系列“轨迹标记”(trajectory tokens)。你可以把这些标记想象成面包屑,它们为 AI 指明了声音随时间移动的精确路径。
该模型通过阶段性学习,就像学生上学一样:
- 阶段 A: 它学习识别简单的声音及其位置。
- 阶段 B: 它学习同时处理多个声音。
- 阶段 C: 它学习比较不同声音相对于彼此的移动方式。
- 阶段 D: 它学习将声音与视频中的特定物体联系起来,即使该物体消失在墙后(遮挡)并随后重新出现。
为了让模型更聪明,他们使用了“推理树强化学习”技术。想象 AI 正在解开一个谜题。系统并没有直接给它答案,而是检查它思考过程中的每一步。如果 AI 说“狗在左边”,系统会检查 AI 是否正确识别了狗,是否正确看到了它在左边,以及是否正确地将吠叫声与狗联系在一起。如果步骤不匹配,AI 就会收到“红笔”纠正。这有助于模型学习保持一致性和逻辑性。
结果:一次巨大的飞跃
当研究人员让 ST-Omni-R1 参加 ST-OmniQA 测试时,它的表现非常出色。
- 最优秀的现有模型(如目前最智能的通用 AI)平均只能答对约 37.28% 的问题。
- ST-Omni-R1 在经过专门训练后,达到了 77.83% 的准确率。
这不仅仅是一个小幅度的提升,而是一个巨大的跨越。该模型证明了它能够处理复杂的场景,例如追踪一个躲在物体后方并随后重新出现的声源,或者区分两个向不同方向移动的相似声音。
研究人员还在三个其他现实世界的音频数据集(TAU-NIGENS, L3DAS22, 和 STARSS23)上测试了他们的模型,而这些数据集是它从未见过的。即使没有经过针对性的训练,ST-Omni-R1 依然优于之前的最佳模型。这表明,该模型学习理解空间和运动的方式是一种可以应用在多种不同情况下的技能,而不仅仅局限于他们构建的特定测试。
为什么这很重要
这篇论文表明,我们正接近赋予计算机像人类一样“听”和“看”世界作为一个完整、动态故事的能力。通过教机器去追踪一个声源的旅程——知道它从哪里开始,去了哪里,以及即使在被遮挡时看起来是什么样的——我们正在为能够真正理解我们动态、嘈杂且视觉丰富的世界的机器人和虚拟助手奠定基础。作者认为,这种结合 3D 音频与全景视频,并教 AI 进行逐步推理的方法,是解锁下一阶段智能的关键。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。