← 最新论文
💻 computer science

EgoAVU: Egocentric Audio-Visual Understanding

本文介绍了 EgoAVU,这是一个可扩展的数据引擎,它能够自动生成高质量的第一视角视听叙述,以创建 EgoAVU-Instruct 数据集和 EgoAVU-Bench,并证明在这些数据上对多模态大语言模型进行微调,能显著提升它们在第一视角视频中对音频和视觉信号进行联合理解的能力。

原作者: Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你戴着一副高科技眼镜,它记录了你在日常生活中所看到的一切和听到的一切——无论是做晚饭、修理自行车,还是在繁忙的街道上行走。这就是研究人员所说的“第一视角”(egocentric)视频。这是一种第一人称视角,充满了运动感和噪音。

这篇论文介绍了一个名为 EgoAVU(自我视角视听理解)的新项目。你可以把它想象成一个“翻译官”和“老师”,旨在帮助 AI 模型理解这些忙碌、嘈杂的生活日志。

以下是这篇论文的故事,通过简单的形式拆解如下:

1. 问题所在:AI 是“耳聋”且“分心”的

作者发现,目前的超智能 AI 模型(称为多模态大语言模型)非常擅长观察图像和视频,但在摄像头像人类头部一样移动时,它们在听觉方面表现得很糟糕。

  • 偏见(The Bias): 这些 AI 就像只关注视觉的人。如果你给它们看一段有人在切洋葱的视频,AI 可能会完美地描述刀和洋葱,但会完全忽略切菜的声音。
  • 幻觉(The Hallucination): 更糟糕的是,如果视频中有一个声音(比如背景里汽车鸣笛),AI 可能会因为“认为”那里应该有一只狗,就猜那是狗叫声。它在凭空捏造,因为它无法将声音与实际来源联系起来。
  • 数据缺失(The Missing Data): 要教导 AI,你需要一本教科书。但现有的这类视频教科书大多只有文本描述,只谈论人们用手在“做什么”,却忽略了环境中的声音。

2. 解决方案:“EgoAVU”工厂

为了解决这个问题,团队构建了一个庞大的自动化工厂,名为 EgoAVU。他们没有雇佣人类去编写数百万条描述(这既慢又贵),而是制造了一台机器来完成这项工作。

把 EgoAVU 想象成一个三步走的流水线

  • 第 1 步:侦探(增强/Enhancement): 工厂获取原始视频片段,并要求不同的 AI “侦探”在不看声音的情况下观察视频,以及在不看视频的情况下聆听音频。这可以防止 AI 产生混淆。一位侦探列出每一个物体;另一位侦探列出每一种声音。
  • 第 2 步:编辑(过滤/Filtering): 并非所有的视频都适合用于教学。有些视频太枯燥或重复性太高。工厂使用一个“词汇计量器”(称为 MATTR)来检查一个视频中有多少不同的单词和声音。如果一个视频只是某人在盯着墙看,它就会被丢弃。如果是一个充满切菜声、滋滋声和说话声的混乱厨房,它就会被保留下来。
  • 第 3 步:讲述者(图谱生成/Graph Generation): 这是神奇的一步。工厂提取物体列表和声音列表,并构建一张地图(称为多模态上下文图谱)。这张地图将点与点连接起来:“刀(物体)撞击了砧板(动作),发出了嗒嗒声(声音)。” 它迫使 AI 理解这个声音属于那个特定的动作。

3. 结果:一本新教科书和一场新考试

利用这个工厂,他们创造了两样东西:

  • EgoAVU-Instruct(教科书): 一个拥有 300 万个问答对的海量图书馆。这些问题不仅仅是“这是什么?”这类问题。它们是复杂的谜题,例如:“在人打开冰箱之前发生了什么声音?” 或者 “请描述这个场景,包括背景噪音。”
  • EgoAVU-Bench(期末考试): 一个包含 3,000 个经过验证的问题的严格测试,用以观察 AI 是否真的学会了知识。

4. 重大发现

当他们让现有的 AI 模型参加这场新考试时,这些模型表现得一塌糊涂。

  • 它们忽略了音频。
  • 它们无法分辨哪个声音来自哪个物体。
  • 它们会编造不存在的声音。

然而,当他们让这些相同的 AI 模型学习 EgoAVU 教科书后,它们变成了超级明星。

  • 提升: 它们的表现在新测试中提升了高达 113%
  • 迁移能力: 这种新技能不仅限于针对该特定测试。它们在其他现有测试(如理解视频时序或识别错觉)中的表现也提升了高达 28%

核心结论

这篇论文证明了目前的 AI 模型是“以视觉为中心”的,并且需要学习如何倾听。通过构建一个能自动创建将声音与特定视觉动作相联系的高质量训练数据的机器,作者教会了这些模型终于能够“听见”它们所看到的画面。

简而言之: 他们制造了一台机器,教导 AI 不要再忽视生活的背景音,而是开始将噪音与动作联系起来,从而让 AI 在理解现实世界的第一视角视频时变得更加聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →