← 最新论文
⚡ electrical engineering

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

本文介绍了 Audio-Visual Flamingo (AV-Flamingo),这是一个完全开源的先进大语言模型,旨在通过利用一个大规模的新数据集、一个渐进式的三阶段训练课程以及一种新颖的时序交错思维链框架,实现对长时、复杂现实世界视频的联合理解与推理。

原作者: Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon K
发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在看电影。你看到了演员的面孔、场景和动作,但你也听到了对话、背景音乐、脚步声以及树叶的沙沙声。长期以来,计算机就像那些闭着眼睛看电影的人,只能听到音频轨道,或者反之亦然。它们擅长识别图片中的猫或转录一段演讲,但在理解一个“猫在屏幕上跑过时同时发出喵喵叫”的完整场景方面却很吃力。这个研究领域被称为“多模态”智能,即机器试图结合不同的感官——比如视觉和听觉——来像人类一样理解世界。研究人员一直在问一个大问题:我们能否构建出一种 AI,它不仅仅是观察一段视频或聆听一段播客,而是真正能够思考声音与画面是如何协同工作的,尤其是当故事漫长且复杂时?

于是,Nemotron-Labs-Audio-Visual Flamingo(简称 AV-Flamingo)出现了,这是一种由 NVIDIA 和马里兰大学的研究人员设计的全新 AI 大脑。把之前的视频 AI 想象成只能阅读教科书单页并回答快速问题的学生。如果你要求它们总结一部完整的电影,或者解释一个持续 15 分钟且不断变化的复杂场景,它们会迷失方向、忘记开头,或者搞混角色。AV-Flamingo 则不同。它就像一名超级专注的学生,可以观看整部电影,聆听原声带,然后坐下来写一篇详尽的文章,阐述音乐是如何改变情绪的、角色为何做出某种反应,或者某个特定声音是在何时相对于视觉事件发生的。

研究人员发现,为了实现这一点,他们不能只是向 AI 输入更多旧有的数据。他们必须教它三个新技巧。首先,他们创建了一个包含约 700 万个真实世界视频示例(包括 480 万个问答对)的大型库,专门用于测试 AI 在时间维度上连接声音与视觉的能力。他们称之为 Audio-Visual-Skills(视听技能)。其次,他们并没有直接把 AI 扔进深水区;他们使用了一种“课程”机制,从短片段开始教授基础技能,然后慢慢过渡到更长、更复杂的视频,以教会它如何追踪一个故事随时间的发展。第三,也是最巧妙的一点,他们教会了 AI 使用一种被称为 Temporal Audio-Visual Interleaved Chain-of-Thought(时序视听交织思维链)的“思考过程”。想象一下,AI 在看视频时每隔几秒就会停顿一下并说:“好的,就在这一秒,鼓声响起了,然后角色跳了起来。”这有助于让 AI 的思维在时间轴上保持一致,使其不会对先后顺序感到困惑。

结果非常令人印象深刻。在针对 15 种以上不同挑战(范围涵盖理解音乐、语音到分析长视频及回答棘手问题)的测试中,AV-Flamingo 以明显的优势击败了其他同等规模的开源模型。事实上,它甚至能够与目前世界上最强大、最昂贵的“闭源”模型(即那些你看不到代码的模型)相抗衡,甚至有时能超越它们。该论文表明,该模型特别擅长处理那些线索散落在时间轴上的长篇、复杂的真实世界视频,这证明了通过正确的数据和训练方法,开源 AI 可以赶上那些巨头。这是赋予计算机真正“观察与聆听”世界能力的一大步,而不仅仅是盯着世界看。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →