✨ 要点🔬 技术摘要
想象一下你正在看电影。你看到了演员的面孔、场景和动作,但你也听到了对话、背景音乐、脚步声以及树叶的沙沙声。长期以来,计算机就像那些闭着眼睛看电影的人,只能听到音频轨道,或者反之亦然。它们擅长识别图片中的猫或转录一段演讲,但在理解一个“猫在屏幕上跑过时同时发出喵喵叫”的完整场景方面却很吃力。这个研究领域被称为“多模态”智能,即机器试图结合不同的感官——比如视觉和听觉——来像人类一样理解世界。研究人员一直在问一个大问题:我们能否构建出一种 AI,它不仅仅是观察一段视频或聆听一段播客,而是真正能够思考声音与画面是如何协同工作的,尤其是当故事漫长且复杂时?
于是,Nemotron-Labs-Audio-Visual Flamingo (简称 AV-Flamingo )出现了,这是一种由 NVIDIA 和马里兰大学的研究人员设计的全新 AI 大脑。把之前的视频 AI 想象成只能阅读教科书单页并回答快速问题的学生。如果你要求它们总结一部完整的电影,或者解释一个持续 15 分钟且不断变化的复杂场景,它们会迷失方向、忘记开头,或者搞混角色。AV-Flamingo 则不同。它就像一名超级专注的学生,可以观看整部电影,聆听原声带,然后坐下来写一篇详尽的文章,阐述音乐是如何改变情绪的、角色为何做出某种反应,或者某个特定声音是在何时相对于视觉事件发生的。
研究人员发现,为了实现这一点,他们不能只是向 AI 输入更多旧有的数据。他们必须教它三个新技巧。首先,他们创建了一个包含约 700 万 个真实世界视频示例(包括 480 万 个问答对)的大型库,专门用于测试 AI 在时间维度上连接声音与视觉的能力。他们称之为 Audio-Visual-Skills (视听技能)。其次,他们并没有直接把 AI 扔进深水区;他们使用了一种“课程”机制,从短片段开始教授基础技能,然后慢慢过渡到更长、更复杂的视频,以教会它如何追踪一个故事随时间的发展。第三,也是最巧妙的一点,他们教会了 AI 使用一种被称为 Temporal Audio-Visual Interleaved Chain-of-Thought (时序视听交织思维链)的“思考过程”。想象一下,AI 在看视频时每隔几秒就会停顿一下并说:“好的,就在这一秒,鼓声响起了,然后 角色跳了起来。”这有助于让 AI 的思维在时间轴上保持一致,使其不会对先后顺序感到困惑。
结果非常令人印象深刻。在针对 15 种以上不同挑战 (范围涵盖理解音乐、语音到分析长视频及回答棘手问题)的测试中,AV-Flamingo 以明显的优势击败了其他同等规模的开源模型。事实上,它甚至能够与目前世界上最强大、最昂贵的“闭源”模型(即那些你看不到代码的模型)相抗衡,甚至有时能超越它们。该论文表明,该模型特别擅长处理那些线索散落在时间轴上的长篇、复杂的真实世界视频,这证明了通过正确的数据和训练方法,开源 AI 可以赶上那些巨头。这是赋予计算机真正“观察与聆听”世界能力的一大步,而不仅仅是盯着世界看。
技术摘要:Nemotron-Labs-Audio-Visual Flamingo (AV-Flamingo)
1. 问题陈述
尽管视频在全网流量中占据主导地位,且人类感知世界的方式是连续的视听序列,但当前的语言大模型(LLMs)在理解和推理长篇、复杂视频方面仍表现挣扎。现有的音频-视觉大语言模型(AV-LLMs)主要关注短视频片段,并且通常将音频和视觉模态分开处理,或者依赖于隐式的跨模态学习。关键挑战包括:
数据稀缺性: 缺乏大规模、高质量、专为联合推理设计的配对视听数据,尤其是在长篇内容方面。大多数可用资源是单模态的,或仅限于以识别为导向的短任务。
架构局限性: 当前的模型往往表现出“视觉偏差”,即深层网络会优选视觉并抑制潜在的音频表示,导致联合感知能力较差。
时间推理: 现有方法无法有效地将中间推理步骤锚定到长音频-视觉流中的特定时间戳,导致随着视频时长的增加,性能出现退化。
封闭生态系统: 最强大的模型通常是闭源或仅提供开放权重的,这阻碍了可复现性和开放性的进展。
2. 方法论
作者提出了 Nemotron-Labs-Audio-Visual Flamingo (AV-Flamingo) ,这是一个完全开放的前沿 AV-LLM,旨在对长且复杂的现实世界视频进行联合理解与推理。该方法构建在三个核心技术支柱之上:
A. 架构
AV-Flamingo 基于 OmniVinci 架构,使用 Qwen2.5-7B 作为基础 LLM。该系统集成了五个关键组件:
SigLip 视觉编码器: 从图像和视频帧中提取密集的空间特征,并通过“先空间缩放后压缩”的动态 S2 模块进行处理,以在不产生过度 Token 消耗的情况下处理高分辨率输入。
AF-Whisper 音频编码器: 一个基于 Whisper 的编码器,使用滑动窗口机制来处理任意长度的音频(切分为 30 秒的块),而不会发生截断。
跨模态对齐: 视觉和音频 Token 序列在时间上交错并使用 约束旋转位置嵌入 (CRTE) 进行对齐。这确保了 LLM 能够区分多模态事件的顺序和相对时间。
LLM 主干网络: 以自回归方式处理交错的 Token 序列。
流式 TTS: 一个仅解码器(decoder-only)的 Transformer 模块,支持实时语音对语音交互。
B. 数据策展:音频-视觉技能 (AV-Skills)
为了解决数据瓶颈,作者引入了 AV-Skills ,这是一个大规模数据集,包含约 700 万个训练实例 (描述和问答对),涵盖短视频(最高 60 秒)和长视频(60 秒至 15 分钟)。
来源: 衍生自公开数据集(如 YouTube-8M, LSMDC, MovieClips)和互联网公开视频。
技能聚焦: 不同于以往侧重于识别的任务,AV-Skills 针对复杂的推理技能,包括:
短篇形式: 关系推理、情感变化、时间推理、空间感知、因果推理、幻觉检测以及计数(音频/视频)。 【注:此处原文为列表项,保持结构】
长篇形式: 大海捞针式推理、时间引用/排序、子场景理解、整体推理、主题级推理以及详细描述。
C. 训练课程
模型经历了一个 三阶段课程 来逐步扩展能力:
预训练(短上下文): 从 OmniVinci 开始初始化,并在混合了单模态数据和 AV-Skills-Short (最大时长 5 分钟,16K 上下文)的数据集上进行全参数微调。这在保留基础技能的同时引入了跨模态推理。
中训练(长上下文): 扩展到 AV-Skills-Long 数据(最大时长 15 分钟,32K 上下文)。此阶段侧重于长篇描述、精确的时间定位和复杂问答,并通过降采样数据保留短上下文技能。由此产生的模型为 AVF-Instruct 。
后训练(推理): 在 AV-Think (一个包含“问题-答案-推理”三元组的数据集)上进行训练。此阶段采用监督微调(SFT)以及 群体相对策略优化 (GRPO) 强化学习。目标是生成锚定在特定时间戳上的结构化、分步骤的逻辑推导。最终模型为 AVF-Think 。
D. 时间音频-视觉交错思维链 (TAVIT)
一种全新的推理框架,其中中间推理步骤被显式地锚定到音频和视觉流中的时间戳(例如使用 <t>...</t> 标签)。这提高了时间对齐度、可解释性,以及模型导航长且复杂流的能力。
3. 核心贡献
AV-Flamingo 模型: 一个完全开放的前沿 AV-LLM,能够对长篇、复杂的现实世界视频进行联合音频-视觉理解与推理。
可扩展方案: 一个面向下一代 AV-LLM 的全面框架,包括互联网规模的数据策展 (AV-Skills)、针对性的能力扩展以及具备时间定位能力的推理 (TAVIT)。
开源发布: 作者开源了模型权重、训练代码、推理代码及相关技术,以支持未来的研究。
性能表现: AV-Flamingo 在同等规模的开源模型中以明显优势脱颖而出,并在长篇和复杂任务上保持高度竞争力,甚至超越了许多规模更大的开源及闭源模型(如 Gemini 2.5 Pro, GPT-4o)。
4. 实验结果
模型在音频、视觉、全模态及语音理解方面的 15 个以上基准测试 中进行了评估。
全模态理解: AVF-Think 在 WorldSense 上达到 51.6% ,在 DailyOmni 上达到 73.9% ,超越了 Qwen2.5-Omni 和 OmniVinci。在 MMOU(一个针对长视频推理的基准测试)上,AVF-Think 达到了 60.2% ,显著优于开源基线 Minicpm-o 4.5 (46.8%),并接近了专有模型 Gemini-2.5 Pro (64.2%)。
视频理解: 在 Video-MME 上,AVF-Instruct 在无字幕情况下得分为 70.7% ,有字幕情况下为 71.2% ,超过了 NVILA 和 OmniVinci。
音频理解: AVF-Instruct 在 MMAU 上获得了最佳平均得分 (73.49 ),优于 Audio Flamingo 3 和 OmniVinci。它还在多个 ASR 基准测试中创下了新的 SOTA 结果,包括在 LibriSpeech test-clean 上达到 1.64 WER 。
鲁棒性: 该模型在未见任务上展现了强大的泛化能力,并在其他模型性能通常会下降的长篇视频任务中表现出极强的鲁棒性。
5. 意义与声明
论文声称,AV-Flamingo 代表了将 开源音频-视觉智能 从学术基准扩展到更广阔领域的重要一步。通过利用互联网规模的数据和针对性的后训练推理,它解决了长篇、具有时间定位能力的视听理解方面的关键空白。
作者强调,模型、数据和代码的发布降低了缺乏专有资源的研究人员的使用门槛,促进了更具包容性的研究生态系统。他们承认了一些局限性,例如来自开源互联网数据的潜在来源偏差,以及在极长视频中面对极度密集或稀疏证据时的挑战,但也将 AV-Flamingo 定位为未来开源音频-视觉系统的稳健基础。这项工作凸显了显式的时间定位和跨模态推理对于从简单的识别迈向真正的复杂现实世界视频内容理解是至关重要的。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。