✨ 要点🔬 技术摘要
想象一下,你正试图教一个超级聪明的机器人如何理解世界。你不仅仅是给它一本书来读;你是在同时给它看一部电影并播放一段配乐。这就是“全模态”(Omni-modal)AI 的精彩世界——在这里,计算机能够同时学习看、听和阅读。但问题在于:电影和配乐的数据量巨大。视频或音频的一秒钟就可以被分解成数千个被称为“Token”的微小数字“砖块”。如果你尝试把整部电影喂给机器人,它会感到应接不暇,就像一个试图在一分钟内读完整个图书馆的学生一样。这不仅处理起来极其缓慢,耗费巨额电费,而且往往会因为信息量过于庞大而感到困惑。科学家们一直试图通过在机器人开始阅读之前,就把那些“无聊”的砖块扔掉,希望能只保留重要的部分。然而,旧的方法在丢弃信息时显得有些笨拙——它们有时仅仅因为某些碎片看起来与邻居不同,就扔掉了至关重要的线索;或者在机器人有机会真正理解故事之前,就试图去猜测什么才是重要的。
于是,OmniPack 出现了,这是一种聪明的全新策略,旨在帮助这些“眼观六路、耳听八方”的机器人工作得更快,且不会让它们崩溃。你可以把 OmniPack 想象成一个针对混乱电影剧本的两步编辑过程。首先,在机器人阅读剧本之前,OmniPack 扮演着一名严格编辑的角色,扫描原始素材。它不仅仅是删掉安静的部分;它还会寻找那些“响亮”的时刻(比如突然的撞击声或闪光),同时确保不会跳过那些在时间轴上发生得较远、但同样重要的安静背景场景。它将相似的砖块组合在一起,从而不再占用额外的空间,创造出一个既保留了故事结构又精简的“精彩集锦”。
但真正的魔力发生在第二步。一旦机器人开始阅读剧本并进行自我思考,OmniPack 会再次介入。这时,它会倾听机器人的提问。如果机器人正在问:“那辆车的颜色是什么?”OmniPack 就知道要保留与汽车和颜色相关的 Token,即使它们原本很安静或很微小。它利用机器人自身的“好奇心”来精炼信息,将最有用的细节合并在一起。其结果是极大地减少了机器人需要完成的工作量。在一个名为 Qwen2.5-Omni-7B 的特定模型上,OmniPack 成功地将工作量缩减到了原始量的 16.7% ,同时仍保留了机器人原有的 98.0% 的智能。即使在他们挑战极限、将工作量缩减到极小的 6.8% 时,机器人仍然记得它应该知道的 92.9% 的内容。这就像是将一本厚重的百科全书缩减成了一份单页小册子,但这份小册子竟然依然包含了你所需的所有答案。
研究人员发现,旧的方法之所以经常失败,是因为它们试图过早或过简单地压缩一切。他们指出,仅根据“响亮程度”或“相似性”来丢弃 Token 往往会错过重要的、分散的线索。他们还表明,在机器人有机会将两种感官融合之前,就尝试用音频来压缩视频(或反之亦然)是行不通的。相反,OmniPack 提出了一种“阶段专业化”的方法:首先,根据特定媒体类型(视频或音频)清理其结构;然后,在机器人有机会将两者混合之后,利用特定的任务或问题来进行最终的、智能化的压缩。
在五项不同的挑战测试中,OmniPack 的表现始终优于他们对比过的所有其他方法。无论是在测试短片还是长视频,这种新方法总能在速度与智能之间提供最佳的平衡。作者认为,通过协调这两个阶段——先进行结构化清理,再进行基于问题的智能精炼——我们可以让这些强大的 AI 模型变得更加高效,而无需从头开始重新训练。这是一种让超级聪明的机器人运行得更快、成本更低的方法,即使在信息洪流涌来时,也能保持其敏锐的思维。
技术摘要:OmniPack
问题陈述 全模态大语言模型(Omni-LLMs)通过对文本、图像、视频和音频进行统一建模,在统一视听理解方面取得了显著成功。然而,视觉和音频输入所需的密集标记化(tokenization)导致序列长度远超文本,在推理过程中产生了极高的计算和内存开销。虽然为了高效部署进行标记压缩是必要的,但现有方法在面对激进的标记预算时面临关键局限性:
结构建模不足: Pre-LLM(大模型前)压缩方法通常依赖于局部重要性或相似性,无法捕捉长程时空结构。这导致了全局分布证据的丢失,例如长视频中的稀疏事件或瞬态声学线索。
跨模态协作不足: 现有方法要么在 LLM 之前进行压缩(此时音频和视觉表示之间的语义交互有限),要么在 LLM 内部进行压缩(主要依赖文本引导,而未显式建模音视频协作)。因此,它们无法充分利用任务相关的跨模态证据。
方法论:OmniPack 作者提出了 OmniPack ,这是一个无需训练的两阶段渐进式框架,旨在协调 LLM 前的结构化压缩与 LLM 内的语义细化。
1. 模态特定的 Pre-LLM 压缩 该阶段在 LLM 之前运行,旨在去除结构冗余,同时保留显著证据和全局覆盖。它采用了三种不同的机制:
重要性选择(Importance Selection): 利用编码器注意力统计数据和模态特定的结构线索来识别主导标记。对于视频,包括相邻帧变化和空间显著性;对于音频,包括相邻标记变化以检测声学边界。
覆盖范围选择(Coverage Selection): 为了防止过度集中在显著区域,此步骤使用结合了特征相似度和归一化时空距离的联合距离度量来选择额外的代表性标记。它利用 DPC-KNN 来确保广泛的时空覆盖。
感知相似性的标记合并(Similarity-Aware Token Merging): 与直接丢弃未被选中的标记不同,这些标记的信息会被聚合到保留的代表标记中。未选中的标记根据特征相似性、位置邻近性和目标标记的重要性,被分配给最相似的保留标记,从而有效地将冗余信息转移到保留集合中。
2. 查询驱动的 Inner-LLM(LLM 内部)压缩 在最初的 ℓ \ell ℓ 个 Transformer 块内完成充分的模态交互后,第二阶段压缩会对保留的表示进行细化。该阶段利用:
文本引导(Textual Guidance): 源自文本隐藏状态的全局查询表示引导任务相关标记的选择。
音视频协作(Audio-Visual Collaboration): 标记的相关性得分通过考虑其与文本查询的相似性、与其另一 模态原型(例如,考虑音频上下文的视觉标记)的相似性,以及其模态内的代表性来计算。
多样性感知选择(Diversity-Aware Selection): 通过迭代选择标记来平衡相关性与语义多样性,确保保留集合覆盖必要的信息谱系。
相关性调节的合并(Relevance-Modulated Merging): 未被选中的隐藏状态通过受相关性得分调节的相似性加权平均,被合并到保留的代表中。
核心贡献
识别局限性: 本文指出,由于长程结构建模不足以及未能充分利用查询驱动的跨模态证据,现有的 Omni-LLM 压缩在激进预算下表现不佳。
统一框架: OmniPack 引入了一种无需训练的渐进式策略,将模态特定的 Pre-LLM 结构化压缩与查询驱动的 Inner-LLM 语义压缩相结合,并通过将移除的信息合并到保留的代表中来最小化信息损失。
性能-效率权衡: 该框架旨在实现激进的标记压缩,同时保持高水平的多模态理解性能。
实验结果 研究人员在五个基准测试(AVUT, WorldSense, DailyOmni, VideoMME, LVOmniBench)上,使用三个 Omni-LLM 后端(Qwen2.5-Omni-3B/7B 和 MiniCPM-o-2.6)进行了广泛实验。
性能: 在 Qwen2.5-Omni-7B 上,OmniPack 保留了 98.0% 的原始性能,同时将 FLOPs 降低至 16.7% 。在极端压缩(仅保留 6.8% 的原始 FLOPs)的情况下,仍能保留 92.9% 的原始性能。
对比: 在不同的保留比例下,OmniPack 始终优于现有的最先进(SOTA)无需训练的基线方法(包括 FastV-om, VisionZip-om, OmniZip, OmniSIFT 以及 SEATS 变体)。
效率: 在 15%/7.5% 的保留比例(Pre-LLM/最终)下,OmniPack 实现了 10.0 倍的 FLOPs 降低 和 4.5 倍的 Prefill 加速 ,同时保留了 95.6% 的原始性能。
消融实验: 研究证实,结合重要性选择、覆盖范围选择和标记合并可获得最佳的 Pre-LLM 结果。此外,与独立或通用策略相比,Inner-LLM 压缩显著受益于音视频协作和文本感知引导。
意义 本文声称 OmniPack 在无需重新训练模型的情况下,解决了 Omni-LLMs 计算开销的关键瓶颈。通过将压缩从纯粹的结构化线索转向任务驱动的语义,并采用协调的两阶段过程,该框架使得 Omni-LLMs 在资源受限的设备上进行实际部署成为可能。结果表明,可以通过激进的标记压缩实现,且不会牺牲模型理解复杂、动态且随时间演变的现实世界场景的能力,从而在领域内建立了新的性能-效率权衡标杆。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。