← 最新论文
💻 computer science

OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

OmniPack 是一个无需训练的框架,它通过结合 LLM 前的结构冗余消除与交互后的语义精炼,增强了全模态大语言模型的效率,在多个基准测试中实现了卓越的性能-效率权衡,同时显著降低了计算成本。

原作者: Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何理解世界。你不仅仅是给它一本书来读;你是在同时给它看一部电影并播放一段配乐。这就是“全模态”(Omni-modal)AI 的精彩世界——在这里,计算机能够同时学习看、听和阅读。但问题在于:电影和配乐的数据量巨大。视频或音频的一秒钟就可以被分解成数千个被称为“Token”的微小数字“砖块”。如果你尝试把整部电影喂给机器人,它会感到应接不暇,就像一个试图在一分钟内读完整个图书馆的学生一样。这不仅处理起来极其缓慢,耗费巨额电费,而且往往会因为信息量过于庞大而感到困惑。科学家们一直试图通过在机器人开始阅读之前,就把那些“无聊”的砖块扔掉,希望能只保留重要的部分。然而,旧的方法在丢弃信息时显得有些笨拙——它们有时仅仅因为某些碎片看起来与邻居不同,就扔掉了至关重要的线索;或者在机器人有机会真正理解故事之前,就试图去猜测什么才是重要的。

于是,OmniPack 出现了,这是一种聪明的全新策略,旨在帮助这些“眼观六路、耳听八方”的机器人工作得更快,且不会让它们崩溃。你可以把 OmniPack 想象成一个针对混乱电影剧本的两步编辑过程。首先,在机器人阅读剧本之前,OmniPack 扮演着一名严格编辑的角色,扫描原始素材。它不仅仅是删掉安静的部分;它还会寻找那些“响亮”的时刻(比如突然的撞击声或闪光),同时确保不会跳过那些在时间轴上发生得较远、但同样重要的安静背景场景。它将相似的砖块组合在一起,从而不再占用额外的空间,创造出一个既保留了故事结构又精简的“精彩集锦”。

但真正的魔力发生在第二步。一旦机器人开始阅读剧本并进行自我思考,OmniPack 会再次介入。这时,它会倾听机器人的提问。如果机器人正在问:“那辆车的颜色是什么?”OmniPack 就知道要保留与汽车和颜色相关的 Token,即使它们原本很安静或很微小。它利用机器人自身的“好奇心”来精炼信息,将最有用的细节合并在一起。其结果是极大地减少了机器人需要完成的工作量。在一个名为 Qwen2.5-Omni-7B 的特定模型上,OmniPack 成功地将工作量缩减到了原始量的 16.7%,同时仍保留了机器人原有的 98.0% 的智能。即使在他们挑战极限、将工作量缩减到极小的 6.8% 时,机器人仍然记得它应该知道的 92.9% 的内容。这就像是将一本厚重的百科全书缩减成了一份单页小册子,但这份小册子竟然依然包含了你所需的所有答案。

研究人员发现,旧的方法之所以经常失败,是因为它们试图过早或过简单地压缩一切。他们指出,仅根据“响亮程度”或“相似性”来丢弃 Token 往往会错过重要的、分散的线索。他们还表明,在机器人有机会将两种感官融合之前,就尝试用音频来压缩视频(或反之亦然)是行不通的。相反,OmniPack 提出了一种“阶段专业化”的方法:首先,根据特定媒体类型(视频或音频)清理其结构;然后,在机器人有机会将两者混合之后,利用特定的任务或问题来进行最终的、智能化的压缩。

在五项不同的挑战测试中,OmniPack 的表现始终优于他们对比过的所有其他方法。无论是在测试短片还是长视频,这种新方法总能在速度与智能之间提供最佳的平衡。作者认为,通过协调这两个阶段——先进行结构化清理,再进行基于问题的智能精炼——我们可以让这些强大的 AI 模型变得更加高效,而无需从头开始重新训练。这是一种让超级聪明的机器人运行得更快、成本更低的方法,即使在信息洪流涌来时,也能保持其敏锐的思维。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →