VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling
VLZip 引入了一个统一框架,该框架将视觉与文本交织的序列分层压缩为纯 Transformer 中的紧凑软前缀(soft prefixes),从而在显著降低内存使用量的同时,实现了对高达 2M token 的超长上下文的高保真推理,并超越了现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人去理解一个通过数千张照片和数百万个单词交织讲述的故事,这些内容像一个混乱的剪贴簿一样堆叠在一起。这就是视觉-语言模型(VLMs)的世界——这些是能够“看到”图像并“阅读”说明文字以理解发生之事的 AI 大脑。目前,这些机器人擅长观察单张快照或阅读短段落。但当你交给它们一个大规模的、交错排列的故事时——比如一段图像和文本在数小时内来回切换的视频——它们就会撞上一堵墙。问题在于,机器人的大脑运作方式就像一个巨大的网络,每一块信息都必须与所有其他信息相连。随着故事变得越来越长,连接的数量会呈爆炸式增长,导致机器人的大脑耗尽内存并崩溃。这就像试图记住一部 10 小时长电影中的每一个单词,同时还要记住视频的每一帧画面;你的大脑无法同时承载这一切。
科学家们曾尝试通过丢弃故事的一部分(剪枝)或者构建一个完全不同、更简单的脑结构来解决这个问题,但后者可能会降低智能。然而,丢弃部分内容意味着会丢失重要的细节,而改变大脑架构往往会让机器人的推理能力变差。核心问题在于:我们能否保留机器人强大的大脑,同时让它变得足够轻量,以便携带宏大的故事而不至于遗忘情节?
这正是名为 VLZip 的新框架介入的地方。把 VLZip 想象成一位大师级的图书管理员,他不仅仅是通过扔掉书来节省空间,而是为每一章写下一份完美的、精简的摘要,并将其塞进书中的一个特殊口袋里。VLZip 并不强迫机器人去阅读每一个单词或查看 28 万个 token 序列中的每一个像素(这规模巨大!),而是将图像和文本压缩成微小且信息丰富的“软前缀”(soft prefixes)。这些不仅仅是随机的笔记;它们就像是故事主旨的高清快照,专门针对机器人不同层级的思考过程进行了组织。
其运作机制如下:VLZip 接收一段长序列的图像和文本,并将其分解成若干块。对于每一块,它使用一种特殊的工具,将最重要的视觉和文本细节提炼成一组紧凑的 token。至关重要的是,它并不只是将这些信息挤压在一个地方;它将这些压缩后的摘要注入到机器人大脑处理故事的每一个层级中。这就像是在旅程的每一步,都有一个导游在机器人耳边低声提醒关键的情节要点,确保即使它实际观察的序列非常微小,也永远不会脱离叙事的主线。
结果令人印象深刻。研究人员展示了通过 VLZip,机器人可以接受长达 12 万个 token 的序列进行训练——这比标准模型增加了 6 倍——并且实际上可以对长达 28 万个 token 的序列进行推理(阅读并回答相关问题)。当其他方法在这些长度下崩溃或耗尽内存时,VLZip 能让机器人平稳运行,且使用的内存显著减少。事实上,这种设计如此高效,为未来处理高达 200 万个 token 的任务指明了清晰的路径。
为了证明这不仅仅是一种针对简单测试的方法,团队还构建了一个新的基准测试,名为 LongVLBench。不同于以往那些只要求机器人“大海捞针”(简单的查事实任务)的测试,LongVLBench 使用真实的视频叙事。它迫使机器人去理解整个故事、角色之间的互动以及随时间推移的事件流。在这项具有挑战性的测试中,VLZip 不仅赢得了胜利,还树立了新的标准,得分高达 61.9,而排名第二的模型仅为 33.1;并且在面对最长、最复杂的场景时,即便其他模型完全失效,VLZip 仍能保持强劲的表现。
论文指出,这种方法之所以是一个游戏规则的改变者,是因为它统一了图像和文字的压缩,而以往的方法忽略了这一点或处理得不好。通过在保持机器人强大的“Transformer”大脑完整性的同时,为其提供一种更聪明的方式来处理长输入,VLZip 表明我们不需要为了效率而牺牲智能。它证明了通过正确的压缩策略,AI 终于可以开始理解定义现实世界人类活动的、长篇且交错的复杂叙事——无论是遵循详细的操作手册,还是分析数小时的视频片段——而不会感到不堪重负。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。