← 最新论文
💻 computer science

LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?

LLaVA-UHD v4 引入了一种高分辨率视觉编码方案,该方案将基于切片的编码与 ViT 内部早期压缩相结合,在保持或超越现有多模态大语言模型性能的同时,将视觉编码的浮点运算量降低了 55.8%。

原作者: Kechen Fang, Yihua Qin, Chongyi Wang, Wenshuo Ma, Tianyu Yu, Yuan Yao

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Kechen Fang, Yihua Qin, Chongyi Wang, Wenshuo Ma, Tianyu Yu, Yuan Yao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一张繁忙城市街道的超高清巨幅照片。你希望一个超级智能的 AI 助手(多模态大语言模型,即 MLLM)查看这张照片并回答相关问题,例如“面包店的招牌上写的是什么?”或“有多少人正在过马路?”

问题在于,这张照片过于巨大,包含了数百万个微小的细节(像素)。如果你将整个照片一次性喂给 AI,它会不堪重负。这就像试图在一秒钟内读完图书馆里所有的书。AI 会陷入试图同时处理所有信息的困境,导致运行速度慢且成本高昂。

本文的作者,LLaVA-UHD v4,决定重新思考如何将这些巨型图像喂给 AI。他们发现了两个巧妙的技巧,可以在不丢失任何重要细节的情况下加快处理速度。

1. “切片与分割”策略(而非整块派)

旧方法: 传统上,人们试图将整张巨型图像一次性输入 AI 的“视觉大脑”(称为视觉 Transformer)。AI 必须查看每一个像素,并弄清楚它与整张图像中其他所有像素的关系。这计算量巨大,就像蒙着眼睛试图拼好一万块的拼图,然后再摘下眼罩检查你的工作。

新方法(基于切片的编码): 作者意识到,将巨型图像切割成更小、更易管理的切片(就像将大披萨切成单独的片),然后逐一查看,效果更好。

  • 类比: 想象你试图阅读一张巨大且详细的地图。与其盯着整张地图试图同时记住每一条街道,不如使用放大镜一次查看一个街区。
  • 结果: 令人惊讶的是,当 AI 查看切片时,它实际上能更好地理解细节。通过专注于小的局部区域,AI 比试图一次性处理整个混乱图像时,能更清晰地发现微小事物(如招牌上的文字或特定物体)。

2. “提前退出”策略(在重负荷工作前压缩)

旧方法: 即使将图像切片后,仍有太多碎片让 AI 难以高效处理。旧的方法是让 AI 先完整处理所有切片,然后在最后尝试压缩信息。

  • 类比: 这就像雇佣 100 名搬运工将房子里的每一个箱子都搬到卡车上,然后才意识到“哦,我们只需要 25 个箱子”,于是扔掉了其中 75 个。你浪费了大量精力搬运了不需要的箱子。

新方法(ViT 内部早期压缩): 作者构建了一个特殊的“压缩器”模块,位于 AI 视觉大脑的内部,就在起始位置附近。

  • 类比: 与其搬运所有 100 个箱子,这个新压缩器就像前门处的智能分拣员。它立即将相似的箱子分组,并在重型搬运团队开始工作之前就扔掉重复的箱子。
  • 秘诀: 为了在不破坏 AI 大脑的前提下实现这一点,他们并非随意丢弃碎片。他们使用了“热启动”技术。他们利用 AI 已有的关于如何观察图像的知识,来教导新压缩器如何压缩数据。这就像让新员工跟随资深专家学习,而不是从零开始。

最终成果:LLaVA-UHD v4

通过结合切片(分部分查看图像)和早期压缩(在重负荷处理开始前缩小数据),他们创建了一个名为LLaVA-UHD v4的新系统。

  • 速度: 它将计算工作量(能耗和时间)减少了约56%
  • 智能: 尽管工作量减少了,但它回答问题时的表现与旧系统一样好,有时甚至更好。它特别擅长在高分辨率图像中阅读文字和发现细微细节。

简而言之: 本文表明,要让 AI 理解图像,并不需要强迫它一次性盯着整张巨幅图像。通过将图像分解成碎片,并在早期智能地总结信息,你可以让 AI 变得更快、更便宜,而不会让它变“笨”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →