← 最新论文
🤖 AI

CIVIC: End-to-End Sequence Compactness for Efficient Vision-Language Models

CIVIC 是一个端到端框架,通过在全部推理阶段维持连续的紧凑视觉通路,在视觉语言模型中实现真正的硬件效率,在确保精度不受影响的同时显著降低内存占用和延迟。

原作者: Fengze Yang, Bo Yu, Xuewen Luo, Cathy Liu, Chenxi Liu

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Fengze Yang, Bo Yu, Xuewen Luo, Cathy Liu, Chenxi Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图向朋友解释电影中一个复杂的场景。

问题:“过度描述”的朋友
当前的 AI 模型(称为视觉 - 语言模型)就像那些会描述电影帧中每一个像素的朋友。如果电影是 4K 分辨率,它们可能会尝试为仅仅一秒钟的视频描述 1,000 个微小的细节(token)。虽然这很详尽,但令人疲惫不堪。AI 在尝试编写故事的同时,必须在其短期记忆("KV 缓存”)中记住所有 1,000 个细节。这使得 AI 运行缓慢、占用大量内存,且成本高昂,尤其是在小型设备上。

旧方案:“编辑按钮”的谬误
此前试图解决这一问题的方法,就像先写出完整的 1,000 字描述,然后再聘请编辑事后划掉无聊的部分。

  • 缺陷:即使编辑划掉了某些词语,AI 仍然必须先写下它们、携带它们,然后再删除它们。这就像背着一个装满石头的沉重背包,直到终点线才扔掉一半。你仍然因为背负重量而感到疲惫,而且“编辑”过程本身也耗费了额外的时间。

新方案:CIVIC(“智能摘要器”)
这篇论文提出了 CIVIC,这是一种关于 AI 如何“看”和“说”的新思路。CIVIC 不是先写出完整描述再进行编辑,而是教导 AI 从一开始就只写重要的部分

以下是 CIVIC 的工作原理,使用简单的类比:

  1. “锚点”系统(智能分组)
    想象一下看着一个拥挤的房间。CIVIC 不是列出每个人的脸,而是挑选几个“锚点”(比如一群朋友的核心),并说:“整个群体代表一个概念。”它在 AI 开始处理之前,就将相似的视觉细节分组。这将 1,000 个杂乱无章的项目转化为 400 个关键点的整洁列表。

  2. “连续路径”(无绕路)
    大多数其他方法就像接力赛,跑步者传递接力棒,停下来重新包装,然后再跑。CIVIC 是一条直道。它将“紧凑”(缩短)的信息列表从摄像头一直保留,穿过投影仪,直到进入 AI 的大脑。它永远不会切换回“沉重”的版本。这意味着 AI 不会浪费能量去切换模式或重新组织数据。

  3. “内存节省器”(KV 缓存)
    因为 AI 只需要记住 400 个关键点而不是 1,000 个,其短期记忆(KV 缓存)大幅缩小。论文发现,与标准方法相比,CIVIC 仅使用约 三分之一 的内存空间。这就像从提着一个沉重的行李箱变成背一个小背包。

  4. “师生”课程(训练)
    为了确保 AI 不会因细节减少而感到困惑,研究人员使用了一种“文本对齐”的教学方法。想象一位老师(大型、缓慢的 AI)向一名学生(新型、快速的 AI)展示如何描述一张图片。老师不只是说“简短点”,而是说:“用更少的词语描述图片的含义,但要确保你仍然讲对了故事。”这确保了 AI 不会失去理解细微细节的能力,例如物体在图片中的位置。

结果
当研究人员在名为 Qwen3-VL 的模型上测试该方法时:

  • 速度:AI 完成任务的速度快得多(从约 3.5 秒降至约 2.5 秒)。
  • 内存:它使用的内存显著减少(从约 122 MB 降至约 44 MB)。
  • 准确性:尽管速度更快、体积更小,但它并没有变“笨”。它在回答复杂问题和定位图片中的物体方面,表现与缓慢、庞大的版本一样好。

总结
CIVIC 阻止了 AI 做不必要的工作。它不是生成海量数据然后试图削减,而是学会从一开始就生成紧凑、高效的摘要。这使得 AI 运行更快、成本更低,并且能够在不损失智能的情况下投入实际应用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →