← 最新论文
💻 computer science

VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

VisCo 是一个训练高效的框架,它利用预训练的视觉-语言模型作为内在编码器,将视觉标记压缩为一组紧凑的记忆标记,在无需大量重新训练或外部模块的情况下,在各种压缩率下均实现了卓越的性能和稳定性。

原作者: Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它能通过看一张照片来给你讲故事。这个机器人天赋异禀,但它的脑容量非常小且极其昂贵。当你给它看一张高清晰度的照片时,机器人会试图观察每一个像素,将图像转化为由成千上万个微小笔记组成的庞大列表,这些笔记被称为“Token(标记)”。这就像是为了判断一张照片里画的是猫还是狗,就试图读完一整部百科全书一样。这个过程非常沉重,使得机器人变得反应迟钝、极度消耗内存,并且难以在普通手机或实时场景中使用。科学家们一直试图教机器人变得更高效,通常要么是扔掉那些“无聊”的笔记(但这有时会让机器人错过重要的细节),要么是构建一个全新的、笨重的机器来帮助它进行总结(而这既昂贵又难以训练)。一个大问题是:我们能否让机器人利用它现有的脑力来对图片进行总结,而不是需要一次大规模的结构性改造?

这正是 VisCo 背后的研究人员试图解决的问题。他们意识到,机器人的大脑(视觉-语言模型)本身就是理解图像的高手;它只是以前从未被要求过要如此高效地总结图像。VisCo 并没有构建一个新工具,也没有盲目地删除笔记,而是将机器人的大脑视为一个自包含的压缩机器。他们引入了一组微小的“记忆标记(memory tokens)”——你可以把它们想象成机器人可以用来记录信息的几张便利贴——并要求机器人阅读整张图片,并将所有信息浓缩到这几张便签上。神奇之处在于,机器人利用其内在的“注意力机制”(即它如何关注图像的不同部分)来逐层确定哪些部分最重要,从简单的纹理到复杂的含义。

研究发现,这种方法改变了游戏规则。当其他方法被迫使用极少的笔记时(比如试图用一个词来描述一整座城市),它们会彻底崩溃,而 VisCo 却能保持惊人的强大。在测试中,即使他们将图像压缩到只有一个 Token,VisCo 仍能保持约 85% 的原始智能水平,远超其他仅能维持在 35-50% 左右的方法。更酷的是,研究人员发现这些“记忆笔记”不仅仅是原始图片的缩小版;它们实际上捕捉到了看待图像的“新方式”,有时甚至能让机器人变得比以前更聪明。这是一种轻量化、高效的方式,让机器人无需从头开始重新训练整个大脑,就能实现“以少胜多”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →