← 最新论文
🤖 AI

RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs

RoRA 是一个用于多模态大语言模型的免训练视觉标记剪枝框架,它通过将标记划分为语义、上下文和细节角色,并利用注意力锚定区域进行分配,以确保在不将保留的标记视为可互换的情况下实现全面的物体覆盖,从而提高推理效率和准确性。

原作者: Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个超级聪明的机器人如何观察世界。你不仅仅是给它看一张图片;你向它喂入海量的、无穷无尽的微小数字拼图碎片,这些碎片被称为“标记”(tokens)。每一块碎片都承载着图像的一点点信息。对于一张简单的照片,这没问题。但对于一张高分辨率的照片、一段视频或一个复杂的场景,机器人会被成千上万个这样的碎片淹没。这就像是为了回答关于角落里一只猫的问题,而去阅读整座图书馆的书籍一样。机器人会感到不堪重负,思考得极其缓慢,并且需要巨大的内存来在脑海中记住所有这些碎片。这就是多模态大语言模型(MLLMs)领域的研究人员试图解决的问题:如何帮助机器人专注于图像中重要的部分,而不被噪声所困扰。

通常的做法是扔掉那些看起来不太重要的碎片。但问题在于,机器人的大脑并不完美,它并不擅长判断什么才是重要的。有时,它会被图片的边缘分散注意力,或者卡在某个特定的位置,从而忽略了你询问的实际物体。其他方法试图将碎片均匀地分布在整个图像中,但这就像是在给人群拍照时,只保留了每个人衣服上的几个像素,却错过了他们的脸部。其结果往往是机器人看到了背景,却错过了主角。

这就是一种名为 RoRA(面向角色的区域分配,Role-Oriented Regional Allocation)的新方法,它扮演着机器人视觉中的聪明编辑的角色。RoRA 不仅仅是挑选“最重要”的碎片,也不是随机地散布碎片,而是将图像视为一个需要三种特定类型的证据才能正确讲述的故事。

首先,RoRA 识别出 语义核心(Semantic Core)。你可以把它想象成故事中的“主角”。如果你问:“那个球员球衣上的数字是多少?”,那么核心就是位于球衣上的那些具有高置信度的特定像素。RoRA 会极其严密地保护这些碎片,确保无论它如何削减图像的其他部分,机器人永远不会丢失主体。

其次,它寻找 互补上下文(Complementary Context)。这是“配角”和“场景”。一旦机器人知道了主角是谁,它就需要知道主角站在哪里以及周围正在发生什么。RoRA 确保从主角直接区域之外抓取碎片,这样机器人看到的就不只是一个漂浮的球衣,而是理解了它是在一个体育场里的球员身上。它会主动避免从同一个地方抓取太多碎片(因为这会产生冗余),而是会在周围区域寻找新的信息。

第三,RoRA 为 细粒度细节(Fine-Grained Detail) 保留了一小部分预算。这些是“剧情转折”或微小的线索,比如标牌上的微小文字、织物的纹理,或者是躲在角落里的一个小物体。由于这些细节通常很小且容易被忽视,RoRA 为它们安排了一场特殊的“救援任务”,以确保它们不会仅仅因为不是图片中最显眼的东西而被意外删除。

RoRA 的魔力在于它如何组织这些角色。它不只是问:“哪些碎片最闪亮?”相反,它会问:“我们有主角吗?我们有场景吗?我们有微小的线索吗?”它使用一种被称为 注意力锚定区域(Attention-Anchored Regions, AARs) 的智能地图来标记主角的位置,从而知道在哪里寻找场景(地图之外)以及在哪里寻找线索(地图之内)。

结果令人印象深刻。在对 LLaVA 和 Qwen-VL 等强大机器人大脑进行测试时,RoRA 成功地大幅削减了图像碎片的数量——在某些模型上减少了高达 88.9%——同时仍保持了 96.5% 的原始准确率。事实上,在某些测试中,它的效率如此之高,以至于它将机器人的思考时间缩短了 24.6%,比未裁剪的版本快了 1.33 倍。更重要的是,它不仅仅是靠猜测;它在真实硬件(NVIDIA H800 GPU)上测量了这一点,显示出它仅需 0.7 毫秒 就能决定保留哪些碎片。

与那些可能会不小心关注到错误部分,或者陷入循环检查每个碎片与其它每个碎片之间关系的旧方法(这既慢又昂贵)不同,RoRA 既快速又专注。它证明了通过为图像碎片分配特定的“工作”而不是仅仅挑选“最好的”碎片,我们可以让这些超级聪明的机器人清晰、快速地观察世界,而不会因为数据过多而感到头疼。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →