ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
ReToken 是一种轻量级的、单一可学习的嵌入,它能够高效地从预填充的 KV 缓存中检索与查询相关的视觉标记,在显著提升视觉语言模型在长上下文图像和视频检索任务上性能的同时,仍能保持在单块 GPU 上的计算可行性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一大堆混乱的干草堆中寻找一根特定的针。现在,想象一下这堆干草不是普通的草堆,而是一个包含数千本书籍的巨大图书馆,而你正在要求一个超级聪明的机器人图书管理员读完整个图书馆,以找到回答你问题的那个句子。这就是“视觉-语言模型”(Vision-Language Models, VLMs)的世界——视觉-语言模型是人工智能的一个分支,旨在尝试同时理解图像和文本。
长期以来,这些机器人非常擅长观察单张照片或短视频片段。但当你给它们一段长达一小时的视频或一百张照片的堆叠时,它们就会感到不知所措。这就像要求一个人同时阅读一千本书;他们的大脑(或者说在这种情况下,计算机的内存)无法承载这一切,并且会开始感到困惑。他们可能会看错页面,或者完全错过线索,因为他们试图同时处理所有信息。科学家们一直在问一个大问题:我们如何教这些机器人更好地“搜索”它们自己的记忆?我们如何帮助它们忽略无聊的部分,并精准地聚焦在那个重要的瞬间或图片上,而不需要一台像房子一样大的超级计算机来完成它?
这正是名为 ReToken 的新想法登场的地方。把视觉-语言模型想象成一个接受过训练、通过观察证据来破案的侦探。通常,当你问侦探一个问题,比如“红色的车在哪里?”时,侦探会查看所有的证据(图像),并根据他们投入多少“注意力”来猜测哪一个证据是重要的。研究人员发现,这种“注意力”方法对于视频和大型图像集合来说其实是非常不可靠的。这就像侦探被背景中的一个闪光物体分散了注意力,从而错过了那辆红色的车。
团队发现,机器人目前的搜索方式有点问题。他们进行了测试,发现当机器人尝试使用其标准的“注意力”信号从视频中挑选正确的帧时,它的正确率仅为 5% 左右。它基本上是在黑暗中盲目猜测。他们还注意到了一些奇怪的现象:机器人的“注意力”是针对预测句子中的下一个词进行训练的,而不是为了寻找特定的图像。所以,它并不擅长当一名图书管理员。
为了解决这个问题,作者发明了 ReToken。想象一下,你有一个神奇的、单一的“搜索按钮”,你可以把它贴在你的问题上。与其要求机器人扫描整个图书馆,不如给它这个特殊的按钮。这个按钮是一段微小的、可学习的代码,机器人被专门训练用来使用它来搜寻正确的图片。它的工作原理是观察图像的“内容”(论文中称之为“值”空间),而不是机器人通常使用的“标签”或“键”。
这里有一个魔术技巧:研究人员在一组关于图像的问题集上训练了这个单一的“搜索按钮”。他们教会它忽略噪声,并锁定回答问题的确切帧。一旦训练完成,这个小小的 token 就变成了一个超高效的检索器。当机器人被问及关于长视频的问题时,这个 token 就像一个激光笔,能瞬间从数千帧中找到相关的几帧,并忽略其余部分。
结果非常出色。当他们在“视觉干草堆”(Visual Haystack)挑战赛(即在一堆图像中寻找一张相关图像)中进行测试时,使用 ReToken 的机器人比之前的最佳水平提高了 13 个百分点以上。更令人印象深刻的是,尽管他们只在静态图像上对其进行了训练,但当给它看一段长视频时,它仍然有效!它完美地迁移了技能,在名为 LVBench 的困难基准测试中将视频理解得分提高了 8 个百分点。
最棒的部分是?这个解决方案非常轻量化。它不需要重建整个机器人,也不需要使用庞大的超级计算机。从训练到观看长视频,整个过程都可以运行在单块高端显卡(H100)上。作者认为,这种简单的单 token 方法可能是让 AI 真正理解数小时视频或海量图像集合而不迷失细节的关键。这是一个微小的改变,它帮助机器人“见林而不见树”,证明了有时你不需要更大的大脑,你只需要一种更好的观察方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。