← 最新论文
💻 computer science

ReLoop-UME: Recurrent Depth with Learnable Retrieval Registers for Universal Multimodal Embedding

ReLoop-UME 引入了一种新颖的通用多模态嵌入架构,通过仅执行一次前层、循环重用具有可学习检索寄存器的参数共享块以跨深度累积证据、并在最后一次循环后才应用最终映射层,从而实现了比现有方法更优越的速度和准确性,进而提升了检索性能与效率。

原作者: Shijie Wang, Xiangzhao Hao, Yueti Li, Guangyu Cao, Xinyu Tang, Haiyun Guo

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Shijie Wang, Xiangzhao Hao, Yueti Li, Guangyu Cao, Xinyu Tang, Haiyun Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一大堆混乱且庞大的干草堆中寻找一根特定的针。但这不是一个普通的干草堆,这是一个“多模态”的干草堆,这意味着干草是由文本构成的,针是图片,有时甚至整个干草堆是一段视频。在人工智能的世界里,这被称为通用多模态嵌入(Universal Multimodal Embedding, UME)。把它想象成一位超级聪明的图书管理员,他可以接收文字描述的问题、一张猫的照片或一段电影剪辑,并能瞬间将它们全部翻译成一种单一的、关于“相似性”的秘密语言。一旦所有内容都被翻译成这种秘密代码,图书管理员就能立刻告诉你哪些项目是相关的,即使它们在表面上看起来完全不同。

长期以来,这些人工智能图书管理员的工作方式就像短跑运动员:他们会对输入内容看一次,在脑海中跑完一圈,然后给出答案。这种方式很快,但有时不够精确,尤其是在面对棘手的问题时。最近,一些研究人员尝试让图书管理员“思考得更深”,通过强制要求他们在给出答案之前写下一段长长的、循序渐进的推理笔记。虽然这确实有所帮助,但这就像是要求图书管理员为了找一本书而写一部长篇小说一样;这太慢了,而且拖慢了整个进度。一个巨大的问题随之而来:有没有一种方法,既能让图书管理员思考得更深,又不必让他们写长篇小说呢?

于是,ReLoop-UME 出现了。这一新方法表明,答案不在于写得更多,而在于对正确部分进行“重读”。研究人员发现,人工智能的大脑并不是沿着一条每一层都做同样事情的直线运行的。相反,他们发现早期的层级像是“语境设定者”(捕捉氛围),中间的层级是“侦探工作”(寻找线索),而最后的层级仅仅是“包装”(撰写最终标签)。

该论文提出了一个聪明的技巧:与其让 AI 写下长长的推理笔记(这既慢又乱),不如让 AI 在其大脑的“侦探工作”部分进行多次循环(loop)。为了确保 AI 在第一次循环时不会忘记所发现的内容,他们添加了一个名为**可学习检索寄存器(Learnable Retrieval Registers)**的特殊工具。想象一下,这些就是 AI 可以贴在自己额头上的便利贴。当 AI 在侦探部分进行循环时,它会用新的线索更新这些便利贴,从而在不生成新词汇或减慢过程的情况下累积证据。

结果令人印象深刻。在一项名为 MMEB-V2 的大规模测试中(该测试包含数千个涉及图像、视频和文档的任务),这种新方法始终比之前的“推理型”模型找到了更好的匹配。它比之前尝试写出想法的“推理型”模型快了 44.9 倍,比另一种快速模型快了 1.5 倍,同时更加准确。研究人员认为,通过将额外的计算能力精准地集中在“侦探工作”发生的地方,并利用这些“便利贴”来保存线索,他们创造了一个既更聪明又显著更快的系统。这就像是给侦探一把放大镜和一个笔记本,而不是强迫他在指出嫌疑人之前先写一篇日记。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →