← 最新论文
💬 NLP

UEmbed: Unified Sparse and Dense Multimodal Embeddings

UEmbed 引入了一种统一的仅解码器多模态嵌入模型,该模型在单次因果前向传播中即可生成稀疏词汇表示和稠密表示,在实现多模态基准测试最先进性能的同时,还能够赋能高效的智能体应用。

原作者: Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie, Yilun Zhao, Shu Wu

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie, Yilun Zhao, Shu Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一座巨大且混乱的图书馆中寻找一本特定的书。长期以来,图书管理员使用一种简单的技巧:寻找精确的词汇。如果你询问“猫”(cat),他们只会找到包含“猫”这个词的书籍。这很快也很容易,但有点笨拙;它会错过那些从未提及“cat”但关于“猫科动物”(felines)或“小猫”(kittens)的书籍。为了解决这个问题,科学家们发明了能够理解含义的“智能”搜索引擎。这些引擎将你的问题和书籍转化为长串的数字列表(称为“稠密向量”)。这就像是根据每本书的“氛围”和故事为其赋予一个独特的指纹。这对于理解内容非常出色,但它很沉重、缓慢,有时很难解释为什么某本书被选中。

现在,想象一种全新的图书管理员,可以同时胜任这两项工作。他们既能提供“氛围指纹”,又能提供一份最重要的关键词列表,而且只需一眼就能完成,速度极快。这就是信息检索的世界——研究如何在数字干草堆中寻找针尖的科学。一个大问题是,研究人员一直在问:我们能否构建一个单一的、超级智能的大脑,既能处理“精确词汇”搜索,又能处理“基于含义”的搜索,而不需要两个不同的、笨重的系统?并且,这个大脑能否不仅理解文本,还能同时理解图片、视频和文档?这就是一项名为 UEmbed 的新发明故事的开始。

一脑双用方案:UEmbed

认识一下 UEmbed(统一嵌入),这是一种由阿里巴巴、中国科学院和耶鲁大学的研究人员设计的新型计算机大脑。把 UEmbed 想象成一个多任务处理的超级英雄,它拒绝在“文字巫师”和“含义大师”之间做选择。在过去,如果你想要一个能理解深层含义的搜索引擎,你必须使用一个沉重且缓慢的系统;如果你想要一个快速且使用关键词的系统,你必须使用一个更简单、更基础的系统。通常情况下,你无法在同一个包中同时拥有两者,尤其是在处理图像和视频时。

UEmbed 通过使用“仅解码器”(decoder-only)架构改变了游戏规则。用一个简单的类比:想象标准的搜索引擎就像一个人从头到尾阅读一本书,通过来回查看以理解整个故事(这被称为“双向”)。然而,UEm本身就像是一个讲故事的人,他听完整个故事后,在最后时刻立即以两种方式进行总结:首先,通过给你一个“氛围得分”(即稠密部分);其次,通过大声喊出在他脑海中跳出的前 10 到 20 个最重要的词(即稀疏部分)。他通过一次单向传递即可完成这一切,就像拨动开关一样。

它是如何工作的:特殊标记的魔力

那么,这个大脑是如何在理解整个故事的同时,还能喊出关键词的呢?其秘诀在于一个涉及“特殊标记”(special tokens)的巧妙技巧。

想象你在写一个故事,并在结尾处附上几个隐形的、神奇的便利贴。在 UEmbed 的案例中,研究人员在输入的末尾附加了 16 个这样的特殊标记(tokens)。在计算机开始阅读之前,它会将整个词汇表(vocabulary)划分为 16 个不同的组,就像把一大盒乐高积木分类到 16 个不同颜色的箱子里一样。

当计算机阅读你的图像、视频或文本时,它会处理这个故事。当它到达末尾那 16 个神奇的便利贴时,每个贴纸都被分配了一项特定的任务:“你负责红色词汇箱”、“你处理蓝色词汇箱”,以此类推。每个贴纸都会审视它刚刚听到的整个故事,并决定:“基于我听到的内容,这些是我所属颜色箱中最重要的词。”

当计算机完成工作时,它已经拥有了 16 个重要的词汇小列表。它将这些列表缝合在一起,创造出一个庞大且极其详细的关键词列表(稀疏向量)。与此同时,它提取整个故事的“氛围”来创建稠密指纹。这种巧妙的分区解决了主要问题:通常,一个计算机大脑只能使用一个“总结标记”来描述整个故事,这不足以承载所有的关键词。通过使用 16 个不同的标记,UEmbed 分散了工作量,使其能够同时具备丰富的关键词和深刻的含义。

数据说明

研究人员在一些全球最严苛的搜索挑战中测试了 UEmbed。他们不仅观察了文本,还向它投掷了图像、视频和复杂的文档。

  • 高分表现: 在一个名为 MMEB-v2 的大规模基准测试中(该测试衡量模型理解不同媒介类型的能力),UEmbed 的最大版本(9B 模型,拥有 90 亿个参数)在“氛围”搜索中得分为 71.8,在“关键词”搜索中得分为 71.0
  • 对比分析: 这是一件了不起的事情。通常,基于关键词的搜索会落后于“氛围”搜索。在这里,UEmbed 的关键词模式几乎与它的氛围模式一样出色,并且击败了几乎所有在公开数据上训练的模型。例如,它超越了名为 RzenEmbed-V2-7B 的 70 亿参数模型(得分为 71.1)以及一个 20 亿参数的模型 Embed-RL-4B(得分为 68.1)。
  • 效率: 由于 UEmbed 是基于“仅解码器”架构构建的(与流行的聊天机器人类型相同),它能很好地适配高速服务器。它可以极其快速地生成这些双重结果,使其在实际应用中具有可行性。

为什么这很重要:“智能体”优势

论文指出,这种双重能力的方法不仅仅是一个有趣的技巧,它对于 AI “智能体”(Agents,即能够浏览网页并为你执行任务的智能程序)的未来来说是一种实际的必然要求。

当一个 AI 智能体试图解决问题时,它经常提出简短且充满关键词的问题,比如“我附近的最好披萨”或“如何修理漏水”。稠密的“氛围”搜索有时会错过这些,因为它寻找的是深层含义,而关键词搜索虽然快但不够聪明。UEmbed 提供了两者的最佳结合。在名为 BrowseComp-Plus 的基准测试中,研究人员发现,使用 UEmbed 的关键词模式可以帮助 AI 智能体以更少的搜索尝试找到正确的信息,从而节省了时间和计算资源。

局限性与未来

作者谨慎地指出,UEmbed 目前尚未完美。他们注意到,由于该模型主要针对英语和中文进行训练,它在处理其他语言时有时会显得有些困惑。他们还观察到,有时那些“神奇的便利贴”可能会喊出一些奇怪的、非标准的词汇(如 "_alt" 或 "_perm"),这些是计算机内部词典产生的痕迹。

然而,核心理念是坚实的:UEmbed 证明了你不需要在速度与智能之间,或者在单词与含义之间做出选择。通过将这两个世界统一到一个单一的、仅解码器的模型中,它为搜索引擎开启了大门——这些搜索引擎可以更快、更聪明,并且能够在一个步骤内理解整个数字世界——从一句话到一部完整的视频。这是一个新的范式,在这里,搜索引擎不再仅仅寻找单词或仅仅感受氛围;它两者兼顾,且瞬间完成。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →