← 最新论文
💻 computer science

PLUME: Latent Reasoning Based Universal Multimodal Embedding

PLUME 提出了一种基于潜在推理的通用多模态嵌入框架,通过用连续的潜在状态自回归展开替代显式思维链,并辅以语义锚点引导适配器及渐进式训练课程,在显著降低推理开销(推理速度提升 30 倍以上)的同时,在 MMEB-v2 基准上实现了超越显式思维链基线的检索性能。

原作者: Chenwei He, Xiangzhao Hao, Tianyu Yang, Yuxiang Ma, Yuheng Jia, Lingxiang Wu, Chaoyang Zhao, Haiyun Guo, Jinqiao Wang

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenwei He, Xiangzhao Hao, Tianyu Yang, Yuxiang Ma, Yuheng Jia, Lingxiang Wu, Chaoyang Zhao, Haiyun Guo, Jinqiao Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 PLUME 的新系统,它的目标是让电脑在“看图、看视频、读文档”时变得更聪明,同时反应更快。

为了让你轻松理解,我们可以把多模态检索(UME)想象成“在图书馆找书”,而PLUME就是那个超级图书管理员

1. 以前的困境:要么太笨,要么太慢

在这个领域,以前的图书管理员主要有两种工作模式:

  • 模式 A:一眼定乾坤(早期方法)
    • 做法:你问“找一本关于红色跑车的书”,管理员扫一眼你的描述,直接去书架上找封面像红色的书。
    • 缺点:太肤浅了。如果书里讲的是“红色跑车在雨中漂移的惊险瞬间”,管理员只看封面就找不到了,因为它没有真正“思考”过。
  • 模式 B:写长篇大论的笔记(现有的“推理”方法)
    • 做法:为了更聪明,管理员决定先写一段长长的文字笔记(就像我们在纸上写“首先,这是红色的;其次,这是跑车;最后,它在雨中……"),把思考过程全部写下来,然后再去找书。
    • 缺点:虽然找得准了,但太慢了!每找一本书都要写几百字的笔记,效率极低。而且,把复杂的画面(比如视频里的动态)强行压缩成文字,就像把一部精彩的电影强行压缩成一句话,很多细节(比如动作的连贯性)都丢失了。

2. PLUME 的解决方案:心里的“默念”

PLUME 提出了一种全新的思路:“思考”不一定非要写出来,可以在脑子里“默念”完成。

它引入了一个**“潜意思推理”(Latent Reasoning)**的框架。我们可以这样比喻:

  • 以前的“写笔记” = 在纸上写满几百字的解题步骤(显式思维链,CoT)。
  • PLUME 的“默念” = 在脑子里快速过一遍解题思路,只保留几个关键的**“思维快照”**(潜状态),然后直接给出答案。

PLUME 是怎么做到的呢?

A. 脑内“快速闪念”代替“长篇大论”

PLUME 不再让模型生成几百个文字 token(就像写几百字笔记),而是让它在隐藏的空间里进行8 次左右的快速“思维跳跃”

  • 比喻:以前是写 100 页日记,现在是脑子里快速闪过 8 个关键画面。这 8 个画面包含了所有必要的逻辑,但只占用了极少的空间和时间。
  • 效果:速度提升了 30 倍 以上!

B. 智能“导航员”(语义锚点引导)

不同的任务需要不同的思考方式。看视频需要关注“时间顺序”,看文档需要关注“排版结构”,看图片需要关注“空间位置”。

  • 比喻:PLUME 给这个“默念”过程配了一个智能导航员
    • 如果你问的是视频,导航员会指挥大脑:“嘿,注意看时间轴,想想动作是怎么连贯的!”
    • 如果你问的是文档,导航员会说:“别管时间了,注意看文字怎么排版的,找关键信息!”
  • 这个导航员会根据你的问题,自动调整“默念”的路径,确保用最少的步骤解决最复杂的问题。

C. “先扶后放”的训练法(渐进式课程)

让模型直接从“写笔记”变成“纯默念”太难了,模型会晕。

  • 比喻:PLUME 采用了一种**“学骑车”**的策略。
    • 第一阶段:先让模型大声把思考过程念出来(写笔记),老师(训练数据)在旁边纠正。
    • 第二阶段:慢慢把念出来的话变成“心里默念”,老师只纠正最后的结果。
    • 第三阶段:完全变成“心里默念”,老师不再看它怎么想的,只看它找得准不准。
  • 通过这种循序渐进的方法,模型学会了把复杂的思考过程“内化”到脑子里,而不需要再写出来。

3. 结果如何?

在包含 78 个不同任务的测试(MMEB-v2)中:

  • 更准:PLUME 找东西的准确率比那些“写长篇笔记”的旧方法还要高,特别是在视频复杂文档的搜索上,优势巨大。
  • 更快:它把原本需要生成几百个字的思考过程,压缩成了不到 10 步的“脑内闪念”,速度提升了 30 多倍

总结

PLUME 就像是一个学会了“心算”的超级图书管理员。

以前的管理员要么不思考(找不准),要么边想边写(太慢)。PLUME 教会了管理员在脑子里快速、灵活地思考,既保留了深度思考的聪明劲儿,又拥有了闪电般的速度。这对于我们需要快速从海量视频和文档中查找信息的场景来说,是一个巨大的进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →