← 最新论文
💻 computer science

UniNote: A Unified Embedding Model for Multimodal Representation and Ranking

UniNote 是一个统一的嵌入模型,旨在通过采用对比监督微调和强化学习的两阶段训练范式来优化工业级物品到物品检索,从而在全局表示与细粒度排序之间取得平衡,并在小红书的大规模部署中实现了最先进的性能与成本效益。

原作者: Jinghan Zhao, Wenwei Jin, Anqi Li, Jintao Tong, Luya Mo, Jiawei Li, Bin Li, Yao Hu

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinghan Zhao, Wenwei Jin, Anqi Li, Jintao Tong, Luya Mo, Jiawei Li, Bin Li, Yao Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在运营一个庞大、繁忙的数字图书馆(就像小红书 App 一样),里面有数百万人发布“笔记”。每篇笔记都是一个杂乱多彩的包裹,包含照片、视频、文本标题、正文段落,甚至隐藏在图片中的文字(比如照片里的招牌)。

作者们面临的问题是,传统的图书馆系统难以找到这些特定的包裹。如果你向系统展示笔记中的一张单张照片,它可能会找到其他相似的照片,但无法找到该照片所属的整篇笔记。反之,如果你搜索特定主题,系统可能会漏掉该笔记,因为它未能理解照片和文本如何作为一个整体单元协同工作。

以下是 UniNote 如何解决这一问题的解释,通过简单的类比来说明:

1. 问题所在:“双塔”与“统一大脑”

旧系统就像拥有两位独立的图书管理员:一位只懂“图片”,另一位只懂“文本”。他们站在不同的房间(双塔)里,试图猜测对方在想什么。

  • 缺陷:他们实时交流的速度太慢,且经常遗漏细微之处。如果你询问关于“星巴克”的笔记,“图片管理员”可能会找到一张咖啡杯的照片,但“文本管理员”可能会漏掉这篇笔记,因为“星巴克”这个词是写在照片里的招牌上,而不是出现在标题中。

UniNote 就像雇佣了一位拥有统一大脑的超级管理员。这位管理员可以同时查看照片、阅读照片内的文字、阅读标题以及阅读正文,将它们理解为一个连贯的整体故事。

2. 训练过程:两个学习阶段

作者们并没有直接将这位管理员扔进图书馆,而是分两个截然不同的阶段对他们进行了训练。

第一阶段:“硬式特训”(对比式监督微调 SFT)

想象管理员正在一个训练营中学习辨别差异。

  • 特训内容:训练员向管理员展示一张照片,并问:“这张照片属于哪篇笔记?”
  • 技巧:为了让管理员变得敏锐,训练员不仅展示明显的错误答案,还展示“硬负样本”——那些看起来几乎正确但存在微小关键差异的笔记(例如来自不同品牌的咖啡杯照片)。
  • 结果:管理员学会了忽略表面的相似性,专注于深层的语义含义。他们学会了将复杂的笔记(图片 + 文本 + 隐藏文本)压缩成一张单一的、紧凑的“身份证”(嵌入向量),从而捕捉到整体精髓。

第二阶段:“排序教练”(强化学习)

一旦管理员能够找到正确的笔记,他们就需要学习如何排序这些笔记。

  • 场景:管理员找到了 10 篇都“相关”的笔记,但其中一些是“完美相关”的,而另一些只是“还可以”。
  • 奖励机制:作者们使用了一种名为 GRPO(组相对策略优化)的方法。这就像一位教练,不仅仅说“做得好”或“做得差”,而是根据以下标准打分:
    • 你是否找到了正确的那些?(相关性奖励)
    • 你是否将最好的排在了最前面?(位置奖励)
    • 你是否不小心把垃圾笔记排在了前面?(惩罚)
  • 结果:管理员学会了不仅要在 haystack(干草堆)中找到针,还要将这些针排列好,让最锋利、最相关的那些就在你触手可及的地方。

3. “俄罗斯套娃”功能(MRL)

最酷的功能之一是 套娃表示学习(MRL)

  • 类比:想象一个俄罗斯套娃。最大的娃娃是完整、详细的身份证(4096 维)。但在大娃娃里面是一个稍小的娃娃(1024 维),再里面是一个微小的娃娃(64 维)。
  • 重要性:有时,图书馆预算充足,想要最详细的娃娃。而有时,他们预算紧张或需要瞬间搜索数百万个项目,因此只需要那个微小的娃娃。
  • 魔力:UniNote 创建了一个包含所有这些尺寸的单一模型。你可以“剥去”层级,使用更小、更快的版本,而不会损失太多准确性。这就像拥有一件工具,根据工作需要,它既可以是一把重型锤子,也可以是一把微型精密螺丝刀。

4. 结果:实际发生了什么?

论文声称,当他们在来自小红书的真实世界数据上测试该系统时:

  • 更好的搜索:与之前的系统相比,它能更好地找到正确的笔记,特别是当仅根据一张图片或图片内发现的文本片段(OCR)搜索整篇笔记时。
  • 更快且更便宜:由于采用了“套娃”方法,他们可以在保持高搜索质量的同时,节省计算机存储和处理能力的成本。
  • 一个模型统领全局:UniNote 不需要一个模型用于搜索,另一个用于排序,而是通过单次遍历同时完成这两项任务。这就像一位管理员,在呼吸之间既找到了书,又决定了递给你时的顺序。

总结

UniNote 是一个智能的统一系统,它将照片和文本的杂乱混合体视为一个单一的故事。它通过识别棘手的差异并学习完美排序结果来进行自我训练。它还拥有不同的“尺寸”以适应不同的预算和速度需求,使其成为大型互联网平台的高效工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →