想象你正在运营一个庞大、繁忙的数字图书馆(就像小红书 App 一样),里面有数百万人发布“笔记”。每篇笔记都是一个杂乱多彩的包裹,包含照片、视频、文本标题、正文段落,甚至隐藏在图片中的文字(比如照片里的招牌)。
作者们面临的问题是,传统的图书馆系统难以找到这些特定的包裹。如果你向系统展示笔记中的一张单张照片,它可能会找到其他相似的照片,但无法找到该照片所属的整篇笔记。反之,如果你搜索特定主题,系统可能会漏掉该笔记,因为它未能理解照片和文本如何作为一个整体单元协同工作。
以下是 UniNote 如何解决这一问题的解释,通过简单的类比来说明:
1. 问题所在:“双塔”与“统一大脑”
旧系统就像拥有两位独立的图书管理员:一位只懂“图片”,另一位只懂“文本”。他们站在不同的房间(双塔)里,试图猜测对方在想什么。
- 缺陷:他们实时交流的速度太慢,且经常遗漏细微之处。如果你询问关于“星巴克”的笔记,“图片管理员”可能会找到一张咖啡杯的照片,但“文本管理员”可能会漏掉这篇笔记,因为“星巴克”这个词是写在照片里的招牌上,而不是出现在标题中。
UniNote 就像雇佣了一位拥有统一大脑的超级管理员。这位管理员可以同时查看照片、阅读照片内的文字、阅读标题以及阅读正文,将它们理解为一个连贯的整体故事。
2. 训练过程:两个学习阶段
作者们并没有直接将这位管理员扔进图书馆,而是分两个截然不同的阶段对他们进行了训练。
第一阶段:“硬式特训”(对比式监督微调 SFT)
想象管理员正在一个训练营中学习辨别差异。
- 特训内容:训练员向管理员展示一张照片,并问:“这张照片属于哪篇笔记?”
- 技巧:为了让管理员变得敏锐,训练员不仅展示明显的错误答案,还展示“硬负样本”——那些看起来几乎正确但存在微小关键差异的笔记(例如来自不同品牌的咖啡杯照片)。
- 结果:管理员学会了忽略表面的相似性,专注于深层的语义含义。他们学会了将复杂的笔记(图片 + 文本 + 隐藏文本)压缩成一张单一的、紧凑的“身份证”(嵌入向量),从而捕捉到整体精髓。
第二阶段:“排序教练”(强化学习)
一旦管理员能够找到正确的笔记,他们就需要学习如何排序这些笔记。
- 场景:管理员找到了 10 篇都“相关”的笔记,但其中一些是“完美相关”的,而另一些只是“还可以”。
- 奖励机制:作者们使用了一种名为 GRPO(组相对策略优化)的方法。这就像一位教练,不仅仅说“做得好”或“做得差”,而是根据以下标准打分:
- 你是否找到了正确的那些?(相关性奖励)
- 你是否将最好的排在了最前面?(位置奖励)
- 你是否不小心把垃圾笔记排在了前面?(惩罚)
- 结果:管理员学会了不仅要在 haystack(干草堆)中找到针,还要将这些针排列好,让最锋利、最相关的那些就在你触手可及的地方。
3. “俄罗斯套娃”功能(MRL)
最酷的功能之一是 套娃表示学习(MRL)。
- 类比:想象一个俄罗斯套娃。最大的娃娃是完整、详细的身份证(4096 维)。但在大娃娃里面是一个稍小的娃娃(1024 维),再里面是一个微小的娃娃(64 维)。
- 重要性:有时,图书馆预算充足,想要最详细的娃娃。而有时,他们预算紧张或需要瞬间搜索数百万个项目,因此只需要那个微小的娃娃。
- 魔力:UniNote 创建了一个包含所有这些尺寸的单一模型。你可以“剥去”层级,使用更小、更快的版本,而不会损失太多准确性。这就像拥有一件工具,根据工作需要,它既可以是一把重型锤子,也可以是一把微型精密螺丝刀。
4. 结果:实际发生了什么?
论文声称,当他们在来自小红书的真实世界数据上测试该系统时:
- 更好的搜索:与之前的系统相比,它能更好地找到正确的笔记,特别是当仅根据一张图片或图片内发现的文本片段(OCR)搜索整篇笔记时。
- 更快且更便宜:由于采用了“套娃”方法,他们可以在保持高搜索质量的同时,节省计算机存储和处理能力的成本。
- 一个模型统领全局:UniNote 不需要一个模型用于搜索,另一个用于排序,而是通过单次遍历同时完成这两项任务。这就像一位管理员,在呼吸之间既找到了书,又决定了递给你时的顺序。
总结
UniNote 是一个智能的统一系统,它将照片和文本的杂乱混合体视为一个单一的故事。它通过识别棘手的差异并学习完美排序结果来进行自我训练。它还拥有不同的“尺寸”以适应不同的预算和速度需求,使其成为大型互联网平台的高效工具。
技术摘要:UniNote
问题陈述
物品到物品(I2I)检索是现代内容平台(如小红书)的关键组成部分,其中用户生成的“笔记”包含异构模态(文本、图像、视频和嵌入式 OCR)。当前的检索范式在处理这些复杂的多模态物品时面临三个根本性局限:
- 结构脱节:标准的双塔模型(如 CLIP)独立编码各模态以确保效率。这种后期交互机制无法捕捉复合笔记中文本与视觉组件之间所需的细粒度对齐,导致局部细节丢失。
- 粒度不匹配:虽然多模态大语言模型(MLLM)在全局推理方面表现出色,但它们往往难以应对“从局部到全局”检索所需的层次结构(例如,基于单个图像片段检索整篇笔记)。它们通常针对广泛的语义描述进行优化,而非精确的子组件对齐。
- 排序低效:工业流水线通常依赖割裂的“先检索后重排”策略。这涉及使用重型生成模型进行重排,造成计算瓶颈。此外,基于用户交互数据(点击/点赞)训练的模型通常针对用户兴趣进行优化,而非客观的内容相关性,使其不适合严格的语义检索任务。
方法论
为应对这些挑战,作者提出了UniNote,这是一种专为工业级 I2I 检索设计的统一嵌入模型。该框架通过新颖的两阶段训练范式,在单一模型架构中统一了表示学习与相关性排序。
1. 任务定义与数据构建
作者定义了一套涵盖十个不同检索类别的综合 I2I 任务集,包括:
- 原子对齐:跨模态搜索(图像 ↔ 文本)。
- 从属检索:从局部到全局的检索(例如,图像 → 整篇笔记)。
- 语义提取:从全局到局部的检索(例如,笔记 → 特定图像)。
- OCR 感知:图像内文本搜索及 OCR 到笔记的检索。
- 内容相关性:笔记到笔记的排序。
为支持这些任务,利用真实的小红书笔记构建了高质量数据集。采用多粒度硬负例挖掘策略以增强判别能力。这包括:
- 模态替换:用文本描述替换图像,防止模型依赖低级的像素捷径。
- 反事实硬负例:构建与正例上下文保持最大内容重叠但严格排除有效成员关系的负例对(例如,将一篇笔记减去某张特定图像作为该图像的反例)。
- 软监督:利用参考编码器的相似度分数提供软标签,以实现分布对齐。
2. 两阶段训练范式
阶段 1:对比监督微调(SFT)
目标是将生成式 MLLM 转化为鲁棒的嵌入模型。
- 架构:模型使用“最后一个 token"的隐藏状态作为最终表示,将异构输入压缩到统一的向量空间。
- 优化:模型最小化基于嵌入的分布与 MLLM 衍生的软标签分布之间的 Jensen-Shannon (JS) 散度。
- MRL 集成:集成套娃表示学习(MRL)以支持嵌套维度(64、512、1024、4096),允许根据成本效益权衡进行灵活部署。
阶段 2:基于强化学习(RL)的相对重排
此阶段在不使用独立重排器的情况下,弥合了检索(嵌入)与排序(相关性)之间的差距。
- 框架:模型使用**组相对策略优化(GRPO)**进行训练。
- 数据构建:对于给定的笔记,将视觉和文本组件进行划分,创建一个内容重叠度递增递减的候选序列,并混入噪声序列。
- 奖励函数:设计了一个多维奖励函数以优化列表级相关性,包括:
- 不相关笔记惩罚:惩罚排在相关笔记之上的噪声笔记。
- 基础相关奖励:奖励相关样本的召回。
- 绝对位置奖励:最小化预测位置与真实位置之间的距离。
- 相对顺序奖励:确保相关笔记排序的全局一致性。
- 结果:模型学会区分细微的内容差异,并在单次传递中生成感知相关性的排序,消除了对计算昂贵的生成式重排器的需求。
主要贡献
- 综合 I2I 任务集:定义了涵盖跨模态对齐、信息压缩以及细粒度局部 - 全局双向检索的十个不同检索类别,并由鲁棒的硬负例挖掘数据集提供支持。
- 统一检索 - 排序框架:提出了 UniNote,通过两阶段训练范式(对比 SFT 后接感知相关性的 RL)将嵌入与相关性排序集成到单一模型中。
- SOTA 性能:广泛的评估表明,在所有十个 I2I 任务中均取得了最先进的结果,消融研究证实了两个训练阶段之间的协同效应。
- 工业部署验证:成功集成 MRL 以实现灵活的维度选择,并验证了该模型在小红书大规模在线和离线生产环境中的性能。
实验结果
- 基准比较:UniNote 在包含 6.6 万篇笔记和 50 万 + 物品的数据集上,与 SOTA 基线(RzenEmbedding 和 Qwen3VL-Embedding-8B)进行了评估。
- UniNote 在从属检索(例如,I2Note:93.7% R@1,而基线为 41.2%)和语义提取任务中取得了最佳性能,基线因无法建模全局 - 局部关系而在这些任务中表现挣扎。
- 在OCR 感知方面,UniNote 在 OCR 到笔记和 OCR 到图像任务中显著优于基线,尽管在图像到 OCR 任务中表现略低于某些基线。
- 对于笔记到笔记的相关性,UniNote 实现了相当或略有提升的召回率(R@10:99.5%),同时显著提高了精确率(P@5:96.0%,而仅 SFT 为 92.6%)。
- 消融研究:
- 移除硬负例挖掘(随机采样)导致性能显著下降,验证了全局硬负例挖掘和软监督的必要性。
- 排除基于规则的启发式方法和反事实负例,降低了模型区分细微语义差异的能力。
- 移除 RL 阶段使笔记到笔记任务的 Recall@5 和 Precision@5 分别降低了 1.4% 和 3.4%。
- MRL 性能:在 512 维时,性能接近全维特征。即使在 64 维时,模型在关键任务中仍保留了约 70% 的能力,证明了存储与精度之间的有效权衡。
- 在线部署:在线 A/B 测试中,UniNote 在笔记到图像/视频/文本任务中实现了高召回率保持(85.6%–93.6%),仅使用单次嵌入提取,所需的存储和计算量比基于 CLIP 的基线方法少 9.2 倍。在离线大画廊检索中,UniNote 的相关样本召回率比基线提高了 23.5%。
意义
本文声称 UniNote 为工业级异构物品检索提供了一种高效、实用的解决方案。通过统一表示与排序,它解决了去耦流水线的系统性低效以及现有 MLLM 嵌入中的粒度不匹配问题。这项工作表明,强化学习可以有效地将嵌入空间与内容相关性对齐,从而实现单次传递的高精度排序。在小红书的成功部署验证了该模型在现实世界的大规模应用中平衡检索质量与严格延迟及成本约束的能力。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。