PRQ-KMeans: Projection Residual Quantization for Semantic ID Tokenization
本文介绍了 PRQ-KMeans,这是一种事后语义 ID 分词方法,它通过移除全局均值分量、利用相似度加权更新来精炼质心,并采用投影残差,从而在生成式检索和推荐任务中实现了超越传统残差量化的卓越性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在互联网浩如烟海的数字图书馆中,数十亿计的产品、文章和视频都在争夺注意力,计算机需要一种超越简单标签的方式来组织信息。传统的系统通常依赖为每个单品分配唯一的代码,就像图书馆的卡片目录一样,每本书都有一个独特的编号。然而,现代人工智能正在学习理解这些条目背后的“意义”,即根据它们“是什么”而非仅仅根据它们“叫什么”来进行分组。这种被称为生成式检索(generative retrieval)的方法,允许机器通过生成描述物品本质的短词序列或标记(tokens)来预测并寻找相关内容。为了高效实现这一目标,研究人员开发了将复杂数据分解为层级结构的方法,其中前几个标记描述宽泛的类别,随后的标记则细化到具体的细节。其中的挑战在于,如何在每一步都剥离出一组物品所共有的共同特征,从而使剩余的信息纯粹是让下一层级细节变得独特的部分。如果系统未能干净利落地移除这些共同特征,它就会浪费容量去重复已经学习过的信息,从而减少了区分那些最重要的物品的空间。
来自快手科技的一支研究团队通过一种名为 PRQ-KMeans 的新方法解决了这一特定问题。他们的工作专注于这些层级代码构建的机制,识别了以往系统在处理从一个细节层级向下一个层级过渡时存在的一个微妙缺陷。在标准方法中,当计算机为一组相似物品选择一个具有代表性的“中心”时,它只是简单地从物品数据中减去该中心,以创建一个用于进一步分析的剩余部分或残差。研究人员发现,这种简单的减法往往会留下原始中心的微弱“回声”——一个随数据传递到下一层的残留成分。这种回声是有问题的,因为它导致下一层系统浪费时间去重新分析那些已经被解释过的差异,从而有效地模糊了那些本应被清晰区分的物品之间的界限。
为了解决这个问题,该团队引入了一个名为“渐进式共性移除”(progressive commonality removal)的过程,它起到了更精确过滤器的作用。该方法并非仅仅减去一个标准平均值,而是首先移除一个在整个数据集中共享的全局背景成分,确保系统从一个干净的状态开始。然后,在构建每个层级的过程中,它使用一种称为“投影”(projection)的技术来消除所选中心的影响。想象一下,将数据向量视为一条指向特定方向的线;研究人员的方法确保发送到下一层的剩余数据与它刚刚经过的中心方向完全垂直。这保证了没有任何先前决策的部分会泄露到下一阶段,从而迫使系统完全专注于定义更精细细节的新的、独特的差异。他们还改进了系统对物品进行分组的方式,允许数据点不仅受其最近邻居的影响,还能受到周围一小圈候选者的影响,从而在做出最终决策前,建立起更准确的数据景观图谱。
应用该方法的效果是通过一个包含数百万件商品和查询的工业级电子商务搜索引擎的大规模数据集进行衡量的。新方法在组织数据以及帮助搜索引擎找到正确产品方面表现出了明显的优势。在这个工业数据集上,与之前的最优方法相比,新方法将系统在排名前五十结果中命中正确物品的能力提升了 7.4%,并将正确物品的排名提升了 11.8%。这些提升并不局限于某一类数据;研究人员还在涵盖运动、玩具、服装和音乐的四个公开推荐基准测试集上测试了该方法。在所有案例中,新方法的表现均等同于或优于领先的替代方案,证明了该技术适用于不同类型的内容。
除了数字之外,研究人员还通过可视化手段展示了使用他们的新方法后,系统的内部地图发生了怎样的变化。在旧系统中,组织的层级往往会挤在一起,后层的聚类紧密地集中在中心,因为它们仍然携带著早期决策的“回声”。通过使用新的投影方法,各层级分布得更加均匀,利用了所有可用空间来区分不同的物品。这种结构性的改进意味着系统可以为不同的产品分配更多的唯一代码,减少了无关物品被迫共享相同标识符的情况。通过仔细控制从一个分析层级传递到下一个层级的确切信息,研究人员表明,构建一个更高效、更准确的系统来在数字世界中寻找事物是可能的,他们将一个微妙的数学修正转化为了在互联网搜索和发现内容方面显著的实际收益。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。