Distributional Approximate Nearest Neighbour Search for Uncertainty-Aware Retrieval
本文介绍了 DINOSAUR,这是一个通过为用户和物品采样多个嵌入向量,将嵌入不确定性引入近似最近邻搜索的框架,从而在保持与现有基础设施兼容并最小化召回损失的同时,提升了对多样化长尾内容的检索能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走在一座拥有数百万本书籍的巨大图书馆中。你想根据自己当下的心情找到一本完美的书。在现代推荐系统中,这座图书馆由一个机器人管理员运行,它使用一张特殊的地图来寻找那些看起来与你以前喜欢的书籍相似的书。
问题所在:“完美”地图过于僵化
目前,机器人管理员将每本书和每个读者都视为地图上的一个单一、固定的点。
- 热门书籍: 想想像《哈利·波特》这样的畅销书。管理员已经见过它们成千上万次了。它们在地图上的位置清晰且精确。
- 小众书籍: 现在想想一本关于特定类型蘑菇的晦涩自出版小说。管理员只见过它寥寥数次。由于数据稀疏,管理员其实并不确定这本书“真正”应该属于地图上的哪个位置。
缺陷: 因为机器人被设定得非常僵化,它只会挑选那些与你的位置完全最近的书。如果那本晦涩的蘑菇书因为管理员的不确定性而稍微偏离了中心,它就会永远被忽略。这创造了一个系统,其中只有著名的、热门的项目才能获得推荐,而独特的、小众的或“长尾”的内容则会被剥夺关注。
解决方案:遇见“Dinosaur”
该论文提出了一种名为 dinosaur 的新方法(用于不确定性感知检索的分布近似最近邻搜索,Distributional Approximate Nearest Neighbour Search for Uncertainty-Aware Retrieval)。
与其将一本书视为地图上的一个点,dinosaur 将不确定的书籍视为一种可能性的云团。
创意类比:“模糊云团” vs. “锐利点”
- 旧方法(点估计): 想象管理员用一个微小、锐利的图钉标记了蘑菇书的位置。如果你的请求落在那个图钉哪怕仅仅一毫米之外,这本书就会被拒绝。
- Dinosaur 方法(分布式): 想象管理员意识到:“我不百分之百确定这本蘑菇书应该属于哪里。”所以,他们没有使用一个图钉,而是在那个大致区域周围投下了一个模糊的图钉云团。
- 对于一本热门畅销书,云团很小很紧凑(因为管理员非常确定)。
- 对于一本小众书籍,云团很大很分散(因为管理员不确定)。
当你寻求推荐时,机器人不仅仅检查一个点;它会检查你的请求是否落在这些模糊的云团之中的任何地方。因为小众书籍拥有更大的云团,它有更高的概率被“击中”并包含在你的列表中。
在实践中如何运作
论文解释说,这不需要建立一个新的图书馆或改变机器人的大脑。这是一个聪明的技巧:
- 采样: 在你到达之前,系统会将小众书籍的“模糊云团”在地图周围生成多个副本,使其散布开来。
- 搜索: 当你进行搜索时,系统会寻找距离最近的副本。
- 去重: 如果它找到了三个相同的蘑菇书副本,它只会将其计为一次推荐。
这就像是撒开一张更宽的网。你更有可能捕捉到稀有的鱼(小众项目),而不会丢失常见的鱼(热门项目)。
结果:更多的多样性,几乎没有成本
作者在大型电影推荐数据集(MovieLens)上测试了该方法。
- 权衡: 通常,如果你试图展示更多多样性,你可能会不小心向人们展示他们不喜欢的东西,从而降低你的“准确性”得分。
- Dinosaur 的发现: 论文表明,通过使用这些模糊云团,他们可以使向用户展示的电影多样性增加三倍(将“目录覆盖率”从约 23% 提高到约 63%)。
- 代价: 他们的“准确性”(他们挑选出用户真正喜欢的电影的频率)下降了一个微小的、几乎不可察觉的幅度(不到 0.5%)。
为什么这很重要
论文认为,这是运行一个更公平的市场的方式。
- 对于创作者: 小众卖家和创作者得到了“数学上的助力”。因为他们的项目具有不确定性,他们会获得一个“更大的云团”,从而在不需要人工经理进行人为干预的情况下,获得一个更公平的被看见的机会。
- 对于用户: 你可以发现那些在僵化系统中会被过滤掉的、具有偶然惊喜感的独特内容。
总结
Dinosaur 是一种简单且聪明的方法,它告诉推荐机器人:“如果你不确定这个项目属于哪里,不要忽略它。给它一点呼吸的空间,这样它才有机会被发现。” 它将机器人的不确定性转化为发现的机会,帮助长尾内容在不破坏系统的情况下生存下来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。