PASH at TREC 2021 Deep Learning Track: Generative Enhanced Model for Multi-stage Ranking
本文介绍了 PASH 在 TREC 2021 深度学习赛道中的参与情况,详细阐述了一个整合了稀疏与稠密检索、针对点对排序(point-wise)和对对排序(pair-wise)的持续预训练,以及通过引入创新的生成式 T5 模型来提升较前一年性能的多阶段排序框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在经营着一座拥有数百万本书籍(文档)和数十亿页内容(段落)的巨型图书馆。每天,都有成千上万的人走进来,提出非常具体的问题。你的工作就是找到能回答这些问题的准确页面或书籍,并将它们放在列表的最顶端。
这篇论文描述了一个名为 PASH 的团队如何参加了一场高规格的竞赛(TREC 2021),旨在看谁能为这项工作构建出最优秀的“图书管理员”。以下是他们做法的简单解释:
1. 两步搜索策略(召回阶段)
在图书管理员决定哪个答案是“最好”的之前,他们首先需要收集一大堆“可能的”答案。PASH 使用了一种“双管齐下”的方法来收集这些候选对象:
- 关键词猎手(稀疏检索): 这可以想象成一位只看页面上精确单词的图书管理员。如果你询问“苹果”,他们会找到带有“苹果”一词的页面。为了让这个过程更聪明,他们使用了一个机器人(T5),该机器人阅读一个页面并写下该页面可能回答的问题列表。这有助于关键词猎手即使在用户没有使用完全正确的词汇时也能找到页面。
- 概念阅读者(稠密检索): 这是一位理解文字背后“含义”的图书管理员。即使你问的是“水果”,而页面上写的是“红富士”,这位图书管理员也知道它们是匹配的。PASH 使用了一个名为 ColBERT 的系统,它擅长理解上下文,且不会被速度问题所困扰。
通过结合这两者,他们撒下了一张大网,以确保不会遗漏任何好的答案。
2. 排序阵容(多级排序)
一旦他们拥有了一大堆潜在的答案,他们就需要将它们从“最好”到“最差”进行排序。他们分两个轮次进行了这项工作:
- 第一轮(逐点检查): 他们单独查看每个答案,并询问:“这个答案本身有多好?”他们使用了强大的 AI 模型(如 BERT 和 XLNet),这些模型经过了通用知识的训练,并针对特定的图书馆数据进行了微调。
- 第二轮(面对面匹配): 这是他们的一个新技巧。他们不再只是单独给每个答案评分,而是开始让答案之间进行直接比较。“答案 A 是否比答案 B 更好?”这使得他们能够利用更多的数据来训练他们的排序器,使其变得更加敏锐。
3. 新的超级工具(生成式模型)
去年比赛中最大的变化是引入了一个名为 T5 的全新的、大规模的 AI 模型。
- 类比: 想象之前的模型像是记住了图书馆目录的专家学生。而新的 T5 模型则像是一个能够从头开始编写答案摘要的天才。
- 结果: 这个“生成式”模型非常强大,它通常可以在前 5 个结果(Top 5)中就找到完美的答案,而无需进一步查找。然而,论文指出,虽然它在快速找到“最佳”答案方面表现出色,但在对剩余列表进行排序(Top 10)方面,与旧模型相比并不完美。
4. 团队协作(集成)
最后,他们并没有仅仅依赖一位图书管理员,而是训练了几个不同版本的排序系统,并赋予它们略微不同的变化(例如给予它们不同的随机起点)。然后,他们结合了所有这些图书管理员的意见来做出最终决定。这种“团队投票”通常比任何单个图书管理员 Alone 能达到的结果都要更准确。
核心总结
该团队发现,将“关键词猎手”与“概念阅读者”相结合效果非常好。他们还发现,使用新的“生成式”T5 模型可以帮助他们非常快速地找到绝对最佳的答案,但他们也意识到,在未来,他们需要教会这些生成式模型如何更好地对“整个”列表进行排序,而不只是挑选出顶尖的赢家。
简而言之: 他们构建了一个超级图书管理员,该管理员使用两种不同的搜索方法来寻找候选对象,然后使用一个 AI 团队(包括一个新的“写作型”AI)对最佳答案进行投票,从而在比赛中获得了极高的分数。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。