CeQe: Grounding Lexical Retrieval in Semantic Evidence
本文介绍了一种称为交叉编码器查询扩展(Cross-Encoder Query Expansion, CE-QE)的方法,该方法通过从语义搜索结果的交叉编码器归因中提取决定性术语来扩展 BM25 查询,从而在不修改底层索引或依赖生成式幻觉的情况下增强词汇检索,有效地弥合了词汇鸿沟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一座庞大且混乱的食谱图书馆中寻找一份特定的食谱。你有两种搜索方式。第一种方式就像一位严厉的图书管理员,只寻找你输入的精确词汇。如果你搜索“香辣番茄汤”,他只会寻找包含“香辣”、“番茄”和“汤”这些词的书籍。如果一本书将这道菜描述为“带有番茄的火红浓汤”,他会完全忽略它,尽管这正是你想要的。第二种方式则像一位睿智、直觉敏锐的朋友,他理解你想要的东西背后的“意图”。他可能会找到那本关于“火红浓汤”的书,因为他理解热度和番茄的概念,即使词汇并不匹配。
在计算机科学领域,这就是“词法”(lexical)搜索(严厉的图书管理员)与“语义”(semantic)搜索(直觉敏锐的朋友)之间的较量。多年来,工程师们一直试图将两者结合起来,希望朋友的直觉能帮助图书管理员找到正确的书。但问题在于:这位图书管理员非常固执,如果朋友发现了一本完美的书,但因为词汇不匹配导致图书管理员根本没看到它,图书管理员就会在朋友展示之前直接将其丢弃。这篇论文就在解决这种固执。它提出了一个问题:我们能否在搜索开始之前,教会图书管理员理解朋友的直觉,从而让他们从一开始就不会错过正确的答案?
IBM 研究院由 Adam Kahirov 领导的研究团队表示,答案是肯定的。他们引入了一个巧妙的技巧,称为交叉编码器查询扩展(Cross-Encoder Query Expansion, CE-QE)。你可以把它想象成一个坐在图书管理员和朋友之间的“秘密翻译官”。它是这样工作的:首先,直觉敏锐的朋友(语义搜索引擎)快速找到与你的问题看似相关的头几本书。然后,秘密翻译官(交叉编码器)阅读这些书,并标出让它们变得相关的特定词汇。这就像翻译官指着一本书说:“嘿,图书管理员,你错过了这一本,因为你在找‘香辣’,但这本其实是关于‘火红’和‘浓汤’的。快把这些词加入到你的搜索中!”
随后,团队将这些标出的词汇添加到你原始的搜索请求中。现在,当严厉的图书管理员回到书架前时,他寻找的是“香辣番茄汤”加上“火红浓汤”。突然之间,图书管理员找到了那本他之前会忽略的书。最棒的部分在于,图书管理员不需要重新训练,图书馆也不需要重建。图书管理员只是得到了一个稍微长一点、更智能的词汇列表供其查找。
论文表明,当人们使用不同的词汇来描述同一事物时,这种方法是一个游戏规则的改变者。例如,在一个名为 Natural Questions 的数据集上(人们提出随意的提问,而答案存在于正式的百科全书中),团队发现该方法帮助系统更频繁地找到相关文档(召回率从 0.32 提升到了 0.47)。他们还将此与一种被称为 SESF 的评分系统相结合,该系统以显著优势击败了其他顶尖的搜索方法,使排名质量比目前正在使用的一些最先进模型提高了 5% 以上。
至关重要的是,作者认为这种方法优于近期的其他想法。有些方法试图利用巨大的 AI 模型来“发明”新词或伪造答案来辅助搜索,但 IBM 团队警告说,这可能会导致“幻觉”——即编造出图书馆中根本不存在的事实。而他们的方法是扎实的:他们添加的每一个新词都源自于朋友已经找到的真实书籍。这就像是从一本真实的字典里借用一个词,而不是凭空创造一个。他们还表明,这并不需要对搜索系统进行大规模、昂贵的彻底改造;它只是增加了一个聪明的小步骤,通过牺牲一点点额外的时间来换取显著更高的准确性,使搜索在不破坏现有机制的情况下变得更加精准。
简而言之,这篇论文证明了,通过让“直觉敏锐的朋友”在搜索开始之前向“严厉的图书管理员”低声耳语正确的关键词,我们可以修复现代搜索引擎最大的盲点:即答案就在那里,但词汇却无法匹配的时刻。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。