SciRet: A Compute-Aware Empirical Study of Retrieval and Reranking for Scientific RAG
SciRet 展示了一项针对固定科学 RAG 流水线在不同 CORD-19 语料规模下的计算感知实证研究,该研究表明混合检索优于单一方法,同时强调了领域不匹配的重排序器带来的负面影响,以及语料规模与生成忠实度之间的正相关关系。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图解开一个谜团,但你的工作场所不是一座尘土飞扬的图书馆,而是一座由科学论文组成的、不断增长的巨型大山。你有一个超级聪明的机器人助手(即人工智能)可以阅读这些论文并回答你的问题。这种设置被称为检索增强生成,简称 RAG。你可以把它想象成一名侦探,先去图书馆寻找正确的线索(检索),然后仅根据这些线索撰写报告(生成)。
但棘手的地方在于,科学论文是用一种非常特定且精确的语言编写的。一个被训练用来寻找“最佳餐厅”或“电影评论”答案的机器人,在尝试寻找关于“病毒蛋白”或“化学反应”的答案时可能会感到困惑。这就像是把一份蛋糕食谱交给了一位厨师,却要求他去修理汽车发动机;工具虽然在那里,但它们并不适用。科学家们提出的重大问题是:“如果我们给机器人一个更大的图书馆,它会变得更擅长寻找正确的线索,还是只会变得更加困惑?”
这正是研究团队在一项名为 SciRet 的新研究中试图测试的内容。他们并没有制造一个全新的机器人;相反,他们拿出了一个标准且广为人知的机器人,并给了它三个不同规模的图书馆来工作:一个包含 1,000 篇论文的小型图书馆,一个包含 5,000 篇的中型图书馆,以及一个包含 15,000 篇的巨型图书馆。他们想观察机器人的“搜索引擎”和“阅读理解能力”是如何随着图书馆规模的扩大而变化的。
以下是他们的发现,而且这其中有一个情节转折。
首先,他们发现机器人的搜索策略非常重要。他们测试了两种寻找线索的方法:一种是寻找精确的单词匹配(就像图书管理员检查你是不是说的是“猫”而不是指代“猫”);另一种是理解单词的“含义”(就像一个知道即使你说了“小猫”,你也指的是“猫科动物”的朋友)。研究表明,最好的方法是同时使用两者。当他们结合了这两种搜索方法时,即使是在那个 15,000 篇论文的巨型图书馆中,机器人也能几乎完美地找到正确的线索。这就像是拥有一名既检查索引卡片又理清故事情节的侦探,确保没有任何重要的信息被遗漏。
然而,他们还测试了一个许多人都在使用的流行“升级版”工具:一个专门设计用于重新排列线索列表顺序,从而将最好的线索放在最顶端的工具。这个工具是基于通用的网络搜索(如寻找食谱或新闻)进行训练的。当研究人员尝试将这个经过网络训练的工具用于科学论文时,情况反而变得更糟了。这就像是你雇佣了一位著名的影评人来评判一场化学实验;他们可能有很好的品味,但他们并不了解实验室的规则。研究发现,这种“现成”的重排序工具降低了答案的质量,这表明对于科学领域,你不能直接复制粘贴互联网上的工具。
最后,他们观察了机器人撰写最终答案的表现。令人惊讶的是,随着图书馆规模的扩大(从 1,000 篇增加到 15,000 篇),机器人的回答变得更加忠实于事实,也更具相关性。看来,拥有更多的科学证据有助于机器人保持思路清晰,即使搜索过程很困难。
研究人员谨慎地表示,这并不是所有科学问题的最终答案。他们使用了一组特定的 15 个问题来测试该系统,并且必须对哪些论文是“正确”的做出一些假设,因为他们无法让人类专家检查其中的每一篇。但他们的发现提供了一个清晰且实用的指南:如果你正在构建一个阅读科学文献的系统,不要仅仅依赖一种搜索方法,并且在使用针对互联网训练的工具处理科学工作时要非常小心。有时,经过不同规模仔细测试的最简单的工具组合,比最昂贵的升级版效果更好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。