← 最新论文
💬 NLP

uva-irlab-conv at SemEval-2026 Task 8: Multi-Turn RAG with Learned Sparse Retrieval and Listwise Reranking

本文介绍了用于 SemEval-2026 Task 8 的 uva-irlab-conv 系统,该系统采用了一种结合了学习型稀疏检索与基于大语言模型的对话式查询重写及列表式重排序的多轮检索增强生成流水线,以有效地处理多样化领域和无法回答的查询。

原作者: Simon Lupart, Kidist Amde Mekonnen, Zahra Abbasiantaeb, Mohammad Aliannejadi

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Simon Lupart, Kidist Amde Mekonnen, Zahra Abbasiantaeb, Mohammad Aliannejadi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一座巨大的图书馆中寻找特定的信息,但你不仅仅是在问一个问题,而是在与一位图书管理员进行一场漫长的、来回不断的对话。有时你会说:“CEO是谁?”下一分钟你会说:“他们的地址是什么?”如果没有第一个问题,第二个问题就无法理解。这就是**多轮检索与问答(Multi-Turn Retrieval and Question Answering)**所面临的挑战。

你分享的这篇论文描述了一个来自阿姆斯特丹大学的团队(名为 uva-irlab-conv),他们构建了一个智能系统来充当这位图书管理员。他们参加了一项名为 SemEval-2026 Task 8 的竞赛,旨在测试他们的系统在处理涵盖金融、云计算、政府和维基百科这四个完全不同主题的对话时表现如何。

以下是他们系统的运作方式,通过简单的类比来解释:

1. 翻译官(查询重写)

问题: 人类说话喜欢使用简写。如果你问“谁是CEO?”,接着问“他多大了?”,计算机并不知道“他”指的是谁。
解决方案: 系统有一个“翻译官”(AI)来倾听整个对话历史。在它去图书馆之前,它会将你的最后一个问题重写为一个完整的、独立的句子。

  • 类比: 这就像一个翻译员听到你说“我要蓝色的那个”,然后将其重写为“我要我们刚才看的那排架子上的那件蓝色衬衫”,再转达给店主。

2. 快速侦察兵(学习型稀疏检索)

问题: 图书馆里有数百万份文档。你无法阅读所有文档。
解决方案: 系统使用了一个名为 LION-SP 的“快速侦察兵”。这是一种特殊的搜索引擎,它既擅长理解词义,也擅长理解精确使用的单词。它的设计初衷是即使话题从金融转向政府,也能表现出色。

  • 类比: 想象一个侦察兵跑进一片巨大的森林。他不是在阅读每一棵树,而是快速扫描特定的关键词和概念,带回最具有潜力的前 1,000 片叶子(文档)到总部。

3. 专家法官(重排序)

问题: 侦察兵带回了 1,000 片叶子,但你只需要最好的 10 片。
解决方案: 系统使用了一个两步走的评判过程:

  • 步骤 A(逐点评分/Pointwise): 一个 AI 逐一查看每片叶子并给出一个分数。这把名单缩小到了前 20 名。
  • 步骤 B(列表评分/Listwise): 一个超级聪明的 AI(GPT-4.1)会同时观察这 20 片叶子,同时记住整个对话过程。它通过相互比较来决定完美的排序。
  • 类比: 首先,教练从试训中选出前 20 名球员。然后,主教练在观看这 20 名球员进行模拟赛的过程中,决定最终的先发阵容,以确保他们在比赛语境下配合默契。

4. 讲述者(回答生成)

问题: 现在你有了最好的 10 份文档。你需要一个清晰的答案。
解决方案: 系统提取前 5 份文档和完整的对话历史,并要求一个强大的 AI 来撰写最终答案。

  • 类比: 一位作家坐下来,结合前 5 份研究笔记和完整的对话故事,为你写出一份简短且准确的总结。

他们表现如何?

该团队参加了竞赛中的三个不同挑战:

  1. 寻找文档(任务 A): 他们表现得非常出色,在 38 支队伍中排名第 2 位。他们的系统非常擅长寻找正确的文档,即使是在金融这类棘手的主题中也是如此。
  2. 使用完美文档进行回答(任务 B): 他们得到了评委提供的“正确”文档并被要求撰写答案。他们表现尚可,但不是最好的。
  3. 使用自己的搜索结果进行回答(任务 C): 他们使用了自己的搜索结果来撰写答案。他们在 29 支队伍中排名第 20 位

核心结论:
论文强调了一个特定的权衡。他们的系统在寻找正确信息(检索)方面非常出色。然而,在撰写最终答案时,面对无法回答的问题(例如,当密码不在文档中时,询问“秘密密码是什么?”),它表现得有些吃力。

作者指出,他们的系统非常“忠实”,这意味着如果信息不存在,它很少会编造内容(幻觉)。然而,由于他们没有明确地编程让系统在信息缺失时说“我不知道”,系统有时会尝试回答那些它无法完全回答的问题,这降低了它在生成任务中的得分。

简而言之: 他们构建了一个由 AI 专家组成的团队(翻译官、侦察兵、法官和讲述者),这些专家协同工作来处理复杂的对话。他们是寻找图书馆中正确书籍的大师,但在学会如何承认一本书根本没有答案方面,仍处于学习阶段。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →