← 最新论文
🤖 AI

MPR-CiteG: Enhancing RAG with Multi-Portfolio Retrieval and Citation-Grounded Generation

该论文介绍了 MPR-CiteG,这是一个结合了多组合检索(Multi-Portfolio Retrieval)与引用落地生成(Citation-Grounded Generation)的双组件框架,旨在通过提高检索效率并利用显式来源归因确保事实一致性,从而增强 RAG 系统,减少幻觉,并在 ScienceON AI 挑战赛中获得第二名。

原作者: Hyewon Lee, Minkyung Song, Junghyun Oh, Seunghoon Han, Sungsu Lim

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Hyewon Lee, Minkyung Song, Junghyun Oh, Seunghoon Han, Sungsu Lim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图写一篇关于一个超级复杂话题的学校报告,比如如何制造一个会跳舞的机器人。你拥有一个巨大的图书馆,但书全都乱七八糟地堆在一起,而且有些书是用不同的语言编写的。如果你只是要求一个超级聪明的 AI 根据它自己的记忆来写这份报告,它可能会编造一些听起来很酷、听起来很真实但实际上是错误的事实。这被称为“幻觉”(hallucination),当需要真实、可靠的答案时,这是一个大问题。为了解决这个问题,科学家们使用了一个叫做**检索增强生成(Retrieval-Augmented Generation,简称 RAG)**的小技巧。把 RAG 想象成在 AI 写报告之前,先给它一份包含真实文档的“小抄”。但问题在于,如果 AI 选错了小抄,或者在写报告时没有明确告诉你信息出自哪一页,那么这个答案仍然是没用的。目标是构建一个不仅聪明,而且像一位严谨的研究员一样总是注明出处的 AI。

这正是 MPR-CiteG 框架所做的事情。该项目的研究人员在一次重大的 AI 挑战赛中获得了第二名,他们构建了一个由两部分组成的系统,以确保 AI 的回答既准确又诚实。首先,他们创建了一个多组合检索器(Multi-Portfolio Retriever,简称 MPR)。MPR 不仅仅是针对一个简单的提问向图书馆寻求帮助,它更像是一个由四名策略各异的侦探组成的团队。一位侦探通过扩展问题来寻找相关想法;另一位通过寻找同义词来捕捉表达同一意思的不同方式;第三位在广泛搜索与精准搜索之间取得平衡;第四位则将问题翻译成其他语言,以寻找国际研究成果。他们各自挖掘线索,汇总发现,然后由一位严格的编辑(重排序器)选出最优秀的 50 份文档供使用。

一旦收集到最好的文档,名为**引用锚定生成(Citation-Grounded Generation,简称 CiteG)**的第二部分系统就会接管工作。它是那位拒绝猜测的作者。它阅读前 10 份文档并写出清晰、流畅的答案。但神奇之处在于:对于每一个陈述特定事实的句子,它都会立即附上一个指向确切来源文档的小标签。如果一个句子只是通用的过渡句,则不会带有标签。这样一来,你就可以在阅读答案时瞬间明白:“好吧,这个事实来自来源 A,而那一个来自来源 B。”团队在一个科学问题数据集上测试了这一系统,发现该系统在避免编造事实方面非常有效。他们发现,使用特定类型的 AI 模型(Qwen-2.5-14B)效果最好,并且在检索团队中拥有所有四种“侦探”策略对于获取正确信息至关重要。虽然该系统表现出色,但作者承认,面对需要反复思考过程的极复杂问题时,它有时会感到吃力,这表明未来的版本可能需要更加动态化。最终,MPR-CiteG 向我们展示了如何构建一个不仅会说话,而且真正了解自己在说什么并能证明自己的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →