Reinforced Informativeness Optimization for Long-Form Retrieval-Augmented Generation
本文介绍了 RioRAG,这是一个通过将有信息量定义为一个可验证的目标,并采用以核心信息点为中心、跨来源的验证方法,为强化学习提供稳定且密集的奖励,从而增强长篇幅检索增强生成的框架,且无需依赖人工设计的监督或强大的教师模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你请一位非常聪明但有时过于自信的图书管理员(人工智能)撰写一份关于复杂主题(例如“量子隧穿是如何工作的?”)的长篇详细报告。
这位图书管理员并非凭空猜测;他们会前往图书馆书库,取出十本不同的书籍,并试图根据所找到的内容撰写一份完美的摘要。这被称为检索增强生成(RAG)。
然而,该论文指出了一个主要问题:你如何给这位图书管理员的工作打分?
问题所在:“精确匹配”的陷阱
在简短的测验中(例如"2+2 等于几?”),评分很容易:答案要么是"4",要么不是。但对于长篇报告而言,并不存在唯一的“正确答案”。
- 旧方法:当前的人工智能系统试图使用模糊的规则,或者通过询问另一个人工智能“这好吗?”来给这些长篇报告打分。这就像让一位疲惫的老师一次性批改 50 篇论文。他们会感到疲惫,评分会随机上下波动(不稳定性),并且经常抓不住重点。人工智能因此收到混乱的反馈,无法学会如何改进。
- 结果:人工智能可能会写出一篇庞大而空洞的论文,听起来不错却遗漏了实际事实,或者它可能会产生幻觉(编造内容),因为它不知道在长文本中“真相”是什么样子的。
解决方案:RioRAG(“事实核查”系统)
作者提出了一种名为RioRAG的新系统。他们不再问“这篇论文好吗?”,而是将游戏规则改为:“你是否包含了每一个重要的事实?”
以下是 RioRAG 的工作原理,使用一个简单的类比:
1. “金块”搜寻(分解任务)
想象一下,图书管理员的源书籍中包含数百个微小的、金色的事实(金块)。
- 旧方法:评分者通读整篇论文,给出一个模糊的分数,例如"7/10"。
- RioRAG 方法:在图书管理员撰写之前,系统会从源书籍中提取所有具体、可验证的事实,并将它们列在检查清单上。
- 示例清单:“提及穿越势垒”、“提及约瑟夫森结”、“提及扫描隧道显微镜(STM)设备”。
2. “事实核查”评分(可验证的奖励)
当图书管理员写下答案时,系统不会猜测它是否“好”。它只是检查检查清单。
- 你提到势垒了吗?(是/否)
- 你提到结了吗?(是/否)
- 你提到设备了吗?(是/否)
如果答案涵盖了 3 项中的 3 项,它就得满分。如果只涵盖 1 项,得分就会较低。这是可验证的,因为你可以确切地指出该事实在源书籍中的出处。这消除了猜测。
3. “长度惩罚”(不要只是啰嗦)
有时,人工智能会试图作弊,通过写一篇 10 页的论文来增加偶然命中正确事实的机会。
- RioRAG 有一条规则:如果你写得太长却没有添加新事实,你的分数就会下降。
- 它鼓励人工智能做到简洁且信息密集,而不是冗长且空洞。
4. 自我提升(健身房)
该系统将人工智能置于一个训练循环中:
- 人工智能尝试撰写答案。
- 系统根据“事实清单”检查答案。
- 人工智能获得清晰的分数(奖励)。
- 人工智能再次尝试,利用该分数学习如何在下次命中更多事实。
由于反馈清晰且基于真实事实(而非模糊的观点),人工智能学得更快、更稳定。它不需要一位“超级老师”写出完美的答案供其模仿;它通过尝试自己命中清单目标来学习。
结果
作者在两个大型基准测试(LongFact 和 RAGChecker)上测试了这种方法。他们发现:
- 更多事实:人工智能记住并包含了更多来自源文档的实际事实。
- 更少幻觉:由于严格奖励其坚持清单,人工智能编造的虚假事实更少。
- 更好的稳定性:训练没有崩溃或失控,因为评分系统是可靠的。
简而言之
RioRAG 不再试图猜测人工智能的长篇论文是否“好”,而是开始检查它是否完整。通过将模糊的论文转化为一个简单的“你是否勾选了这些事实?”游戏,他们构建了一个系统,教导人工智能在回答复杂问题时更加真实、详细和可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。