The RAT: A Unified Bayesian Model for RAG Evaluation
本文介绍了“The RAT”,这是一个统一的贝叶斯框架,它将 RAG 评估分解为检索、弃权和生成三个组成部分,以揭示隐藏的行为差异、优化标注策略,并将人类与 LLM-as-a-judge 的评估整合进单一的概率模型中。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能领域,一种被称为检索增强生成(RAG)的流行方法脱颖而出,它成为提高大型语言模型可靠性的重要手段。这些系统的工作原理是:首先在庞大的文档库中搜索与用户问题相关的信息,然后利用找到的信息来辅助模型构建答案。这种两步走的过程旨在防止模型“一本正经地胡说八道”——即 AI 系统自信地陈述虚假事实这一常见问题。然而,评估这些系统的运作效果已被证明是一项难题。传统方法通常只关注最终结果:用户是否得到了正确的答案?这一单一指标虽然有用,却掩盖了复杂的现实。它无法区分一个系统是找到了正确信息并回答正确,还是在未找到任何信息的情况下猜对了,亦或是找到了正确信息却未能有效利用。为了真正理解这些机器,研究人员需要观察其内部流水线,不仅要观察最终输出,还要观察搜索、决策过程以及最终响应是如何相互作用的。
苏黎世应用科学大学的一个研究小组开发了一种全新的方法来窥探这个“黑盒”,他们将这些系统的评估视为一个统一的统计谜题,而非简单的检查清单。他们引入了一个框架,将搜索的成功与答案生成器的行为分离开来。在他们的模型中,只有当系统根据所找到信息的质量做出恰当的行为时,才被视为成功。这意味着,如果一个系统没有找到相关的文档并明智地拒绝回答,会被判定为行为正确;同样,如果一个系统找到了正确的文档并准确回答,也被视为行为正确。相反,如果一个系统在什么也没找到的情况下仍然进行猜测,或者在找齐了所有信息后却回答错误,即使最终答案由于运气好而凑巧正确,也会被标记为违反了其内部策略。通过对这些不同步骤进行整体建模,研究人员可以追踪搜索阶段的错误如何波及到最终答案,以及不同的模型如何处理不确定性。
为了测试这一方法,该团队进行了一项涉及二十七种不同配置系统的庞大实验。他们结合了三种不同的搜索引擎、三种不同的语言模型,以及涵盖事实核查和复杂推理的三组不同问题。当仅观察最终得分时,许多系统看起来几乎完全相同。然而,新框架揭示了标准指标所掩盖的深刻行为差异。例如,一个模型在搜索失败时会始终拒绝回答,严格遵守“仅在有证据时才发言”的政策。而另一个模型虽然取得了相似的总体成功率,却经常在搜索未找到任何内容时依然进行猜测。研究表明,两个系统在表面层面上可能看起来同样优秀,但其运作原则却截然不同,其中一个在信息缺失的现实场景中要可靠得多。
研究人员还解决了一个任何试图改进这些系统的人都会面临的实际问题:如何分配有限的人工审核预算。检查每一个查询的每一个步骤既昂贵又耗时。团队调查了究竟是让人类验证搜索是否找到了正确的文档更好,还是验证是否找到了正确答案更好,亦或是两者兼顾更好。他们发现了一个显著的不对称现象:验证搜索结果对于了解系统是否遵循其规则提供了显著更多的洞察,这比验证最终答案要有效得多。这是因为“是否回答”或“保持沉默”的决策高度依赖于搜索是否成功。如果人类确认搜索失败了,他们就能立刻知道系统理应保持沉默;如果系统回答了,则说明它违反了策略。然而,仅仅知道最终答案,却无法告诉他们系统在当时是否做出了正确的决策。这一发现表明,对于旨在调优这些系统使其更加诚实和谨慎的开发者而言,将注意力集中在检索信息的质量上,比仅仅关注最终输出能获得更高的投资回报。
最后,该研究探讨了自动化评判的角色,即使用一个人工智能来给另一个人工智能打分,这是为了节省成本而采取的常见做法。研究人员发现,虽然这些自动化评分器可以处理海量数据,但它们容易犯一种特定类型的错误:它们经常在搜索其实并未成功时判定搜索成功。由于这种过度估计成功的倾向,仅仅增加成千上万个自动标签并不能提高评估的准确性。研究结论指出,少量经过妥善校准的细致人工判断,其价值远高于堆积如山的嘈杂自动化数据。这项工作为理解这些复杂系统如何思考及失效提供了一张更清晰、更诚实的地图,为构建不仅正确而且在推理过程中值得信赖的人工智能指明了方向。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。