Evaluating RAG Metrics in Applied Contexts: An Experiment, Its Findings and Its Limitations
本文通过在一个业务问答数据集上将四个库中各种 RAG 指标的分数与人工评估及标准指标进行对比,呈现了一项评估这些指标相关性的实证研究,并讨论了方法论的局限性及未来的研究方向。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是名为“RAG”的一位非常聪明但有时会感到困惑的图书管理员的经理。这位图书管理员的工作是根据你的问题,先跑去书架上寻找正确的书页(检索),然后根据这些页面写出一份总结性的回答(生成)。
问题在于:你如何知道你的图书管理员是否真的做得很好?你不能直接问他们:“我做得好吗?”因为他们可能会撒谎或过度自信。你需要一种方法来给他们的工作打分。
这篇论文本质上是一份关于我们用来评估这位图书管理员的评分工具(指标)的成绩单。作者 Quentin Brabant 来自 Orange Research,他设计了一个小型实验,旨在观察哪些评分工具实际上与人类专家的看法相一致。
以下是对实验、发现以及注意事项的简单说明:
1. 设置:“模拟考试”
团队创建了一份包含 96 个特定问题的练习测试,这些问题基于真实的业务文档(如电信报价和客户规则)。
- 人类评分员: 两名专家阅读问题和图书管理员的答案,并给出 1 到 5 分的评分。
- 5 分: 完美的回答,事实正确,细节程度恰到好处。
- 1 分: 图书管理员谈论了完全无关的内容。
- 自动化评分员: 他们测试了四个流行的“AI 评分软件”库(Ragas、DeepEval、RAGChecker 和 Opik)。这些工具试图在没有人类查看每个答案的情况下自动给出分数。
2. 目标:寻找最好的“尺子”
目标不是要宣布哪一个软件库是永久的“赢家”。相反,他们想看的是:“这些自动化的尺子是否真的测量了人类专家所测量的东西?”
如果一个计算机程序说一个答案是“很棒”(5/5),但人类说它“很糟糕”(1/5),那么这个计算机程序就是一把坏掉的尺子。团队寻找的是相关性——即计算机的分数与人类的分数之间的统计学上的“握手”。
3. 发现:谁拿到了正确的成绩?
结果既有惊喜也有失望:
- “老派”工具: 出人意料的是,一些较旧的、更简单的工具(如 METEOR)实际上与人类的相关性相当好。
- “无参考”工具: 有些工具尝试在不看“正确答案”密钥的情况下对答案进行评分。这些工具通常表现得很差。这就像是在不知道正确答案的情况下尝试给数学考试打分;计算机只是在瞎猜。
- 大惊喜 (RAGChecker): 其中一个工具,RAGChecker,显示出与人类评分非常强的相关性。事实上,它的相关性如此之高,以至于作者们产生了怀疑。
- “幻觉”检查: 旨在检查图书管理员是否编造事实(忠实度)的工具,与整体质量得分的相关性并不好。这很好理解,因为图书管理员可以讲真话,但仍然可能给出乏味或无关的回答。
4. 陷阱:“坏掉的尺子”问题
这是论文中最重要的部分。作者指出了他们自己实验中的一个主要缺陷。
类比: 想象一下你在测试一个温度计。你家里只有一个房间,而那个房间的温度始终是 70°F。
- 你把温度计放进房间。它显示 70°F。
- 你放入第二个温度计。它也显示 70°F。
- 你得出结论:“这些温度计是完美的!”
现实情况: 你无法判断这些温度计是在测量温度,还是它们只是始终显示“70”的损坏设备。因为你只测试了一个图书管理员系统(一个房间),所以你无法判断自动评分器究竟是在测量回答的质量,还是仅仅在测量其他东西,比如问题的难易程度。
- 例子: 如果一个问题非常简单,图书管理员就会得到高分。如果自动评分器只是“聪明”到能猜出简单问题会得到高分,那么它就会与人类高度相关。但如果你给它一个难题,它可能会彻底失败。作者怀疑 RAGChecker 可能正是这种情况——它在无意中测量的是“问题难度”,而不是“回答质量”。
5. 结论:下一步是什么?
论文得出结论,虽然这些自动化工具在过滤掉最差的选择方面很有用,但基于这类测试,我们还不能 100% 信任它们。
为了获得真正可靠的评分,作者建议我们需要针对许多不同的图书管理员(不同的 AI 系统)和许多不同类型的问题来进行测试。如果一个工具能够一致地在各种情况下区分出优秀的图书管理员和糟糕的图书管理员,那么我们就知道它是一把好的尺子。
简而言之: 论文测试了用于给 AI 图书管理员评分的尺子。有些尺子看起来不错,但由于这项测试只使用了一个图书管理员,作者警告我们,这些尺子可能只是根据问题的难易程度在进行猜测,而不是根据回答的实际质量。要解决这个问题,下次我们需要在整个“图书管理员教室”里对这些尺子进行测试。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。