← 最新论文
💻 computer science

Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)

本文介绍了 Deepchecks,这是一个旨在通过提供多维度评估、根本原因分析和生产监控来确保可靠性、相关性以及与特定应用需求的一致性,从而应对评估检索增强生成(RAG)系统所面临复杂挑战的综合框架。

原作者: Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常聪明、健谈的助手(大型语言模型,或称 LLM)。这位助手擅长写故事和回答问题,但它有一个坏习惯:有时会完全编造内容,或者给出与具体情况不太匹配的通用答案。这就像一个背熟了教科书的学生,却忘了核对作业题的具体细节,从而得出自信但错误的答案。

为了解决这个问题,开发者创建了一个名为RAG(检索增强生成)的系统。你可以把 RAG 想象成给那位聪明的助手配备了一张借书证和一位图书管理员

  1. 图书管理员(检索):在助手回答之前,图书管理员会迅速在图书馆(文档数据库)中搜索,找到与问题完全相关的页面。
  2. 助手(生成):助手阅读这些页面,然后利用图书馆的书籍作为事实依据来撰写答案。

问题所在:
即使有图书管理员,系统仍可能失败。图书管理员可能会拿错书,或者助手可能会无视书籍,无论如何都要编造内容。该论文指出,检查整个系统是否运行良好极其困难,因为其中涉及太多变动的部分。

解决方案:Deepchecks
作者引入了Deepchecks,它充当这些 RAG 系统的超级严格的质量控制检查员。Deepchecks 不仅仅给出一个单一的“通过/不通过”等级,而是将系统分解为需要检查的具体“属性”,就像汽车机械师检查发动机的不同部件一样。

以下是 Deepchecks 如何使用简单类比来检查系统:

1. 三项主要检查(“属性”)

Deepchecks 从三个具体方面入手,以确保答案是高质量的:

  • 检索相关性(图书管理员是否找到了正确的书?)
    • 类比:如果你问“如何烤蛋糕?”,图书管理员就不该递给你一本关于“如何修车”的书。Deepchecks 会检查检索到的文档是否真正有助于回答问题。
  • 基于上下文的 grounded(助手是否紧扣书籍?)
    • 类比:这是“幻觉”检测器。如果书上说蛋糕需要 2 个鸡蛋,但助手说是 10 个,Deepchecks 会识破这个谎言。它会验证答案中的每一个事实是否确实得到了图书管理员找到的文档的支持。
  • 完整性(助手是否回答了整个问题?)
    • 类比:如果你问“如何烤蛋糕以及烤箱应该设定什么温度?”,答案就不应该只说“把它放进烤箱”。Deepchecks 会检查助手是否涵盖了你请求的所有部分。

(此外还有一项安全检查,以确保助手不会粗鲁、泄露隐私信息或说出任何危险的内容。)

2. “整体”评分(最终等级)

大多数工具只会列出上述各项的分数。Deepchecks 则更进一步。它使用一种智能的“聚合机制”(一种学习到的公式),将所有这些分数合并为一个最终等级:正面、负面或未知。

  • 正面:图书管理员找到了正确的书,助手也据此完美作答。
  • 负面:出了问题(拿错了书、编造了事实,或答案不完整)。
  • 未知:情况并非糟糕透顶,但尚未达到“完美”的高标准。

3. 侦探工具(根本原因分析)

如果系统获得“负面”等级,Deepchecks 不会只告诉你它失败了;它会像侦探一样告诉你为什么

  • 类比:想象一辆车抛锚了。普通机械师会说:“它坏了。”Deepchecks 则会说:“发动机没问题,但轮胎瘪了。”
  • 这有助于开发者确切知道在哪里修复问题:是需要更好的图书管理员(更好的检索)?还是需要训练助手更好地倾听(更好的生成)?

4. “时间机器”(版本比较与监控)

Deepchecks 还允许你并排比较系统的不同版本。

  • 类比:这就像比较更换轮胎前后汽车的性能。新轮胎是否让车跑得更快了?
  • 它还会在系统于现实世界中运行时进行监控。如果系统随时间推移开始变差(可能是因为图书馆的书籍发生了变化,或者用户的问题发生了变化),Deepchecks 会立即发出警报。

论文发现

作者使用以下数据将 Deepchecks 与其他流行工具(如 RAGAS 和 LangSmith)进行了测试:

  1. 公共数据集:大家熟知的标准测试问题。
  2. 客户数据集:来自实际公司的真实案例(如技术支持聊天和求职者评估)。

结果:Deepchecks 在识别错误方面表现更好,尤其是在真实的客户数据中。虽然其他工具有时会遗漏错误或给出不一致的评分,但 Deepchecks 在识别系统何时撒谎(产生幻觉)或给出无关答案方面更为准确。

总结
Deepchecks 是一个全面的工具包,确保你的 AI 助手不仅仅是自信地说话,而是真正基于你提供的文档讲述真相。它检查图书管理员,检查撰写者,检查安全性,并为你提供一份清晰的成绩单,以便你能够精准地修复任何故障。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →