Towards Dependable Retrieval-Augmented Generation Using Factual Confidence Prediction
本文提出了一种新颖的两阶段方法,用于构建可靠的检索增强生成系统,该方法结合共形预测以筛选高质量检索上下文,并采用基于注意力的分类器来量化答案的忠实度,从而建立具有改进答案质量和一致性检测能力的认证检索增强生成系统。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在聘请一位非常聪明但稍显不可靠的助手(即人工智能)为你撰写一份报告。为了帮助他们,你提供了一叠参考书(即“检索到的上下文”)供其查阅。问题在于,有时助手会拿错书,或者即使拿对了书,他们也可能编造出文本中不存在的内容。本文提出了一种两步“质量控制”系统,以确保助手的报告值得信赖。
以下是该系统的运作方式,通过简单的类比进行解释:
设置:图书管理员与作家
将人工智能系统视为具有两个截然不同的角色:
- 图书管理员(检索):他们的工作是从图书馆中找到正确的页面。
- 作家(生成):他们的工作是仅利用这些页面来撰写答案。
本文认为,在信任最终报告之前,我们需要对图书管理员和作家都进行“认证”。
第一步:认证图书管理员(共形预测)
第一个问题是:图书管理员是否真的找到了正确的书,还是仅仅抓取了看起来相似的东西?
作者使用了一种称为共形预测的统计技巧。想象你有一袋弹珠。其中一些是“正确”的(包含答案),另一些是“不正确”的。你想抓取 handful 弹珠,但你希望有 90% 的把握确保其中至少有一颗是“正确”的弹珠。
- 他们如何做到:他们首先在练习问题集上测试图书管理员。他们确定了一个“分数阈值”。如果一本书的分数高于这条线,它就会获得一个“信任徽章”。
- 潜在问题:这只有在图书管理员胜任工作时才有效。如果图书管理员非常糟糕,根本无法找到正确的书,那么“信任徽章”系统就会失效。
- 诊断工具:作者创建了两个简单的检查(称为m1和m2),以判断图书管理员是否值得信任。
- m1:“我们是否找到了至少一本值得信赖的书?”
- m2:“我们找到的书中有多少比例是值得信赖的?”
- 教训:如果这些数值较低,整个系统就存在风险。在他们的一些测试中,过滤掉“不可信”的书实际上使最终答案变得更糟,因为图书管理员太差劲了,以至于“不可信”的堆栈中才藏着正确答案!
第二步:认证作家(注意力监控)
第二个问题是:即使图书管理员提供了正确的书,作家是否真的阅读了它们,还是仅仅根据自己的记忆编造了内容?
为了检查这一点,作者观察人工智能的“脑电波”(技术上称为注意力图)。想象作家正在阅读一个句子。你可以清楚地看到他们的目光停留在参考书中的哪些单词上。
- “回看”比率:他们衡量作家回看所提供文本特定片段的比例,与盯着问题或系统指令的比例。
- 分类器:他们训练了一个小型、简单的检测器(逻辑回归模型)来观察这些“眼球运动”。
- 如果作家的目光紧盯着参考文本,检测器会说:“这看起来是事实。”
- 如果作家的目光游移或盯着错误的部分,检测器会说:“警告!这可能是一种幻觉(谎言)。”
- 意外发现:作者发现,如果让检测器查看所有内容(包括问题和系统指令),它在猜测方面会变得非常有效,但这实际上是“作弊”。它学会了诸如“金融问题通常很难”这样的模式,而不是“你是否阅读了文本?”。
- 解决方案:他们决定忽略问题和指令,只观察作家如何关注检索到的片段。这使得检测器的整体准确率略有下降,但在判断人工智能是否真正使用了所提供的事实方面更加诚实。
核心结论
本文并不承诺一种能解决所有人工智能错误的灵丹妙药。相反,它提供了一个诊断工具包:
- 首先检查图书管理员:使用“信任徽章”系统。如果系统无法保证正确的书在堆栈中,就不要信任答案。
- 其次检查作家:使用“眼球运动”检测器,查看答案是否真正基于书籍构建,还是凭空捏造。
通过这两个步骤,公司可以构建人工智能系统,这些系统不仅仅是猜测自己是正确的,而是能够提供统计证书,说明:“我们有 90% 的把握确认该信息来自可靠来源,并且我们有 77% 的把握确认人工智能没有编造内容。”这对于事实错误会带来危险的行业至关重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。