CORTEX: Token-Level Hallucination Detection in RAG via Comparative Internal Representations
该论文提出了 CORTEX,一种用于检索增强生成的词元级幻觉检测方法,它通过比较模型在有无检索文档情况下的内部表示来识别无根据的内容,同时利用信息传播和跨度一致性平滑来实现对幻觉的细粒度定位。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明、博学多才的助手(AI),他正试图回答你的问题。为了确保答案准确,你给了这个助手一叠参考书(检索到的文档),让他边看边写。
有时,助手的表现非常出色,严格遵循书籍内容。但有时,尽管书就在桌上,他可能会不小心捏造一个事实或混淆了一个细节。这就是所谓的“幻觉”(Hallucination)。
在一个冗长且详细的回答中,AI 可能会根据书籍写对 90% 的事实,却在其中一两个句子上出错。目前大多数工具就像一名保安,只在报告结束时检查整个报告。如果报告大部分内容看起来都没问题,他们可能会说:“看起来不错!”从而漏掉隐藏在中间的一个微小的谎言。
这篇论文介绍了一个名为 CORTEX 的新工具,它旨在成为一个“显微镜”,通过逐词(或逐标记/token)的检查,精准发现 AI 在哪里编造了内容。
以下是 CORTEX 的工作原理,我们使用三个简单的类比:
1. “有与无”测试(比较内部表示)
想象一下,你正在试图判断一个学生是在真正阅读教科书,还是仅仅在凭直觉瞎猜。
- 旧方法: 你观察学生的答案,并试图猜测他们是否读过书。
- CORTEX 的方法: 你要求学生把同一个问题回答两次。
- 第一次: 你给他们一本教科书让他们阅读。
- 第二次: 你把教科书收走,让他们凭记忆回答。
CORTEX 比较了 AI 在这两种场景下的“大脑活动”(内部思维)。
- 如果 AI 正在谈论书中发现的事实,那么当书存在时,它的“大脑”会发生显著变化。这就像学生的眼睛因为在文本中找到了答案而放光。
- 如果 AI 在编造内容(幻觉),无论书是否在场,它的“大脑”看起来几乎一样,因为它只是在调用自身的记忆。
通过比较这两种状态,CORTEX 可以精准识别出哪些词是因为书的存在而改变的(正确的),以及哪些词保持不变是因为它们是编造的(错误的)。
2. “思维链”侦探(上下文残差)
有时,AI 非常聪明,它能在回答的早期阅读书中的一个事实,然后在后续句子中利用该事实构建内容。
- 问题所在: 如果你只看后面的句子,可能会觉得 AI 已经不再使用书本了,因为书并没有出现在那里。这可能会误导检测工具,让它认为后面的句子是谎言,尽管它其实是基于前面发现的一个真实事实。
- CORTEX 的解决方案: CORTEX 扮演着一名追踪线索的侦探。它意识到:“嘿,这个句子依赖于 AI 两句前刚刚读到的一个事实。”它减去了这种“间接影响”,以免产生误判。这防止了工具在 AI 实际上只是在延续一个真实故事时,错误地指控其撒谎。
3. “噪声过滤器”(标签持久性平滑)
想象一下,你正在听一个有很多静电噪音的广播电台。有时,静电会让单个单词听起来像是个谎言,即使整个句子都是真实的。
- 问题所在: 原始的检测工具可能会出现抖动。它们可能会将一个词标记为谎言,下一个词标记为真相,再下一个词又标记为谎言,从而产生混乱、零散的模式。但实际上,如果 AI 在撒谎,它通常会针对整个短语或句子撒谎,而不是仅仅针对一个孤立的词。
- CORTEX 的解决方案: CORTEX 应用了一个“平滑”过滤器。它假设如果一个词是谎言,那么紧邻它的词很可能也是同一个谎言的一部分。它将这些点连接起来,将零散的“疑似谎言”转化为清晰、连贯的“确定谎言”块。这使得最终结果更易于人类阅读和理解。
实验结果
作者在两组不同的问题集和三种不同的 AI 模型上测试了 CORTEX。他们发现:
- 与其他方法相比,CORTEX 能更好地找出被编造出来的确切词汇。
- 即使 AI 是一个“API”模型(即无法看到内部结构的黑盒),CORTEX 也能通过使用另一个开放的 AI 模型在后台进行侦探工作来发挥作用。
- 系统中的每一个部分(比较、思维链检查和平衡平滑)都有助于提高检测的准确性。
简而言之,CORTEX 是一个帮助我们更加信任 AI 回答的工具,它能精准定位 AI 在哪里编造了内容,而不是仅仅猜测整个答案的好坏。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。