← 最新论文
💬 NLP

Hallucination Detection via Activations of Open-Weight Proxy Analyzers

本文介绍了一种代理分析器框架,该框架通过分析本地托管的小规模开放权重模型的内部激活来检测大语言模型中的幻觉现象,在多样化的分析器架构上实现了最先进的性能,同时证明了更大的模型规模并不一定与更高的检测准确率相关。

原作者: Akshita Singh, Prabesh Paudel, Siddhartha Roy

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Akshita Singh, Prabesh Paudel, Siddhartha Roy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明但有时不可靠的作家(大型语言模型),他正试图基于一份特定文本回答问题。有时,这位作家会编造内容,或“产生幻觉”,将事实与虚构混杂在一起。

问题是:如何在不窥探其大脑或要求其解释思维过程的情况下,识破这位作家的谎言?通常,如果这位作家是一个封闭系统(如大型商业 API),你无法窥见其内部运作机制。

本文介绍了一种巧妙的全新解决方案:“代理分析器”(Proxy Analyzer)。

核心思想:“第二意见”侦探

与其试图窥探作家的内心,作者们构建了一个小型、独立的侦探(一个较小的 AI 模型),让它同时阅读“最终故事”和“原始源文档”。

可以这样理解:

  • 作家:参加考试的学生。
  • 源文档:教科书。
  • 幻觉:学生写出了一个听起来不错但教科书中没有的答案。
  • 旧方法:试图窥探学生的大脑,看他们是否在猜测。(如果学生是一个“黑盒”,这几乎不可能。)
  • 新方法(本文):你聘请一位精明的小导师(代理分析器),让学生答案和教科书并排阅读。这位导师无需了解学生如何思考;他们只需寻找答案与书本之间的张力

如果学生的答案与书本相矛盾,导师的“大脑”(AI 的内部电信号)就会以特定且可预测的方式亮起。系统通过检测这些电“闪光”来识破谎言。

侦探如何工作(18 条线索)

这位侦探不仅仅阅读文字;它观察 AI 处理文本的机制。作者基于 AI 变换器(transformers)的工作原理,构建了18 种不同的“线索”(特征)。以下是其中几个最重要线索的类比:

  1. “注意力”聚光灯(信号 2):想象 AI 有一束聚光灯照射在源文本上。当它说真话时,聚光灯停留在书本上;当它撒谎时,聚光灯会游移或变得混乱。系统精确测量光线照射的位置。
  2. “记忆”与“阅读”之战(信号 4):AI 有两种回答方式:阅读书本(好)或依赖其自身记忆的事实(有风险)。系统测量哪一种占上风。如果“记忆”比“阅读”叫得更响,那很可能就是幻觉。
  3. “困惑”计(信号 3):当 AI 阅读真相时,它会分散注意力;而当它撒谎时,它往往会固着在几个记忆单词上,导致注意力“坍塌”。系统能捕捉到这种坍塌。

大型实验

研究人员使用七种不同规模的 AI 模型测试了这位侦探,范围从微小(05 亿参数)到巨大(90 亿参数)。他们将这些模型视为“侦探”,以观察哪一种最擅长识破谎言。

令人惊讶的结果:

  • 更大并不总是更好:通常,我们假设更大、更昂贵的侦探更聪明。但在这里,一个30 亿参数的模型实际上击败了同一家族中 80 亿参数的模型。这就像发现一辆紧凑灵活的汽车在特定赛道上比一辆巨大的豪华 SUV 更快。侦探的设计比其规模更重要。
  • “小”侦探很出色:一个微小的 0.5 亿参数模型(Qwen2.5)的表现几乎与那些庞然大物一样好。这意味着你不需要超级计算机来捕捉幻觉;一个小型、快速、廉价的模型就能完美胜任。
  • 超越专家:他们的系统始终优于之前的最佳方法(ReDeEP),而后者需要访问原始作家的内部数据。代理分析器在从未接触原始作家的情况下做到了这一点。

为何这很重要

该论文声称这是一个游戏规则的改变者,因为:

  1. 它适用于“黑盒”作家:你可以用它来检查来自封闭系统(如 GPT-4)的答案,在这些系统中你无法看到内部代码。
  2. 它是通用的:由于“谎言”是答案与源文档之间的不匹配,任何阅读该文本的 AI 都会显示出相同的电“张力”。检测器不在乎是谁写了答案。
  3. 它高效:你不需要运行两次庞大的生成器来检查它。你只需运行一次微小、廉价的检测器。

局限性(注意事项)

作者承认一个弱点:他们的侦探是在短文档(约 1,200 个字符)上训练的。当他们在更长的文档(3,000 个字符)上测试时,它变得略微困惑,因为文本的“长度”改变了线索的外观。他们相信可以通过在更长文本上重新训练侦探来解决这个问题,但目前,它在标准长度的文档上效果最好。

简而言之:该论文证明,你可以通过聘请一个小型、独立的 AI 来阅读答案和源文档,寻找表明谎言的特定电“破绽”,从而捕捉 AI 幻觉。令人惊讶的是,一个设计精良的小型侦探往往比巨型侦探更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →