Look Before You Leap: Factual Decoding with Internal Attribution Signals
本文介绍了 DescaPE,这是一个解码框架,它利用源自事实显著层跨度的内部模型信号来检测并惩罚推理过程中的幻觉倾向轨迹,从而在保持极低延迟开销的同时显著提升事实性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大型语言模型是强大的文本引擎,能够创作故事、回答问题并总结复杂的观点。它们的工作原理是通过一个接一个地预测句子中的下一个词,像多米诺骨牌依次倒下一样构建响应。然而,这一过程本身也隐藏着风险:如果模型在早期犯了一个微小的事实错误,这个错误可能会产生滚雪球效应。由于模型试图与其之前的词保持一致,它可能会变本加厉地坚持错误,编织出一个看似自信但完全虚假的故事。这种被称为“幻觉”的现象仍然是人工智能领域最顽固的挑战之一。尽管研究人员尝试通过在更多数据上训练模型或添加外部事实检查器来修复这一问题,但这些解决方案通常需要巨大的计算能力,或者会显著降低系统的运行速度。核心难点在于,一旦模型走上了错误的道路,如果不重写它的整个“大脑”或等到结束时再纠正错误,就很难阻止它。
韩国中央大学的一个研究小组提出了一种处理此问题的新方法,该方法就像在模型思考的瞬间起到了安全制动器的作用。他们将这种方法称为 DESCAPE。他们并没有等待模型完成句子后再检查其真实性,也没有试图通过沉重的重新训练来强迫模型诚实,而是观察了模型在工作时自身的内部机制。他们发现,当模型生成文本时,存在一组特定的内部层——即一段独特的处理步骤——在模型回忆真实事实与编造内容时,其表现出的活跃程度会有所不同。这种内部信号作为一个微妙的真实性指标,其起伏模式揭示了模型是在稳固的基石上运行,还是正在漂向虚构。
研究人员发现,这种信号在整个模型中并不是均匀分布的。通过系统性地阻断模型的某些内部处理部分,他们识别出了一个对于检索准确信息至关重要的“事实显著”(factual-salient)层区间。当模型生成真实事实时,这一部分网络表现得稳定且可预测。然而,当模型即将产生幻觉时,同一部分会产生一个突然的、异常的峰值。这就像是模型的内部指南针在它即将驶离航线坠入悬崖之前,发出了剧烈的警告震动。团队意识到,如果他们能在实时检测到这种峰值,就能在错误的词语被选中之前进行干预,引导模型回归真相。
为了使这一方法具有实用性,研究人员训练了一个名为“探针”(probe)的小型、轻量级助手,用于识别这些警告信号。该探针不需要重新阅读全文,也不需要运行单独且缓慢的验证过程。相反,它在主模型生成每个词的过程中,监视其内部信号。当探针检测到与潜在幻觉相关的特征峰值时,它会将该特定词项标记为高风险。随后,系统会调整可能出现的下一个词的评分,惩罚那些有风险的词,并提高选择基于事实之词的概率。这一切都在模型思考下一个词的极短瞬间内即时发生。
研究结果既精确又高效。在旨在衡量事实准确性的五个不同基准测试中,DESCAPE 方法成功减少了幻觉并提高了生成文本的真实性。在一项涉及长篇传记的具体测试中,该方法取得了 67.20 的评分,显著优于其他现有技术。或许最重要的一点是,这种提升几乎没有造成速度上的损失。该系统仅增加了约 1.10 倍于标准无辅助模型的延迟。这与那些可能让过程变慢七倍或更多的其他方法形成了鲜明对比,因为后者需要模型停止、思考并重写其答案。
研究人员还考察了该方法如何处理不同类型的提问。对于期望详细叙述式回答的开放式问题,该方法表现得非常出色,防止了模型漂向虚假的故事。对于简短、具体的问题,结果则略显复杂,主要是因为该方法有时会促使模型提供比严格评分规则所偏好的更长、更详细的答案。然而,当评估标准调整为寻找正确信息的“存在性”而非“词汇的精确匹配”时,性能有所提升,这表明该方法确实找到了正确的实事,即便措辞略有不同。
这项工作的最引人入胜之处在于,它不需要模型知道自己正在被监视。探针在后台静默运行,利用模型自身架构中已有的信号。它不依赖于外部事实数据库或第二个模型来进行检查。相反,它利用了模型本身具有的关于真伪的独特内部特征。通过倾听这一特征,系统可以在错误即将发生的精确时刻进行干预,有效地在雪球积聚动能之前将其拦阻。
研究还探讨了该方法的局限性。研究人员指出,指示真实性的特定内部层在不同模型之间会有细微差别,这意味着系统需要针对每个应用到的新模型进行校准。他们还发现,虽然该方法在模型拥有知识但选择了错误路径时表现出色,但在识别模型根本不知道答案的情况时效果较差。在这些情况下,模型可能会生成一个自信但错误的回应,因为“不知道”的内部信号不如“幻觉”的信号那样清晰可辨。
尽管存在这些细微差别,这些发现仍为提高人工智能的可靠性提供了一个充满希望的新方向。通过将幻觉视为生成过程中一种可检测的模式,而非事后才去修补的缺陷,研究人员证明了在实时过程中引导模型回归现实是可能的。该方法证明,防止错误的工具已经存在于模型内部;它们只是需要被发现并进行调优。这种方法预示着这样一个未来:大型语言模型可以在生成复杂、富有创造性的文本时,始终保持对自身准确性的无声监测,确保它们讲述的故事始终植根于事实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。