Signed Layer-Level Evidence in Transformer Predictions, and a Diagnostic for When It Applies
本文引入了语言证据流(Language Evidence Flow, LEF)将 Transformer 的预测分解为带符号的逐层证据,并提出了 ScopeGate——一种基于排列的诊断工具,用以揭示现有误差检测器在模型和任务层面的局限性,从而证明没有任何单一指标能够普遍预测模型的失败。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型是新一代人工智能背后的引擎,它们能够撰写论文、解决数学问题,并进行感觉非常接近人类的对话。然而,在其流畅的外表之下,隐藏着一个持久的缺陷:它们有时会极其自信地捏造事实,研究人员将这种现象称为“幻觉”。多年来,识别这些错误的标准方法是观察模型的最终答案,并询问:“它看起来有多确定?”如果模型为某个词分配了高概率,我们就假设它是正确的。但这种方法存在盲点。它将最终输出视为一个“黑盒”,忽略了产生该输出的复杂内部机制。两个答案可能具有完全相同的置信度水平,但其中一个可能是模型内部组件之间清晰、一致的共识的结果,而另一个则是脆弱的产物,源于一场激烈的内部“内战”,即系统的不同部分正在向相反的方向拉扯。理解这种隐藏的斗争至关重要,因为一个听起来充满信心的谎言往往比一个犹豫的真相更危险。
一个研究团队开发了一种新方法来窥探这个黑盒,揭示了在话音落下之前发生的隐藏“拉锯战”。他们将这一框架称为“语言证据流”(Language Evidence Flow)。该方法不再仅仅观察最终得分,而是追踪模型架构中每一层在处理句子时的贡献。将模型想象成一条长长的决策链,其中每一个环节都为最终的选择贡献了自己的证据。研究人员发现,他们可以为每个环节的贡献分配正值或负值。正值意味着该层支持所选的词;负值则意味着它反对该词。通过对这些值进行求和,他们可以计算出一个“冲突得分”。低分意味着内部各层处于和谐状态,而高分则揭示了模型是在内部存在强烈分歧的情况下生成答案的。这使得他们能够检测出模型何时正在产生幻觉,即使最终答案在表面上看起来完美自信。
研究人员在各种模型上测试了这一想法,从较小的 14 亿参数版本到庞大的 147 亿参数系统,涵盖了不同的架构家族。他们发现,该方法在识别一种特定类型的错误时表现异常出色:即当模型的内部记忆与检索到的外部信息发生冲突时。在检索增强生成(RAG)设置中,模型在回答之前会被给予一篇文档进行阅读。如果文档说的是一回事,而模型的训练记忆说的是另一回事,内部冲突得分就会飙升,从而发出信号,表明该答案很可能是幻觉。这种方法是单次完成的,这意味着它几乎不会增加生成过程的时间,不像旧方法那样需要模型多次生成相同的答案以检查一致性。
然而,这项研究也揭示了一个令人惊讶且重要的局限性:这种内部冲突信号并非对所有模型都是通用的真理。研究人员发现,对于某些模型,高冲突得分能可靠地预测错误,但对于另一些模型,该信号则微弱甚至具有误导性。例如,在一个流行的 70 亿参数模型上,冲突得分在预测错误方面的表现甚至比随机猜测还要差;而在另一个同规模的模型上,它却是强有力的故障指标。这种不一致性意味着,仅仅在任何 AI 系统上安装这个工具是不够的;你必须首先验证它是否适用于你的特定模型。为了解决这个问题,团队创建了一个名为“ScopeGate”的安全检查机制。这是一个简单的测试,通过运行一组已知的正确和错误答案,来观察冲突得分是否真的与特定模型的错误相关联。如果测试失败,该工具就不会作为独立的警报使用,但它仍然可以用来理解模型为何陷入困境。
研究结果表明,这些模型的思考方式会随着它们针对人类对话进行的微调而发生变化。当模型经过微调以变得更具帮助性并遵循指令时,它们的表面置信度作为警告信号的可靠性往往会降低,但内部冲突信号却保持强劲甚至变得更加敏锐。这使得该方法对于用于实际应用的最先进的指令微调模型尤其具有价值。研究人员还展示了这种方法可以检测复杂的多步推理任务中的错误,在这些任务中,模型必须将事实串联起来,它能捕捉到内部逻辑开始崩溃的瞬间。
最终,这项工作将焦点从最终输出转向了创作过程。它证明了通往答案的路径与答案本身同样重要。通过绘制流经网络每一层的带符号证据图,研究人员提供了一种实时观察模型内部分歧的方法。虽然该方法在未经预先检查的情况下并不完美适用于所有模型,但它提供了一种可以立即部署的、无需训练的强大工具。它允许开发者精确观察模型为何以及在哪里与自身作斗争,将人工智能这种不透明的过程转变为可以被观察、测量和理解的对象。核心启示在于:仅有信心是不够的;我们还必须寻找机器内部那沉默的共识或冲突的噪音。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。