DeMTS: Denoising Trajectories as Multivariate Time Series for Hallucination Detection in Diffusion Language Models
该论文提出了 DeMTS,一种针对扩散大语言模型(Diffusion Large Language Models)的新型幻觉检测框架,该框架将去噪轨迹视为多元时间序列,以保留完整的标记步长结构信息,从而通过有效捕捉诸如不一致收敛和跨标记故障传播等复杂模式,超越了现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的世界中,新一代文本生成机器已经出现,它们不再沿用那种严格按顺序逐字书写的传统方式。相反,这些被称为“扩散大语言模型”(diffusion large language models)的模型通过一种迭代优化的过程来生成文本。想象一张模糊的图像逐渐变得清晰;类似地,这些模型从一段混乱、嘈杂的词语序列开始,通过一步步逐步清理,直到产生一个连贯的句子。虽然这种方法在速度和灵活性方面提供了独特的优势,但它也与其前身有着一个共同的关键缺陷:幻觉(hallucination)倾向。这并非指机器在做梦,而是事实核查的失败——模型生成了流畅且听起来充满自信的句子,但其中却包含完全错误或缺乏依据的信息。检测这些错误非常困难,因为最终的输出往往看起来完美无瑕,从而掩盖了在混乱的创作中间阶段所发生的错误。
长期以来,研究人员一直试图通过观察最终答案或检查模型在特定时刻的不确定性来捕捉这些错误。然而,一项新研究表明,这些方法往往会错过最关键的线索。问题在于,现有的检测工具往往会抹平模型生成文本时复杂的历史过程。它们要么只关注创作过程的时间线,要么只关注单个词汇,实际上丢弃了关于不确定性如何在时间与特定词汇形成过程中共同演变的丰富、二维图谱。通过压缩这些数据,它们失去了观察句子某一部分的错误如何波及并破坏其余部分,或者不同词汇是否在同一时间无法稳定在确定的真相上的能力。
为了解决这个问题,一个科学团队开发了一个名为 DeMTS 的新框架,该框架将句子的整个生成过程视为一种复杂的、多层级的信号,而非简单的步骤列表。研究人员并没有将模型的内部信号强行压缩进一条直线,而是组织数据以保留每个词与每个创作时刻之间的关系。他们意识到,句子中单词的原始位置并不足够稳定,无法进行可靠的追踪,因为同一个位置在不同的句子中可能具有不同的含义。为了解决这个问题,他们创建了一个系统,将模型中嘈ло、偏移的信号归类到稳定且一致的类别中。这就像是将一堆混乱、混合在一起的拼图碎片,根据其形状和颜色分拣到不同的、贴有标签的盒子中,而不是试图通过它们最初那混乱无序的顺序来进行追踪。
一旦形成了这些稳定的组,研究人员就应用了一种动态建模技术来观察这些组是如何相互作用并随时间变化的。他们发现,幻觉在这个过程中留下了独特的指纹。在真实的回答中,句子的各个部分往往会一起趋于稳定的状态。然而,在幻觉式的回答中,模型经常表现出“不一致收敛”(inconsistent convergence)的迹象,即某些词变得高度自信,而其他词则保持摇摆不定和不确定。此外,他们还观察到了“跨标记故障传播”(cross-token fault propagation),即一个不稳定或错误的词会导致相邻的词偏离真相,从而产生一种在句子中蔓延的错误连锁反应。通过追踪这些特定的不稳定性和相互作用模式,这个新系统可以在谎言被完全说出口之前就将其识别出来。
研究人员在两个不同的语言大模型以及三个涵盖从常识到复杂推理任务的不同问答数据集上测试了这种方法。结果显示,这种新方法显著优于现有技术,能够以更高的准确度成功识别虚假信息。至关重要的是,该系统保持了高效和稳健,证明了它可以将其发现推广到新的问题类型,而无需针对每个特定主题进行重新训练。这项研究表明,通过尊重这些模型思考的完整二维结构——即同时保留时间线和词汇关系——我们可以构建更强大的保障机制,以应对困扰现代人工智能的那些微妙且看似自信的错误。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。