Mixture-of-Expert Blocks Contain Strong Hallucination Detection Signals
本文介绍了 InnerExpert,一种新颖的逐 token 幻觉检测方法,该方法利用混合专家(MoE)架构中独特的内部信号——例如路由熵和专家分歧——在仅需单次前向传播的情况下,在多个数据集上实现了卓越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型是新一代人工智能背后的引擎,它们能够撰写文章、解决问题,并进行感觉非常接近人类的对话。然而,在这种流利度之下隐藏着一个持久的缺陷:这些机器有时会极其自信地编造事实。这种被称为“幻觉”的现象,是指模型生成了听起来合情合理但完全错误的内容。虽然这些错误在日常闲聊中通常无伤大雅,但当模型被用于医疗建议、法律研究或新闻报道时,就会变得十分危险。科学家的核心挑战不仅是在事后发现这些谎言,而是要在它们发生的那一刻将其捕捉到,理想情况下,甚至要识别出真相开始瓦解的确切词汇。
多年来,研究人员一直试图通过让模型重复回答多次,或者检查不同版本的叙述是否一致来解决这个问题。这些方法有效,但速度慢且成本高,因为计算机需要重复执行相同的任务多次,仅仅为了寻找一个错误。一种更新的方法则是观察模型在思考时的“大脑”内部,寻找其内部计算中细微的不确定性迹象。然而,大多数此类内部检查仅限于标准模型。一种不同且更强大的架构——被称为“混合专家模型”(Mixture-of-Experts)——最近变得流行起来,因为它更快且更高效。这种设计就像一个专家团队,由一个中央管理者决定在生成每个单词时应该调用哪位特定的专家。直到现在,这些内部团队动态产生的信号在捕捉谎言方面很大程度上仍被忽视了。
在一项新的研究中,来自葡萄牙的研究人员开发了一种名为 InnerExpert 的方法,终于将这些内部团队信号投入了实际应用。InnerExpert 不再要求模型重复自身,也不再等待句子结束才检查错误,而是实时观察模型的内部路由过程。当模型生成响应时,一个微小的路由器会决定哪个“专家”网络应该处理当前的单词。研究人员发现,当模型即将产生幻觉时,这个路由器会表现出困惑的迹象。专家们可能会产生分歧,或者路由器可能会在为任务选择最合适的专家时感到挣扎。通过追踪这些犹豫和分歧的时刻,结合关于模型如何聚焦注意力的标准信号,InnerExpert 可以在生成每一个单词的同时为其分配一个置信度分数。
该团队使用一种巧妙的自动化方法训练了他们的系统。他们向模型输入了数千个问题,并让一个单独的高能力人工智能充当裁判,对哪些答案是真实的、哪些是编造的进行标注。这使得他们能够教会 InnerExpert 识别导致幻觉发生的特定内部信号模式,而无需任何人工去手动阅读和纠正数据。一旦训练完成,该系统就会作为一个轻量级的检测器,与主模型并行运行,仅需单次数据传递即可产生结果。它不需要减慢模型的速度,也不需要要求它生成额外的文本。
在五个不同的数据集和两种不同类型的模型上进行测试时,InnerExpert 证明了其卓越的有效性。它成功识别了幻觉答案,在句子层面的准确率高达 0.91,在单个单词层面的准确率达到 0.76。这些数字代表了对现有方法的显著改进,因为现有方法往往难以精确定位谎言开始的位置。该系统表现出了良好的泛化能力,即使在处理模型原始训练后发生的事件(这是幻觉最频繁发生的场景)时,依然表现强劲。至关重要的是,它在实现如此高水平检测的同时,仅增加了极小的计算成本,使其在现实世界中使用具有实用性。
研究还表明,没有任何单一的内部团队信号足以独立捕捉所有的谎言。某些信号在检测某一类模型时效果更好,而另一些信号在另一类模型上则表现更佳。InnerExpert 的真正力量来自于将所有这些不同的信号——路由器困惑、专家分歧和使用模式——整合为一个统一的分数。这种结合使得系统能够比任何单一指标都更清晰地观察到模型的置信度。研究人员证明,通过倾听模型专家内部的“嘈杂声”,他们可以以一种此前在不降低系统速度的情况下无法实现的精度来检测不确定性。
这项工作表明,通往更可靠人工智能的路径可能并不需要构建更大的模型或更复杂的验证系统。相反,它可能在于更加关注那些模型已经在产生但却被忽略的信号。通过学习解读模型内部决策过程中细微的犹豫迹象,我们可以构建出能够知道自己何时在猜测、何时在确定的系统。研究人员指出,虽然他们的方法非常有效,但它并非完美的解决方案,未来的工作需要探索这些技术在不同语言和更多样化任务中的适用性。不过,目前来看,这项研究提供了一种清晰且高效的方法,能在幻觉发生的瞬间将其捕捉,为使人工智能的输出更加值得信赖提供了一个实用的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。