← 最新论文
🤖 AI

Neural Diversity Regularizes Hallucinations in Language Models

本文引入了“神经多样性”作为语言模型的第三个缩放维度,提出了 ND-LoRA 方法,通过去相关并行表示和 Barlow Twins 正则化将幻觉减少高达 25.6%,同时建立了将较低的神经相关性与更高的可靠性联系起来的正式界限。

原作者: Kushal Chakrabarti, Nirmal Balachundhar

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Kushal Chakrabarti, Nirmal Balachundhar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解开一个棘手的谜题,但你不是只问一个人,而是问了一整个团队。如果团队中的每个人想得都完全一样,他们可能会一起犯下同样的愚蠢错误,并同时给你错误的答案。这就是现代“语言模型”的核心问题——那些能写故事、回答问题并与我们聊天的超级智能计算机程序。尽管这些程序变得越来越庞大、越来越聪明,但它们有时仍会编造内容,这种故障被称为“幻觉”。它们可能会自信地陈述一个虚假的事实,或者编造一个从未发生过的故事。

为了解决这个问题,科学家通常试图让模型变得更大,或者喂给它们更多的数据,就像试图通过买一个更大的拼图盒来解决拼图问题一样。但本文提出了一种不同的方法:与其把团队做大,不如让团队成员变得“不同”。作者借鉴了金融领域的一个概念,叫做“多样化(多元化)”。正如投资者不会把所有的钱都投入到一只股票中,因为如果那只股票失败了,他们就会损失一切,而是将资金分散到许多不同的股票中。如果一只股票崩盘了,其他的可能依然稳健,从而保证投资组合的安全。这篇论文提出了一个问题:我们能否对计算机大脑也这样做?如果我们迫使模型的不同部分以略微不同、互不相关的方式进行思考,我们能否阻止它们在同一时间犯下同样的错误?

这正是研究人员想要测试的内容。他们提出了一种名为“神经多样性(Neural Diversity)”的新方法,它充当了计算机大脑的“多样性教练”。这种方法不再让模型的内部路径塌陷到以相同方式思考,而是迫使这些路径保持独特和独立。他们构建了一个名为 ND-LoRA 的工具来实现这一点。你可以把它想象成给一个单一的计算机模型同时戴上四顶不同的“帽子”。每顶帽子代表处理同一个句子的一种略有不同的方式。然后,模型会将这四顶帽子的答案结合起来。

结果非常令人振奋。通过使用这种“四顶帽子”的方法以及一种防止帽子变得过于相似的特殊数学技巧,研究人员发现,在特定测试中,他们可以将编造事实的数量减少高达 25.6%,平均提升了 14.6%。这是在不需要扩大模型规模或增加训练数据的情况下实现的。事实上,它只消耗了极少的计算能力——大约 0.008% 的额外训练时间,且运行速度仅为原来的 1.1 倍

然而,论文还发现了一个转折点:多样性并非总是越多越好。这就像一个合唱团;如果每个人都唱不同的音符,听起来就像噪音。如果每个人都唱完全相同的音符,则会显得乏味且容易出错。存在一个“甜点区(最佳平衡点)”,即声音既要足够不同以能捕捉到错误,又要足够相似以能对真相达成共识。研究人员发现,这个甜点区会根据计算机正在执行的任务而变化。对于涉及创意叙事或事实核查的任务,拥有更多“不同”的声音(具体为 4 到 8 个并行流)效果最好。但对于简单的记忆任务,比如回忆一个特定的名字,只有一个声音实际上是最可靠的。

作者谨慎地指出,虽然他们的数学证明了这“应该”有效,且他们在小型模型上的实验表明这“确实”有效,但这是一种针对特定类型错误的特定解决方案。他们认为,幻觉通常是由模型的内部组件陷入一个相似且错误的思维循环中引起的,而不仅仅是缺乏知识。通过用多样性打破这种循环,他们可以使模型更加可靠,而无需构建一个庞大且昂贵的超级计算机。这是一种巧妙且低成本的方法,让人工智能减少撒谎的可能性,证明了有时,获得更好答案的最佳方式是同时提出几个不同的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →