Where Abstention Lives: A Pre-Registered Four-Way Comparison of Abstention Interfaces in a Small Language Model with Versioned Memory
这项预注册研究表明,在具有版本化记忆的小型语言模型中,通过一个独立的二元头来实现弃权,通过将决策与生成 Softmax 解耦,显著优于词表标记和记忆槽,从而使得即使在准确率增益有限的情况下,说“我不知道”的能力也是可学习的。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,人们日益认识到,计算机犯下的最危险错误并非不知道答案,而是不知道自己不知道。当语言模型被问及一个它无法回答的问题时,它往往会编造一个听起来颇为合理的谎言,研究人员将这种现象称为“幻觉”。为了防止这种情况,科学家们尝试教给这些系统一项新技能:说出“我不知道”的能力。这不仅仅是编程一个简单的停止标志;这是在教机器识别自身知识的边界,并学会选择沉默而非捏造。挑战在于机器如何做出那个选择。决定保持沉默应该是一个添加到其词表中的特殊词汇,是一个控制面板上的独立开关,还是其内部记忆中的一条隐藏笔记?多年来,这些不同的方法一直被孤立地进行测试,导致从业者缺乏关于哪种方法真正最有效的明确指导。
一位名叫 Maximiliano Speranza 的研究人员试图通过进行一项受控实验来解决这个问题,在该实验中,除了决策本身的位置外,所有变量都保持不变。他从头构建了一个小型语言模型,参数量不足一百万,并教会了它一组事实,随后这些事实被更新和修正,从而创造了一个模型有时知道答案、有时不知道答案的情景。目标是观察四种处理“我不知道”的主要方式中,哪一种能让模型最有效地学习这项技能。结果揭示了一个明显的胜出者,以及其他方法失败的一个令人惊讶的原因。
实验测试了四种截然不同的方法。第一种是在模型的词表中添加一个特殊的标记(token),即一个像“IDK”这样的独特单词,允许它在不确定时直接说出这个词。第二种是添加一个独立的二进制头(binary head),这是一个微小的、专门的输出通道,其唯一任务是决定是回答还是保持沉默。第三种是重新归一化该特殊词的向量,这是一种旨在修复模型对该词权重分配可能存在失衡问题的技术调整。第四种是在模型的记忆中添加一个特殊的槽位(slot),一个专门用于存储“此处无内容”概念的地方。
研究结果是决定性的。独立的二进制头被证明是最有效的方法。在三次不同的训练运行中,这种方法将误报率(即模型在实际知道答案时却保持沉默的情况)降低了两到三倍,相比于词汇标记法。更重要的是,这种方法允许模型即使在尚未完美掌握事实的情况下,也能学会保持沉默的技能。使用独立的二进制头,一个准确率仅比完美水平低约 10% 的模型仍然可以被教会保持沉默。其他方法,包括特殊词汇单词和记忆槽位,在同样的条件下都未能教会模型这种自律。
这项研究还拆解了一个关于词汇标记法为何失败的流行理论。最初提出“我不知道”标记的创造者曾暗示,该方法在小型模型中失败是因为分配给该词的数值太弱或初始化得不好。Speranza 通过显式地调整该词的强度使其与其他词相匹配来测试这一点,如果该理论成立,这种修复理应奏效。但事实并非如此。问题不在于单词的强度,而在于模型被迫使用同一个机制来做出两种截然不同的决策——选择事实还是选择沉默。当这两个竞争的目标被迫共享同一个决策空间时,模型就很难学会何时保持沉默。
记忆槽位的方法提供了一个特别具有启发性的失败案例。模型被赋予了在记忆中存储“无答案”概念的特定位置,但它完全忽略了这个槽位。模型并没有学会识别何时问题没有答案,而是简单地学习了问题没有答案时的统计平均值。它意识到大约有 40% 的时间没有答案,因此无论实际问题是什么,它都会对“无答案”槽位分配一个恒定的、低水平的注意力。由于这种注意力水平从未上升到足以触发沉默的程度,模型从未真正停下来说“我不知道”。它学习的是概率,而非现实。
或许最令人警醒的发现是,模型知道自己不知道的能力并非取决于原始智能或容量,而是取决于校准。做出正确决策所需的信息存在于模型的内部信号中,但模型不知道如何在没有特定监督引导的情况下使用它。当研究人员尝试在没有任何标签或直接反馈的情况下教模型识别自身的不确定性时,它完全失败了。模型会将答案锚定在它存储的一段真实信息上,即便这段信息对于当前问题是错误的,这使得它无法区分自信的猜测与真实的实事。
这项工作并不声称已经解决了所有系统中人工智能幻觉的问题。实验是在一个词汇量有限的极小型模型上进行的,结果可能无法直接推广到当今使用的庞大且复杂的系统。然而,这项研究为特定的架构问题提供了一个清晰且审慎的答案:如果你希望小型语言模型学会何时保持沉默,那么给它一个独立的、专门的开关来进行决策,要远优于要求它使用一个特殊词汇或记忆槽位。教训是,决策的位置至关重要,有时,最优雅的解决方案仅仅是给机器一个专门的地方来说“我不知道”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。