Fixing Abstention with Token Probability: A Budget-Matched Causal Test Across Four Small Open-Weight Models
本文表明,用预算匹配的标记概率弃权策略取代口头化的置信度,能够因果性地消除在 llama3.2:1b 模型中观察到的特定精度下降效应,但未能将此益处推广至其他小型开源权重模型,这表明此类修复具有模型特异性,且即使在改进了针对性之后,固定预算的弃权行为仍可能产生净负面影响。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,研究人员不断教导计算机程序如何回答问题。但一个关键的挑战仍然存在:如何让程序知道自己不知道答案。当人类不确定时,他们可以说“我不知道”。这种退步的行为被称为“弃权”(abstention),它通常被视为一种安全特性,可以防止机器进行盲目猜测并传播错误信息。然而,最近的研究发现了一些这些系统中的奇怪故障。在特定的开源程序家族中,当被要求承认不确定性时,其中最微小、最轻量级的模型有时表现得甚至不如它们在被迫每次都进行猜测时那样好。似乎要求这些模型谈论自身的置信度会触发一种崩溃,导致它们在试图谨慎处理的问题上丧了准确性。
这项新研究深入探讨了这种崩溃,以观察是否可以修复它。研究人员关注了四个小型、开源权重的模型——这些人工智能版本足够紧凑,可以在标准计算机上运行,但仍具备复杂的推理能力。他们此前观察到,当最小的模型被提示如果在感到不确定时说“我不知道”时,其在医学和精神病学问题上的准确率显著下降。团队怀疑问题不在于弃权行为本身,而在于用于决定何时弃权的方法。该模型被要求将其置信度口头表达出来,而这一信号被证明在统计学上是毫无用处的,本质上并不比抛硬币好多少。与此同时,模型生成每个词时所使用的内部数学逻辑,即“标记概率”(token probability),是判断其答案是否正确的更强有力的指标。那么问题就在于,将决策过程从模型的口头置信度切换到其内部数学逻辑,是否能阻止准确率的下降。
为了找到答案,研究人员并没有进行任何新的实验或要求模型生成新的文本。相反,他们对三个先前研究中收集的数据进行了仔细的重新分析。他们提取了现有关于模型如何回答问题的记录,并比较了两种不同的决定何时跳过答案的方法。第一种方法是原始的方法:只有当模型口头表示不确定时,才会跳过答案。第二种方法是一种新策略:如果模型的内部数学逻辑显示正确概率较低,则跳过答案。至关重要的是,研究人员调整了第二种方法,使其跳过的答案数量与第一种方法完全相同。这确保了结果的任何差异都是由于“跳过了哪些问题”,而不是由于“跳过了多少个问题”。
结果对于最小的模型来说是惊人的。当研究人员用内部概率检查取代口头置信度检查时,严重的准确率下降消失了。在旧方法下,模型的准确率下降了七个百分点,这是一个显著的损失。在处理新方法下,这种下降缩减到了几乎为零,这种变化在统计学上与没有影响是无法区分的。这一修复在通用医学问题和精神病学场景中均保持了一致性。它证实了最初的失败确实是由模型无法准确报告其自身置信度引起的,而使用其内部数学逻辑作为引导成功地纠正了这一错误。
然而,研究也揭示了这种解决方案并非万能药。当研究人员将同样的修复应用于该组中的另一个模型(该模型同样遭受了口头置信度问题的困扰)时,结果却不同。这个模型拥有所有测试模型中最好的内部数学信号,但应用新策略后,其准确率仍然显著下降。研究人员发现,这个模型最初说“我不知道”的频率要高得多。因为它跳过了太多的问题,所以它在丢弃错误答案的同时,也丢弃了大量的正确答案。尽管其内部数学逻辑擅长分类答案,但跳过项目的总量实在太高,以至于无法产生益处。这表明,对于已经非常准确的模型,仅仅改变决定跳过什么的信号是不够的;跳过项目的数量可能需要被减少。
研究结论指出,虽然通过内部数学逻辑而非口头置信度来引导跳过决策是针对特定失败的强大修复手段,但它并不是一种一劳永逸的解决方案。对于最小的模型,这一改变是一次彻底的挽救,将一个有害的指令转变为一个中性的指令。对于较大的、更准确的模型,问题不在于信号,而在于跳过项目的预算。这些发现强调,在人工智能领域,不存在一种适用于所有系统的单一安全补丁。每个模型都需要其特定的验证,以了解其如何处理不确定性,并且对一个系统有效的修正方法,对于另一个系统可能并不适用。研究人员提醒,这些结果是基于特定的数据集得出的,应被视为进一步研究的假设而非最终的部署指令,但它们提供了一个清晰的因果证明,即修复通信渠道有时可以修复结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。