ScaleCal: Scale-Aware Confidence Calibration for Small Language Models
ScaleCal 是一个无需训练的框架,它通过将基于温度校准的逻辑值信号与选择性语义一致性采样相结合,解决了小语言模型中置信度信号退化的问题,在显著改善校准误差和失效检测的同时,保持了较低的计算成本。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,新一代紧凑型模型已经涌现,它们旨在运行于智能手机和笔记本电脑等日常设备上,而非依赖于庞大且耗能的数据中心。这些小型语言模型功能强大,足以回答问题、解决数学题并撰写文本,但它们面临着一个关键的局限性:它们往往不知道自己错了。与那些有时可以由更大型系统提供支持的大型模型不同,这些小型模型通常是孤军奋战。如果一个小型模型自信地给出了错误答案,它误导用户的方式与人类专家一样容易,但其危险之处在于,用户根本无法得知那个答案其实只是一个猜测。为了使这些工具在现实世界中安全使用,研究人员需要一种方法来衡量模型的确定性,并且至关重要的是,要有一种方法能让模型在不确定时说出“我不知道”。
挑战在于这些模型如何表达信心。检查答案是否良好的标准方法在小型模型上往往会失效。一种常见技术是观察模型认为其自身词汇的概率有多高,但在小型模型上,这种信号变得不可靠,即使在回答毫无意义的内容时,听起来也显得非常有把握。另一种方法是要求模型多次生成相同的答案,以观察其是否保持一致,但这对于在小型设备上运行来说通常过于缓慢且成本过高。科学家们核心的问题在于,是否存在一种方法,既能获得这种缓慢、昂贵方法的可靠性,又不必支付其全部代价,特别是针对这些微小且高效的模型。
一位研究人员开发了一种名为 ScaleCal 的解决方案,该方法允许小型语言模型知道何时该停止并进行更深入的思考。这一方法建立在一个关于速度与准确性之间权衡的简单观察之上。研究人员发现,对于极小的模型,那种快速、廉心中检查信心的做法是失效的;它太具噪声,难以信任。然而,更昂贵的检查方式——要求模型生成多次答案并观察结果是否一致——仍然是可靠的,而且令人惊讶的是,对于这些小型模型来说,这种方式实际上是负担得起的,因为它们本身运行速度就很快。ScaleCal 扮演了一个智能门卫的角色。它首先要求模型给出一个快速答案和一个快速置信度评分。如果评分很高,系统会立即接受该答案。如果评分很低(表明存在不确定性),系统则会触发第二步,即让模型多生成几次答案,以检查其一致性。这种两步走的过程确保了系统仅在真正必要时才支付额外的成本。
研究人员在八种不同的小型语言模型上测试了这种方法,涵盖了从拥有 0.5 亿参数的极小模型到拥有 70 亿参数的较大模型,并使用了包括通用知识、数学和真实性测试在内的四种不同类型的基准测试。他们发现,如果没有这种新方法,小型模型会表现出危险的过度自信。当被要求评估自身的确定性时,一个微型模型经常声称对一个实际错误率仅为 45% 的答案有 95% 的把握。新系统将最小模型中的这种校准误差减少了近一半。更重要的是,它显著提高了系统检测自身失败的能力。在以识别错误答案为目标的测试中,该方法将检测率从接近随机猜测提升到了高度可靠的水平,使得模型能够在可能出错时选择放弃回答。
该方法的效率是一个关键发现。由于小型模型的运行速度很快,额外的生成多次答案的成本仅发生在极少数问题上。平均而言,该系统处理每个问题所消耗的计算量相当于大约三次半次的模型运行,这仅为运行一次大型、功能更强大的 70 亿参数模型所付出的成本的一小部分。对于测试过的最小模型,这种方法在计算能力方面的成本仅为运行单次 70 亿参数大型模型的四分之一左右,同时仍能达到类似的可靠水平。研究人员发现,随着模型规模变大,这种额外检查的需求也会随之减少,这符合逻辑,因为较大的模型天生就更擅长判断自身的信心。
这项工作为在个人设备上部署人工智能提供了一条切实可行的路径。通过结合快速检查与针对性的深度检查,该方法为小型模型提供了一种此前缺失的安全机制。研究人员证实,该方法无需重新训练模型或添加额外的软件组件即可实现,它仅仅是调整了对模型现有输出的解释方式以及何时要求其重试。其结果是一个不仅准确,而且对其局限性保持诚实的系统,能够退后一步并承认不确定性,而不是自信地提供一个错误的答案。这种在速度、成本与可靠性之间的平衡表明,只要配备了知道何时收敛的方法,小型语言模型就可以在边缘设备上胜任关键任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。