← 最新论文
💬 NLP

Target-Aware Calibration Data Selection for Preserving Uncertainty in Quantized Language Models

本文介绍了保留怀疑度量化(Doubt-Preserving Quantization, DPQ)框架,该框架根据特定的部署目标来选择校准数据,以更好地保留量化语言模型中的置信度和弃权等不确定性行为,并证明了最优的数据选择取决于所期望的保留目标,而非遵循固定的配方。

原作者: Zhen Yang, Sizai Hou, Kaiwen Zheng, Yaofang Liu, Liang He, Yixuan Chen, Kangning Cui

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhen Yang, Sizai Hou, Kaiwen Zheng, Yaofang Liu, Liang He, Yixuan Chen, Kangning Cui

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是许多现代人工智能引擎背后的核心,它们能够生成文本、回答问题并解决曾经被认为机器无法完成的问题。为了在智能手机或笔记本电脑等日常设备上运行这些庞大的系统,工程师们经常使用一种称为“量化”的技术。这个过程通过简化模型用于思考的数字来缩小其内存占用,就像将一张高分辨率照片压缩成较小的文件大小以便更快加载一样。多年来,这种压缩技术的成功几乎完全取决于模型是否仍能得到正确的答案。如果一个曾经知道澳大利亚首都是堪培拉的模型在缩小后仍然回答堪培拉,那么它就被视为是成功的。然而,这种狭隘的关注忽略了这些模型运作的一个关键层面:它们的置信度。模型不仅会输出一个答案,还会计算它对该答案有多大的把握。这种内在的确定感对于安全性和可靠性至关重要,特别是当模型需要决定是否回答一个问题,或者是否应该承认自己不知道时。

来自包括耶鲁大学和牛津大学在内的研究机构的一个研究小组发现,缩小这些模型的标准方法往往会破坏这种内在的置信感,即使最终答案仍然正确。他们发现,虽然压缩后的模型可能仍然能选出正确的城市,但它可能会对自己的选择表现出极度的过度自信或奇怪的不确定性,这种转变可能会导致下游系统做出危险的错误。为了解决这个问题,研究人员开发了一种新方法,用于选择用于为模型压缩做准备的特定数据。他们的工作表明,并没有一套适用于所有情况的“完美”数据集。相反,必须根据用户需要保留的具体行为类型来仔细选择数据,无论是保留识别无法回答问题的能力,还是在广泛主题范围内保持答案的普遍可靠性。

问题的核心在于这些模型如何处理不确定性。在现实世界中,一个得力的助手应该知道何时保持沉默。如果用户提出了一个没有事实答案的问题,模型应该识别出其中的歧义并拒绝猜测,而不是自信地编造一个错误的事实。这种区分能够回答的问题与不能回答的问题的能力被称为“可回答性”(answerability)。研究人员观察到,标准的压缩技术往往会扰乱这一微妙的边界。面对一个它无法回答的问题,模型可能会看到一个问题,虽然完整版的模型会犹豫,但压缩版可能会突然对一个错误的答案表现出极高的信心。这是因为压缩过程引入了微小的误差并不断累积,将模型的内部评分推向了决定是否开口说话的阈值。

为了解决这个问题,研究人员并没有将训练数据的选择视为一个通用的步骤,而是将其视为一项有针对性的校准任务。他们意识到,不同的目标需要不同的数据。如果目标是保留模型检测无法回答问题的能力,那么用于准备模型的数据必须充满处于不确定性边缘的例子——即那些难以回答或模型自然感到不确定的问题。如果目标是在许多不同类型的问题中保持普遍的可靠性,那么数据则需要更加平衡,将这些困难的边缘案例与标准的、简单明了的例子混合在一起。研究人员在八个不同的语言模型和九个不同的基准测试中测试了这个想法,并将他们的方法与二十二种其他方法进行了比较。他们发现,当他们专门选择包含高度怀疑和不确定性的数据时,压缩后的模型在适当情况下表达“我不知道”的能力得到了显著提升。

研究还揭示了一个令人惊讶的权衡。用于保护识别无法回答问题能力的最优特定配方,与用于保护标准多项选择测试中普遍准确性的配方并不相同。一种侧重于处理困难、不确定案例的方法在保护模型的决策边界方面表现出色,确保它不会对不该回答的问题给出自信的回答。然而,对于期望回答大多数问题的更广泛任务,使用较温和的数据混合,或者仅仅是为了一般置信水平而选择的数据,表现则更好。这一发现挑战了长期以来认为存在一种单一、通用的模型压缩准备方法的假设。相反,研究人员表明,“最佳”数据完全取决于模型的实际用途。

研究人员引入了一个名为“保留怀疑量化”(Doubt-Preserving Quantization)的新框架来实践这一想法。该方法的工作流程是:首先要求原始的全尺寸模型对大量潜在问题进行评分。然后,识别出模型最不确定或前两个答案之间差异非常小的问题。这些“高怀疑”示例随后与标准的、通用的示例混合,以创建一个定制的数据集用于压缩过程。通过将这种定制的混合物输入到压缩算法中,生成的较小模型能够保留原始模型的细微置信感。研究表明,这种方法显著减少了通常困扰压缩模型的置信度误差,特别是在了解何时放弃回答至关重要的场景中。

这项工作表明,我们思考如何使人工智能变得更小、更快的方式正在发生根本性的转变。仅仅检查模型是否仍能得到正确答案是不够的;我们还必须确保它仍然知道自己对该答案有多大的把握。研究人员表明,通过仔细策划用于缩小这些模型的数据,我们可以保留那些使其安全可靠的行为。无论模型是一个需要拒绝对诊断进行猜测的谨慎医疗助手,还是一个可以回答各种问题的通用聊天机器人,用于准备它的数据都必须根据其特定的用途来选择。一刀切式的压缩时代已经结束;未来属于尊重任务本身特定不确定性的针对性校准。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →