想象一下,你有一个非常聪明但有时过于自信的机器人助手。当你向它提出一个高难度的数学问题时,它通常会立即给出答案。但有时,它只是在猜测,却并未意识到这一点。这被称为“幻觉”,如果你需要答案百分之百正确,这种情况就非常危险。
这篇论文介绍了一种名为NoisyCoconut的新技巧。它是一种让机器人变得更可靠的方法,而无需重新训练它或教它新东西。你可以把它想象成一个发生在机器人“大脑”内部、而非其口头表达中的“第二意见”系统。
以下是其工作原理,使用简单的类比来说明:
1. 问题:机器人的“自信”是个谎言
通常,当机器人回答问题时,它会选择下一个最可能出现的词。但仅仅因为它对自己选择的词语很有信心,并不意味着其逻辑是正确的。这就像一个人说话非常流畅自信,但实际上却在编造故事。论文指出,我们需要一种方法来了解机器人何时真正不确定。
2. 解决方案:“如果……会怎样?”游戏
NoisyCoconut 不是让机器人只回答一次,而是让它五次回答同一个问题,但有一个转折。
- 转折(噪声注入): 在机器人开始进行这五次尝试中的每一次思考之前,研究人员会给它的内部“大脑”(即其隐藏状态)施加一个微小、受控的扰动。想象一下你正在解一道谜题。如果你轻微晃动桌子,你的手可能会稍微移动,你可能会尝试一种略有不同的解题方法。
- 结果: 由于这些微小的扰动,机器人会生成五条略有不同的“思维路径”。这就像让同一个人的五个不同版本去解这道谜题,每个版本都有略微不同的视角。
3. 魔法:寻找共识
现在,研究人员查看机器人给出的五个答案:
- 情景 A(一致): 机器人的五个版本得出了完全相同的答案。
- 比喻: 这就像你请五位不同的专家解决一个数学问题,他们都在各自的纸上写下了"42"。你可以非常有信心地认为"42"是正确的。
- 情景 B(分歧): 三个说"42",一个说"43",一个说"100"。
- 比喻: 专家们正在争论。这告诉你机器人很困惑,或者这个问题目前对它来说太难了。
4. 安全网:“弃权”
这是最重要的一部分。NoisyCoconut 有一条规则:如果五个版本意见不一致,机器人就保持沉默。
- 它不会给出错误的答案,而是说“我不知道”。
- 论文表明,当机器人因为五个版本达成一致而开口时,它在数学问题上的正确率高达95%。
- 如果没有这个技巧,机器人的正确率可能只有 60%–70%,但它会回答所有问题,包括那些错误的猜测。
5. 为何这很特别
- 无需重新训练: 你不需要教机器人任何新东西。你只需要在它工作时暂时改变它的思考方式。
- 内部与外部: 其他大多数方法要求机器人与自己对话,或生成许多不同的句子,以查看哪个最好。NoisyCoconut 则在机器人开始说话之前,扰动其内部的大脑状态。这就像在粉刷墙壁之前先检查建筑物的地基。
- 权衡: 机器人回答的问题会变少(覆盖率降低),因为它在不确定的时候会保持沉默。但它确实回答的问题要准确得多。
总结
NoisyCoconut 就像机器人大脑的质量控制检查员。它迫使机器人通过五个略有不同的“镜头”来运行同一个问题。如果所有五个镜头都显示出相同的画面,机器人就会自信地给出答案。如果画面模糊或不同,机器人就会承认自己不确定并拒绝猜测。这使得机器人在重要场合中更加安全,尽管它总体上回答的问题更少。
技术摘要:NoisyCoconut——基于潜在空间推理的反事实共识
问题陈述
大型语言模型(LLMs)正越来越多地被部署于高风险环境中,但它们缺乏内在机制来信号化不确定性,往往产生自信但错误的输出(幻觉)。虽然选择性预测(即允许模型在不确定时放弃回答)是提高分类任务可靠性的成熟策略,但将其应用于生成式大语言模型却十分困难。Token 级别的概率往往反映的是语言不确定性而非事实正确性,而现有的推理时方法(例如通过 Token 采样的自一致性)仅限于表面 Token 分布中已有的多样性。此外,直接在连续隐藏状态上运作的潜在空间推理方法通常需要专门的训练,且缺乏内置的置信度估计机制。
方法论
本文介绍了NoisyCoconut,这是一种无需训练、在推理时通过操纵连续潜在空间中的内部表示来增强大语言模型可靠性的方法。该方法建立在**连续思维链(Continuous Chain-of-Thought, Coconut)**框架(Hao 等人,2025)之上,该框架通过将最后一个隐藏状态反馈作为下一个输入嵌入来实现推理;而 NoisyCoconut 的不同之处在于,它专注于置信度评估,而非训练模型在潜在空间中进行推理。
其核心机制涉及向预训练模型的潜在轨迹中注入受控噪声:
- 噪声注入:对于给定的输入查询,该方法通过在正向传播过程中向隐藏状态注入独立的高斯噪声(ηt),生成多条推理路径(K条)。噪声尺度 σt 随时间步呈指数衰减,并根据隐藏状态范数进行自适应缩放,以确保产生有意义的发散同时保持连贯性。
- 路径探索:这种扰动促使在连续表示空间内分支出替代性的推理轨迹,从而在不生成中间 Token 的情况下有效探索解空间的不同区域。
- 聚合与放弃:对 K 条路径的输出进行聚合。系统采用多数投票策略来确定共识输出。关键在于,如果路径间的一致性低于特定阈值(例如,要求 5/5 的全票一致),系统可以放弃(记为 ⊥)。
- 置信度信号:受噪声扰动路径之间的一致程度可作为预测置信度的代理指标。高度一致表明模型处于稳定的“吸引子盆地”中,解对扰动具有鲁棒性;而低度一致则表明表示不稳定且不确定性高。
主要贡献
作者做出了四项主要贡献:
- NoisyCoconut 框架:一种新颖的、无需训练的推理时方法,通过在连续潜在空间中注入受控噪声来生成多样化的推理路径,从而直接在隐藏状态上实现基于共识的置信度估计。
- 路径一致性的验证:实证表明,路径一致性为预测置信度提供了可靠的代理指标,能够实现有效的覆盖率与准确率之间的权衡。
- 噪声 - 准确率关系的表征:分析显示,随着噪声尺度的增加,模型准确率呈现一致的 S 形(sigmoid)下降模式,证实了噪声注入在不同架构上产生可预测且可利用的效果。
- 基准测试性能:证据表明,NoisyCoconut 在三个推理基准(GSM8K、GSM-Symbolic、MMLU)和五种不同语言模型(包括 Qwen、Llama、Mixtral 和 DeepSeek 变体)上实现了显著的覆盖率 - 准确率权衡,且无需访问训练数据或修改参数。
结果
在五种语言模型和三个基准上进行的实验得出以下发现:
- 误差降低:受噪声扰动路径间的全票一致(5/5)将错误率从 40–70% 的基线降低至 15% 以下。
- 通过放弃实现高准确率:通过选择性地放弃低置信度预测(即路径一致性低的情况),模型在数学推理任务(如 GSM8K)上实现了超过95% 的准确率。例如,DeepSeek-R1-Distill-Qwen-7B 模型在全票一致阈值下,准确率从 62.0% 的基线提升至 95.2%,尽管覆盖率有所降低(31.4%)。
- 均衡效应:较弱的基线模型在高一致性过滤下表现出最大的绝对准确率提升,这表明 NoisyCoconut 可以帮助较弱模型在那些表现出高置信度的问题子集上,接近更强模型的可靠性。
- 噪声敏感性:系统性评估显示,随着噪声尺度增加,准确率呈现一致的 S 形衰减,所有模型的拟合 R2≥0.94,表明模型行为存在从稳健推理到近乎随机表现的相变。
意义与主张
本文主张,NoisyCoconut 提供了一条实用途径,可在无需重新训练或微调的计算成本下提升大语言模型的可靠性。通过将基于共识的置信度估计扩展到潜在空间,该方法利用连续表示空间来揭示在 Token 级别分布中不可见的不确定性。
作者认为,路径一致性与正确性之间的相关性表明,大语言模型的不确定性在潜在空间中是可见的。当噪声扰动导致路径发散时,模型可能正在表示不稳定的区域运行;反之,收敛到相同答案则表明存在对扰动具有鲁棒性的稳定解。这种方法使得大语言模型能够在对准确性和可审计性至关重要的受监管领域部署,提供了一种以覆盖率为代价换取高置信度准确率的机制。
本文承认了局限性,包括需要访问模型内部状态(限制了其在开放权重模型上的适用性)、目前专注于具有离散或明确定义答案的任务,以及生成多条路径带来的计算开销。然而,文章将这些视为未来工作的机会,包括自适应噪声缩放、针对开放式生成的语义聚合,以及与推测解码集成以降低成本。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。