← 最新论文
💻 computer science

Precision, Physics, and Confabulation: Softmax Temperature as an Analog of Dopaminergic Precision-Weighting in LLM Hallucination

这项初步研究提出了计算精神病学中多巴胺介导的精度加权与大语言模型中 Softmax 温度之间的正式数学类比,发现虽然在无根据条件下降低温度会增加幻觉的置信度(减少对冲),但并不影响有根据情况下的准确性,然而研究结果在统计学上仍缺乏足够效力,无法明确证实这一理论联系。

原作者: Kunal Dhanda

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Kunal Dhanda

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:精准度、物理学与虚构(Confabulation)

问题陈述
大型语言模型(LLMs)经常产生“幻觉”——即以与正确答案相同的流畅、自信的语气陈述捏造的事实。这一现象反映了计算精神病学中描述的一种核心特征:异常精度加权(aberrant precision-weighting)。在自由能原理(Free Energy Principle)和预测编码框架下,感知是一个贝叶斯推理过程,大脑将先验信念(prior beliefs)与感觉证据(sensory evidence)相结合,并根据它们各自的精度(即方差的倒数)进行加权。精神病理学理论认为,当多巴胺为先验或噪声分配了过高的精度,而非分配给感觉证据时,就会导致自信但错误的推理(即幻觉)。

虽然这两个领域的数学机制是完全一致的——LLM 的 Softmax 温度 (TT) 即贝叶斯推理中精度参数的倒数——但此前尚无研究直接测试通过操纵 LLM 中的 TT 是否能重现计算精神病学所预测的异常精度加权的定性特征。具体而言:低温度(高精度)是否会导致 LLM 生成自信但缺乏依据的虚构内容,而高温度(低精度)是否会产生更诚实、带有对冲(hedged)色彩的错误?

方法论
作者使用 LLaMA 3.2 (3B) 对由 25 个医学问题和 5,025 份源自先前 MedRAG 研究的文档组成的固定语料库进行了初步研究(pilot study)。实验设计操纵了两个变量:

  1. 条件(Condition): “基础”(Base,非锚定)条件,仅依赖参数化先验;以及“RAG”(检索增强生成)条件,其中模型被锚定在检索到的证据中(充当“感觉证据”项)。
  2. 温度 (TT): 测试了三种采样温度:T=0.0T=0.0(近乎确定性/高精度)、T=0.7T=0.7(标准/中等精度)以及 T=1.3T=1.3(弥散/低精度)。

研究共评估了 150 种组合(3 个温度×2 个条件×25 个问题3 \text{ 个温度} \times 2 \text{ 个条件} \times 25 \text{ 个问题})。

  • 准确率(Accuracy): 使用基于金标准关键词的准则进行衡量,并采用 95% Wilson 分数置信区间。
  • 置信特征(对冲/Hedging): 对于错误的回答,作者统计了一个包含 15 个单词的固定对冲词汇表(例如:“可能”、“或许”、“暗示”、“不确定”)的出现次数。
  • 统计分析: 使用非参数 Mann-Whitney U 检验来比较不同温度组之间对于正确和错误回答的对冲词计数差异。

核心贡献

  1. 形式对应关系: 本文明确映射了计算精神病学中的多巴胺精度加权、统计力学中的逆温度以及 LLM 中 Softmax 温度参数之间的关系,确立了 precision1/Tprecision \propto 1/T
  2. 操作化假设: 它将这种数学对应关系转化为一个可测试的假设:即在非锚定条件下,低温度应诱发“自信的虚构”(低对冲),而这种效应应通过检索锚定(RAG)得到缓解。
  3. 试点数据的诚实报告: 作者区分了精确的数学对应关系与生物学主张,并在报告结果时使用了适当的局限性说明,涵盖了统计效能和样本量的问题。

结果

  • H1(RAG 消除了温度敏感性): 在**基础(非锚定)**条件下,准确率随温度呈现非单调变化(T=0.0T=0.0 时为 0.72,T=0.7T=0.7 时为 0.64,T=1.3T=1.3 时为 0.68),尽管置信区间显著重叠。相比之下,**RAG(锚定)**条件下的准确率在所有温度下均完美稳定在 1.000。这支持了理论预测,即高精度的证据(检索)会覆盖先验精度的影响。
  • H2(自信虚构特征): 在基础条件下,错误回答在 T=0.0T=0.0 时包含的对冲词显著较少(均值 = 0.14),而在 T=0.7/1.3T=0.7/1.3 时则较多(均值 = 0.89)。这代表在高温度下对冲现象增加了六倍。然而,由于 T=0.0T=0.0 时错误回答的样本量较小(n=7n=7),该差异未达到统计学显著性p=0.16p=0.16)。
  • H3(特异性控制): 当将相同的分析应用于正确回答时,未发现温度与对冲之间的关系(p=0.90p=0.90)。这种解离表明,该效应是针对错误生成(幻觉)的特异性表现,而非模型的通用风格转变。

意义与主张
本文结论指出,虽然该初步研究在形式上效能不足,无法正式证实异常精度解释,但观察到的模式在定性上与该理论一致

  • 数学对应关系(Softmax 温度与多巴胺精度)是精确的。
  • 预测的定性模式(低温度下的自信虚构,高温度下的诚实不确定性)特异性地出现在错误回答中,且在正确回答中并不存在。
  • RAG 结果提供了一个强有力的证明,即锚定作用作为一种高精度证据项,无论模型的内部精度设置如何,都能稳定准确率。

作者明确表示,他们并非声称 LLM 拥有生物学上的多巴胺或在机制上实现了贝叶斯推理。相反,他们提出共享的数学框架为理解幻觉提供了一个精确且可测试的框架。这项工作的核心价值在于识别了特定的、可证伪的预测,并强调了进行更大规模、具有足够统计效能的研究的必要性,以区分“证据精度覆盖先验精度”与 RAG 基准测试中的简单天花板效应。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →