这篇文章介绍了一项非常酷的研究,它的目标是让 AI(大语言模型)不再只是“非黑即白”地回答问题,而是学会像人类一样,能够**“给出准确的概率”**。
我们可以用一个生活中的比喻来理解:
1. 现状:只会“拍脑袋”的 AI
想象你正在和一个不太靠谱的朋友聊天。你问他:“明天会下雨吗?”
现在的 AI 就像这个朋友,他要么斩钉截铁地说“一定会下”,要么干脆说“不会下”。他很难告诉你:“根据云层的厚度和风向,有 65% 的概率会下小雨。”
如果 AI 只能给出“是”或“否”,那么在处理复杂世界(比如医疗诊断、法律判断或天气预报)时,它就会显得非常笨拙且不专业。而且,现在的 AI 往往有一种“过度自信”的毛病——明明心里没底,却表现得像个专家。
2. 这篇论文做了什么?——“概率训练营”
这篇论文的研究人员给 AI 开办了一个专门的**“概率思维训练营”。他们不只是教 AI 背知识,而是教 AI 如何“评估不确定性”**。
他们用了三个绝招:
绝招一:找“资深导师”带教(合成数据生成)
由于人类很难给成千上万的问题都标上精确的概率(比如“这件事发生的概率是 0.73”),研究人员让一群“聪明”的 AI 先去模拟思考,并写出推理过程。然后,他们又请来了一位“超级裁判 AI”来检查这些推理过程写得好不好。通过这种“AI 教 AI”的方式,他们制造出了海量的、高质量的概率练习题。
绝招二:学会“精细化打分”(解码器回归)
以前的 AI 就像是在做“选择题”(选 A 或选 B),而这篇论文让 AI 开始做“填空题”。他们把 0 到 1 之间的概率切成了很多细小的“小格子”(比如 0.1, 0.11, 0.12...)。AI 不再只是选一个大概的数字,而是要精准地定位到那个细小的概率区间。这就像从“选个大概颜色”进化到了“精准调配油漆颜色”。
绝招三:学会“比较大小”(排序一致性训练)
除了直接给分,研究人员还教 AI 做“对比题”。比如问:“这件事发生的概率大,还是那件事发生的概率大?”通过这种对比练习,AI 的逻辑变得更加严密,不会出现“明明 A 比 B 更可能发生,却给 B 打了更高分”的低级错误。
3. 结果:AI 变得更像“老司机”了
经过训练,这个 AI 表现得非常出色:
- 它更懂“分寸”了: 在面对模糊不清的问题时,它能给出合理的概率,而不是瞎猜。
- 它更懂“人类逻辑”了: 研究发现,当人类对某件事意见分歧很大时,这个 AI 给出的概率分布也会变得很散;而当大家意见很统一时,它的预测也会很集中。这说明它开始理解人类世界的“复杂性”和“争议性”。
- 它能辅助“复杂决策”了: 在一些需要多步推理的任务中(比如像侦探破案一样的逻辑链条),这个 AI 能通过概率来传递信息,让整个推理过程变得更加科学。
总结一下
如果说以前的 AI 是一个**“只会说对错的复读机”,那么这篇论文的研究成果就是试图把 AI 培养成一个“懂得权衡利弊、能看清迷雾的精明分析师”**。
它不再仅仅告诉你“会”或“不会”,而是会告诉你:“根据目前的情况,这件事发生的胜算大约是 7 成,但你要留意那个 3 成的不确定因素。”这正是让 AI 进入现实世界、处理真实复杂问题的关键一步。
这是一篇发表于 COLM 2025 的论文《Always Tell Me The Odds: Fine-grained Conditional Probability Estimation》,以下是该论文的详细技术总结:
1. 问题定义 (Problem)
尽管大语言模型(LLMs)在确定性推理任务上表现出色,但在处理具有不确定性和模糊性的现实世界问题时,往往难以给出准确且校准良好的概率预测。现有方法存在以下局限性:
- 预测粗糙且有偏:LLM 的概率估计往往倾向于使用少数几个常见的离散数值(如 10%, 50%, 90%),缺乏细粒度。
- 校准度差:通过查看 Logits 或使用口头表达(Verbalized Confidence)的方法往往存在过度自信或校准失效的问题。
- 缺乏高质量数据:现有的概率标注数据集规模较小,且人类标注存在主观性和噪声。
该论文旨在解决如何让 LLM 实现细粒度(Fine-grained)且准确的条件概率估计 P(proposition∣context)。
2. 研究方法 (Methodology)
作者提出了一套完整的训练流水线,结合了合成数据生成、解码器回归训练以及排序一致性约束。
A. 合成数据创建 (Synthetic Data Creation)
为了克服人类标注数据的不足,作者利用 LLM 生成大规模伪标签:
- 推理增强提示 (Reasoning-Augmented Prompting):要求 LLM 在给出概率前先生成推理链(CoT),以提高估计的逻辑性。
- 基于一致性的过滤 (Agreement-Based Filtering):计算多个模型预测之间的差异(Discrepancy)。差异小的样本视为高质量;差异大的样本则交由“LLM-as-a-Judge”进行仲裁。
- LLM 裁判 (LLM-as-a-Judge):由更强大的模型对推理过程的质量进行评分,并根据评分结果将多个模型的概率估计聚合为一个分布。
B. 模型微调策略 (Model Fine-tuning)
作者放弃了传统的编码器(Encoder-based)回归模型,转而使用现代的**解码器(Decoder-based)**模型,并采用以下技术:
- 基于期望标签评分规则的回归 (Expected Label Scoring Rule):
- 将 [0,1] 区间划分为 N 个等宽的 Bin(桶),每个 Bin 对应一个特殊的 Token。
- 为了实现细粒度预测,将目标概率转化为高斯分布,再通过量化(Quantization)转化为离散的 Token 分布。
- 通过优化 Forward KL 散度,使模型预测的 Token 分布逼近目标分布,从而通过期望值计算出精确的标量概率。
- 混合监督学习 (Hybrid Supervision):
- 直接监督:使用人类标注数据和合成数据的分布进行训练。
- 排序一致性训练 (Rank Consistency Training):利用成对排序(Pairwise Ranking)标签,通过 Margin Loss 强制模型在处理不同实例时保持概率大小的逻辑一致性。
3. 核心贡献 (Key Contributions)
- 新颖的训练范式:提出了一种结合了“分布匹配(Distribution Match)”与“成对排序(Pairwise Ranking)”的混合训练方法,解决了解码器模型做回归任务时的精度问题。
- 高效的合成数据流水线:通过“推理-聚合-裁判”的机制,利用 LLM 的评估能力弥补了生成能力的不足,构建了高质量的概率训练集。
- 全面的评估框架:不仅评估模型与标签的对齐度(Intrinsic),还评估了概率排序的合理性(Comparison)以及在复杂结构化推理(Structural)中的表现。
4. 实验结果 (Results)
实验结果表明,该方法在多个维度上均显著优于现有基线(如 RoBERTa、Zero-shot GPT-4o、Logit Probing 等):
- 内在对齐 (Intrinsic):在 UNLI、GNLI 等数据集上的 Spearman 相关系数显著提升,证明了模型能准确捕捉概率数值。
- 比较能力 (Comparison):在 δ-NLI、HellaSwag 等任务中,模型在概率排序的准确率上表现优异。
- 结构化推理 (Structural):在 Maieutic Prompting 和 BIRD 框架下,该模型作为概率估计器,显著提升了复杂推理链条中的决策准确性。
- 人类一致性:模型生成的概率分布能够反映人类在面对模糊问题时的分歧(多峰分布),表现出类似人类的认知不确定性。
5. 研究意义 (Significance)
这项工作为 LLM 从“确定性逻辑推理”向“概率性认知推理”的跨越提供了重要的技术路径。通过将概率估计转化为一种受监督的、细粒度的解码任务,研究者可以构建更可靠的决策支持系统,使 LLM 能够更好地处理现实世界中充满不确定性的复杂信息。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。