← 最新论文
💬 NLP

Adaptive Conformal Prediction for Improving Factuality of Generations by Large Language Models

该论文提出了一种自适应共形预测方法,通过将共形分数转换扩展到大语言模型,实现了提示依赖的校准,在保持边际覆盖率保证的同时显著提升了长文本生成和多项选择题等任务的条件覆盖率及事实性。

原作者: Aleksandr Rubashevskii, Dzianis Piatrashyn, Preslav Nakov, Maxim Panov

发布于 2026-04-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Aleksandr Rubashevskii, Dzianis Piatrashyn, Preslav Nakov, Maxim Panov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文主要解决了一个大问题:大型语言模型(LLM,比如现在的各种 AI 聊天机器人)虽然很聪明,但经常“一本正经地胡说八道”(也就是产生幻觉)。

为了解决这个问题,作者提出了一种新的方法,叫做**“自适应共形预测”。为了让你更容易理解,我们可以把整个过程想象成“给 AI 的考试答案贴标签和筛选”**的过程。

1. 核心问题:AI 的“自信”不可靠

想象一下,你让 AI 做一份关于“历史发明”和“名人传记”的长篇文章。

  • 旧方法(传统的共形预测): 就像是一个死板的监考老师。他不管题目是难是易,也不管你写的是关于“复杂的量子物理”还是简单的“苹果是谁发明的”,他只用同一把尺子来衡量所有答案。
    • 后果: 对于简单的题目(比如名人传记),这把尺子太松了,导致很多错误答案也被放行了(覆盖不足,AI 还在胡说);对于复杂的题目(比如发明细节),这把尺子又太紧了,把很多正确答案也误杀了(覆盖过度,AI 不敢说话)。
    • 比喻: 就像给所有鞋子都穿同一码数的鞋。小脚的人(简单问题)觉得挤得慌,大脚的人(复杂问题)觉得脚在里面晃荡,都不舒服。

2. 新方案:自适应的“智能裁缝”

作者提出的**“自适应共形预测”,就像是一位经验丰富的智能裁缝**。

  • 怎么做? 这位裁缝会先看看你的“脚型”(也就是输入的问题类型、难度和上下文)。
    • 如果是“名人传记”这种简单题,裁缝会收紧标准,只留下最确定的答案。
    • 如果是“复杂发明”这种难题,裁缝会适当放宽标准,但依然保证核心事实是对的,避免因为太严格而把有用的信息都删掉。
  • 核心技术(简单说): 他们利用了一种叫“条件分位数回归”的技术。简单理解就是,AI 会先学习:“哦,原来遇到这种类型的问题,我的不确定性通常比较高;遇到那种类型,我通常比较准。”然后它会根据这个学习结果,动态调整筛选答案的门槛。

3. 具体流程:三步走

想象你在开一家**“事实核查工厂”**:

  1. 拆解零件(原子化):
    AI 生成的长文章,被拆解成一个个独立的“小事实”(比如“巴黎是法国首都”是一个事实,“巴黎建于公元前 3 世纪”是另一个事实)。
  2. 打分与初筛(不确定性评分):
    给每个小事实打个分。分数越低,代表 AI 越自信;分数越高,代表 AI 心里没底。
  3. 动态过滤(自适应门槛):
    • 旧方法: 设定一个固定的分数线(比如 0.8 分以下保留)。不管题目多难,都只认这个分。
    • 新方法: 先看看这道题属于哪个“类别”(比如是“医学”还是“文学”)。如果是“医学”这种高风险领域,门槛自动调高;如果是“文学”这种领域,门槛自动调整。
    • 结果: 最终留下的答案,既保证了整体的准确率(比如 90% 是对的),又保证了每一类问题(无论是医学还是文学)的准确率都接近 90%。

4. 为什么要这么做?(实际意义)

  • 防止“一刀切”: 在医疗、法律等高风险领域,AI 不能因为“整体平均”看起来不错,就放过某个具体的致命错误。新方法能确保在特定领域(比如“心脏病”)里,AI 的胡说八道率被严格控制在安全线以内。
  • 选择性回答: 如果 AI 发现某个问题的答案它实在没把握(不确定性太高),新方法会建议它**“闭嘴”或者“只回答确定的部分”**,而不是硬编一个答案。这就像医生在不确定病情时,会说“我需要进一步检查”,而不是乱开药。

5. 实验结果:真的有用吗?

作者用了好几种不同的 AI 模型(Mistral, Llama, Gemma)和不同的任务(写长文章、做选择题)来测试。

  • 结果: 就像论文里的图表显示的那样,旧方法在不同类别的题目上,准确率忽高忽低(有的太松,有的太紧)。而新方法(自适应) 让所有类别的准确率都稳稳地落在了目标线上,就像一位优秀的教练,让每个队员(不同类别的问题)都发挥出了最佳水平,而不是只照顾平均水平。

总结

这篇论文就像给 AI 装上了一个**“智能动态过滤器”。它不再用一把死板的尺子去衡量所有问题,而是根据问题的难易程度和类型**,灵活调整筛选标准。

一句话概括: 以前是“不管三七二十一,统一标准筛一遍”;现在是“看人下菜碟,具体问题具体分析”,让 AI 在保持高准确率的同时,少说废话,少犯错误,特别是在那些容易出错的复杂领域。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →