← 最新论文
🤖 machine learning

KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning

本文提出了 KARL 框架,通过引入知识边界感知的奖励机制和两阶段强化学习策略,使大语言模型能够在不牺牲回答准确性的前提下,实现与自身知识边界动态对齐的自主拒答行为,从而有效缓解幻觉问题。

原作者: Cheng Gao, Cheng Huang, Kangyang Luo, Ziqing Qiao, Shuzheng Si, Huimin Chen, Chaojun Xiao, Maosong Sun

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Cheng Gao, Cheng Huang, Kangyang Luo, Ziqing Qiao, Shuzheng Si, Huimin Chen, Chaojun Xiao, Maosong Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇关于如何让大语言模型(LLM)变得“更诚实、更聪明”的研究论文。我将用一个生活中的例子来为你解释。

核心问题:大模型的“不懂装懂”症

想象一下,你正在参加一个知识竞赛。

  • 普通的大模型就像一个**“爱面子的学生”:哪怕题目他完全没听过,为了不让老师失望,他也会凭直觉胡编乱造一个听起来很有道理的答案。这就是所谓的“幻觉”(Hallucination)**。
  • 现有的改进方法就像是一个**“极度自卑的学生”**:为了绝对不出错,只要题目稍微有点难度,他就立刻举手说“我不知道”。虽然他没犯错,但他的得分(准确率)也变得极低,变成了一个“哑巴选手”。

现在的难题是:如何让学生既能答对该答的题,又能在真不会的时候优雅地承认“我不知道”?


论文的解决方案:KARL 框架

清华大学的研究团队提出了一个叫 KARL 的新方法。我们可以把它想象成一套**“分阶段的教练训练法”**。

第一步:神奇的“动态考官”(Knowledge-Boundary-Aware Reward)

传统的教练只会给两种分数:答对了给1分,答错了给0分。
但 KARL 训练了一个**“会看情况给分的智能考官”**。

这个考官非常聪明,他会观察学生在面对同一个问题时的**“状态”**:

  • 如果学生能答对(哪怕只对了一次): 考官会说:“看来这题你其实是会的,别偷懒,下次直接答对!”(鼓励准确率)
  • 如果学生无论怎么试都答不对: 考官会说:“这题确实超纲了,承认‘我不知道’才是高分行为!”(鼓励诚实)

比喻: 这就像一个教练,如果发现你其实能举起50公斤,他会逼你举起来;但如果你连10公斤都举不动,他会告诉你:“别硬撑,承认力气不够,我们去练基础,这才是对的。”

第二步:两阶段“进阶训练法”(Two-Stage Training Strategy)

为了防止学生还没学会走路就先学会了“闭嘴”,研究者设计了两个阶段:

  1. 第一阶段:知识大爆发(探索期)
    这个阶段的目标是**“扩充知识库”**。教练会给学生大量的题目,并告诉他:“哪怕你现在不会,也要拼命去试,去寻找正确答案的路径。”这个阶段不强调“不知道”,而是强调“尽可能答对”。

    • 目的: 确保学生先把脑子里的知识点练扎实,别还没学会知识就先学会了逃避。
  2. 第二阶段:边界校准(修养期)
    当学生知识储备丰富后,教练开始进行**“性格塑造”**。教练会观察那些学生即便努力了也依然答错的题目,然后温柔地告诉他:“对于这些题,你不需要再硬猜了,学会说‘我不知道’吧。”

    • 目的: 把那些“硬猜导致的错误”转化为“诚实的拒绝”,从而消除幻觉。

最终效果:一个“既博学又谦虚”的学霸

通过这种训练,大模型表现出了惊人的平衡感:

  • 不再乱说话: 面对不知道的问题,它能准确地闭嘴(幻觉率大幅下降)。
  • 依然很聪明: 它并没有因为学会了拒绝而变笨,反而因为第一阶段的强化,答题的准确率甚至还提高了。
  • 举一反三: 即使换了全新的领域(比如从常识题换到医学题),它也能保持这种“该答则答,不会则说”的良好素质。

总结

KARL 就像是给大模型装上了一个“知识边界感”的传感器。它让 AI 不再是一个“只会死记硬背的复读机”,也不是一个“只会逃避的胆小鬼”,而是一个真正知道自己“能做什么”和“不能做什么”的聪明助手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →