← 最新论文
💬 NLP

High Accuracy, Less Talk (HALT): Reliable LLMs through Capability-Aligned Finetuning

本文提出了 HALT 方法,通过构建能力对齐的微调数据(将回答拆解为事实片段并剔除或标记不确定的错误内容),使大语言模型能够根据置信度选择性地生成内容,从而在保持部分回答完整性的同时显著提升回答的准确性并减少幻觉。

原作者: Tim Franzmeyer, Archie Sravankumar, Lijuan Liu, Yuning Mao, Rui Hou, Sinong Wang, Jakob N. Foerster, Luke Zettlemoyer, Madian Khabsa

发布于 2026-02-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Tim Franzmeyer, Archie Sravankumar, Lijuan Liu, Yuning Mao, Rui Hou, Sinong Wang, Jakob N. Foerster, Luke Zettlemoyer, Madian Khabsa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为 HALT(High Accuracy, Less Talk,即“高准确率,少废话”)的新方法,旨在解决大型语言模型(LLM)最头疼的问题:幻觉(胡说八道)。

简单来说,现在的 AI 就像是一个过于热心的导游:不管游客问什么,它都恨不得把知道的、猜的、甚至瞎编的都一股脑讲出来。如果它不知道答案,它也会假装知道,编造一个听起来很像真的故事。这在写诗时很可爱,但在看病、写代码或处理法律问题时,这种“不懂装懂”是致命的。

HALT 的核心思想是:让 AI 学会“知之为知之,不知为不知”,并且只说它真正有把握的话

下面我用几个生活中的比喻来解释它是如何工作的:

1. 核心比喻:从“全能演说家”到“谨慎的专家”

  • 传统的 AI(Standard Finetuning):就像一个刚毕业、急于表现的大学生。你问他任何问题,他都会滔滔不绝地回答。如果问题很难,他可能会编造一些细节来填补空白,结果就是“看起来很像那么回事,但全是错的”。
  • HALT 训练后的 AI:就像一个经验丰富的老专家。他非常清楚自己的知识边界。
    • 如果你问他一个他完全不懂的领域,他会直接说:“这部分我不确定,我不敢乱说。”
    • 如果你问一个复杂问题,他只会回答他100% 确定的那几部分,剩下的部分他会停下来,告诉你:“到这里我就不确定了(Unsure from here)”,而不是继续编造。

2. HALT 是怎么“教”AI 学会闭嘴的?(训练过程)

HALT 并不是给 AI 灌输新知识,而是教它如何正确地使用自己已有的知识。这个过程就像给 AI 做了一次“体检”和“剪辑”:

  • 第一步:试错(生成初稿)
    让 AI 先像往常一样回答问题,写出一篇完整的文章或解题步骤。
  • 第二步:切片(拆解内容)
    把这篇回答像切香肠一样,切成一个个独立的“事实片段”或“推理步骤”。
    • 例子:在写人物传记时,切分成“奥巴马是第 45 任总统”、“奥巴马有一只狗叫 Bo"等独立句子。
    • 例子:在解数学题时,切分成“列出公式”、“代入数值”、“计算结果”等步骤。
  • 第三步:找茬(评估对错)
    请一个更强大的“考官 AI"(或者人类专家),拿着标准答案,逐一检查这些“切片”。
    • 如果切片是对的,打勾 ✅。
    • 如果切片是错的,打叉 ❌。
  • 第四步:剪辑(生成训练数据)
    这是最关键的一步!
    • 对于独立的事实(如传记):直接把打叉的“坏切片”剪掉,只保留打勾的“好切片”。
    • 对于连续的逻辑(如数学题):一旦发现第一步错了,后面的所有步骤都不可信。于是,从第一个错误开始,把后面所有的内容都剪掉,并在最后贴上一张标签:“此处存疑,我不确定”
  • 第五步:重新学习
    用这些经过“剪辑”和“打标签”后的完美数据,重新训练 AI。
    • 结果:AI 学会了,如果我不确定,我就不要强行输出,而是停下来或者承认不知道

3. 一个生动的场景:解数学题

想象你在问 AI 一道很难的数学题:

  • 普通 AI

    “首先,我们要用这个公式...(算对了)。然后代入数字...(算错了)。最后得出答案是 42!其实这道题很难,但我算出来了。”
    (结果:前面是对的,后面全是瞎编的,用户以为全对,结果被误导。)

  • HALT AI

    “首先,我们要用这个公式...(算对了)。然后代入数字...(算对了)。
    Unsure from here(此处存疑,我不确定后续步骤)。”
    (结果:用户知道前两步是对的,但最后一步 AI 很诚实。用户可以选择自己算最后一步,或者去问别人,而不会被误导。)

4. 灵活的控制:在“多说”和“说对”之间做选择

HALT 还有一个很棒的特性,就像调节收音机的音量旋钮:

  • 调向“多说”:AI 会尝试回答更多,但可能会偶尔犯错(适合创意写作)。
  • 调向“说对”:AI 会变得非常保守,只说它 100% 确定的话,哪怕这意味着它回答的内容变少了(适合医疗、法律、编程)。

论文实验发现,通过调整这个“旋钮”,他们训练出了一个Llama3-70B 模型,在四个不同领域(写传记、做数学题、写代码、回答医学问题)的准确率从 51% 飙升到了 87%!虽然它回答的完整度(说了多少话)只有原来的 53%,但它说的每一句都是真话

5. 总结:为什么这很重要?

以前的 AI 总是试图“讨好”用户,不管懂不懂都要给个答案。
HALT 让 AI 学会了“诚实”

它不再是一个只会瞎编的“话痨”,而变成了一个可靠的合作伙伴。当你需要它帮忙处理重要事情时,你可以信任它说出来的每一个字;如果它停下来了,你就知道那里需要你自己多留个心眼,而不是盲目相信。

一句话总结:HALT 就是给 AI 装上了一个“刹车”和“诚实标签”,让它少说废话,多说真话,在关键时刻靠得住。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →