← 最新论文
💬 NLP

Zero Hallucination, by Construction: Hallucination-Aware Layered Oversight for Trustworthy Enterprise AI

本文介绍了 HALO(幻觉感知分层监督),这是一种六层保障架构,它实现“零幻觉”并非通过消除大语言模型的固有局限性,而是通过实施一个由基于事实的生成、受限执行、多信号验证、校准式弃权、全流程溯源以及持续监督组成的系统级框架,从而将幻觉控制在一种可控的失效模式之中。

原作者: Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu

发布于 2026-07-21✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在建造一个极其擅长讲故事的机器人管家。这个机器人读遍了图书馆里几乎所有的书,并且能用完美、自信的句子进行表达。但有一个问题:有时当它不知道答案时,它不会说“我不知道”,而是编造一个听起来如此真实且具有说服力的故事,让你深信不疑。在人工智能的世界里,这被称为“幻觉”(hallucination)。这不是导致机器人崩溃的故障,而是一种机器人面不改色地撒谎的故障。

长期以来,试图将这些机器人用于严肃工作(例如帮助银行决定贷款或帮助医生核查保险理赔)的人们一直处于困境之中。他们曾希望只要让机器人变得更聪明,或者给它读更多的书,它就会停止编造事实。但你即将阅读的这篇论文表明,这种希望是一个死胡同。作者认为,制造一个永远不会撒谎的机器人是不可能的,因为这些机器人的构建方式决定了它们天生容易发明事实。因此,与其试图修复机器人的大脑,不如提议在其周围构建一个超级严格的“护栏”。这个护栏就像是一个由侦探、数学检查员和安全网组成的团队,共同协作,确保如果机器人真的开始撒谎,也不会有人看到这个谎言。目标不是制造一个完美的机器人,而是一个即使谎言发生,也不会在无人察觉的情况下溜进缝隙的系统。

问题所在:为什么“更好的机器人”并不是答案

来自 FlowX.AI 的论文作者首先指出了一项令人沮丧的现实。许多公司想要使用 AI 智能体,但他们非常害怕“幻觉”。这就是指 AI 给出了一个流畅、自信但完全错误的答案。在闲聊中,一个假事实只是让人烦恼;但在银行或保险公司,一个假事实可能意味着支付了不该支付的款项,或者提交了一份带有虚假数字的报告。

科技界的通常反应是等待一个“完美”的模型——一个聪明到永远不会产生幻觉的机器人。作者说这是一个错误的目标。他们认为,大型语言模型本质上就具备编造事物的能力。无论如何增加规模或提高智能,都无法完全消除这种能力。即使你增加一个“裁判”机器人来检查答案,那个裁判也可能被蒙蔽,或者因为它与第一个机器人拥有相同的盲点而认同对方的错误。

论文认为,我们不应该再问“我们如何构建一个不会撒谎的机器人?”,而应该开始问“我们如何构建一个让谎言在被发现之前无法到达用户的系统?”这与工程师设计汽车的逻辑相同:我们不期望汽车零件永远不损坏;我们设计汽车配备安全带、气囊和溃缩区,以便当零件确实损坏时,乘客依然安全。

解决方案:HALO(六层安全网)

为了解决这个问题,作者提出了一种名为 HALO(幻觉感知分层监督,Hallucination-Aware Layered Oversight)的新架构。不要把 HALO 看作单一的工具,而要把它看作一个六层堡垒,旨在在每个阶段捕捉错误。作者声称,通过堆叠这些层级,他们可以将幻觉到达用户的速率降低到趋近于零,尽管由于底层机器人本身仍易出错,仍会存在微小的残留逃逸率。

以下是这六个层级是如何运作的,通过一个关于机器人尝试填写保险理赔单的简单故事来解释:

第 1 层:有据可查的图书馆(禁止记忆)
HALO 不允许机器人从自己的记忆中提取答案(在那里它可能会发明东西),而是强制它只能使用特定的、经过批准的文件库。如果机器人需要知道“理赔金额”,它必须在上传的 PDF 中找到这个数字。这就像告诉一名学生:“你只能使用桌上的教科书来回答测试题,不能使用你上周记得的内容。”这限制了机器人被允许说的话。

第 2 层:受限的迷宫(禁止游荡)
机器人不允许肆意妄为。它的行为被锁定在一个严格的、循序渐进的路径中(“状态机”)。它不能突然决定拨打一个随机电话或重写整个文档。如果它试图脱离剧本,系统就会阻止它。这确保了即使机器人感到困惑,它也不会造成巨大的混乱或泄露隐私数据。

第 3 层:侦探小队(多信号验证)
这是最重要的层级。当机器人写出一个答案时,它不仅仅得到一个来自单个裁判的“赞成”;它还会接受两种不同类型侦探的检查:

  1. AI 裁判: 另一个 AI 会检查该答案是否基于文本逻辑合理。
  2. 证据检查器: 这是一个不使用 AI 的特殊工具。它查看原始文档并进行严格的数学检查。例如,如果机器人说总额是 1,000 美元,证据检查器会亲自计算文档中的各项明细。如果数学对不上,机器人就会被抓到在撒谎,即便 AI 裁判认为它听起来很合理。这能捕捉到那些听起来很有道理但数学上错误的“自信的谎言”。

第 4 层:“我不知道”按钮(校准弃权)
如果机器人在图书馆中找不到答案,或者证据检查器指出数字不匹配,系统就不会让机器人猜测。相反,它会按下“弃权”按钮。机器人被迫说:“我没有足够的信息”,并将任务升级交给人类处理。让机器人说“我不知道”比让它自信地给出一个错误的答案要好得多。

第 5 层:黑匣子记录仪(全程可追溯)
机器人的每一步操作都会被详细记录在日志中。如果以后发生了错误,人类可以查看日志,了解阅读了哪个文档、提出了什么问题,以及为什么机器人做出了那个特定的选择。这使得系统具有透明度和可审计性,这对于法律和监管至关重要。

第 6 层:瞭望塔(持续监督)
系统不仅仅运行一次就结束了。它一直在自我监视。如果机器人的错误率随着时间推移而增加(即“漂移”),系统会立即检测到。然后,它会运行实验来修复问题,在将新规则投入实战前,先在小部分数据上进行测试。这确保了系统随时间推移而不断改进,并在问题演变成灾难前将其拦截。

证明:现实世界测试

为了证明其有效性,作者在一家名为“Meridian Insurance”的模拟保险公司上测试了 HALO。他们创建了一个机器人来阅读理赔文件并提取诸如“理赔金额”和“事故日期”之类的数字。

起初,机器人看起来表现尚可,但 HALO 系统发现了一个隐藏的问题:机器人在大约 28% 的时间里在产生幻觉(0.28 率),且准确率仅为 72%(0.72)。系统之所以能发现这一点,是因为“证据检查器”注意到机器人记录下的数字与原始文档中的数学计算并不匹配。

HALO 没有让机器人继续犯错,而是做了两件事:

  1. 即时遏制: 它阻止了错误答案进入下一步。任何机器人无法证明其答案正确性的文档都会被路由给人工进行审核。
  2. 自我修正: 系统自动生成了一个修复方案,进行了测试,并找到了一个表现更好的新版本机器人。新版本的幻觉率降至仅 8%(0.08),准确率提升至 88%(0.88)。

总结

论文得出结论,“零幻觉”并不是 AI 模型本身的属性。你无法买到一个永远不会撒谎的机器人。相反,“零幻觉”是围绕机器人构建的系统的属性。通过使用 HALO,企业可以构建一个护栏,既能捕捉谎言,又能迫使机器人承认其不确定性,并使其不断自我改进。虽然由于模型本身存在缺陷,仍会存在微小的残留逃逸率,但系统确保了幻觉在到达用户之前是被遏制、可观察且可纠正的。

作者承认这并非万能药。如果没有可以对照的来源文档(比如在要求创作一个创意故事时),系统的效力会减弱。此外,频繁说“我不知道”可能会让人感到厌烦。但对于像银行业和保险业这样严肃且受监管的工作,作者认为这种分层方法是建立信任的唯一途径。它将目标从“完善大脑”转向了“工程化安全网”,确保即使机器人失误,用户也永远不会看到它跌落。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →