← 最新论文
💻 computer science

A Risk-Oriented Verification and Validation Framework for Hallucination Detection in Public-Sector LLM Systems

本文提出了一种面向风险的验证与确认框架,通过引入一个用于指导延迟处理或人工升级等操作决策的综合风险指数,将公共部门大语言模型中的幻觉检测从一个纯粹的技术挑战转变为一个治理问题,从而确保法律确定性与行政问责制。

原作者: Nguyen Binh

发布于 2026-07-10✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Nguyen Binh

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位超级聪明、速度极快的机器人助手,来帮助你的市政府回答有关法律、税收以及如何获取驾照的问题。这个机器人由大语言模型(LLM)驱动,非常擅长表现得自信且书写流畅。但问题在于,它有时会编造事实。它可能会发明一条虚假的法律,命名一个不存在的政府部门,或者给出一个并不真实的截止日期。在技术领域,我们称之为“幻觉”(hallucination)。

在私人领域,如果机器人给了你一个错误的电影推荐,这只是令人恼火;但在公共部门,如果机器人告诉你要向错误的机构提交税务表格,或者引用了一条不存在的法律,这可能会毁掉你的生活、浪费你的金钱,甚至让政府陷入法律纠纷。

旧方法的问题
大多数研究人员一直试图通过观察机器人的“大脑”内部来解决这个问题。他们试图让机器人“思考”得更深入,重新训练它,或者检查它是否会给出两次相同的答案(自一致性)。本文认为,这种方法就像是在试图通过摇晃一个黑盒来修理它。在现实世界中,政府通常使用的是无法看到内部结构的机器人(黑盒 API),并且无法对其进行重新训练。此外,机器人可能会表现得极其自信,并始终给出同一个错误的答案,从而骗过“摇晃两次”的测试。

新思路:基于风险的安全网
与其试图让机器人变得完美(作者认为目前这还不可能),不如采用另一种方法:将幻觉视为一种治理风险,类似于我们检查防火安全或数据安全的方式。

作者建议了一种新的框架,它就像是俱乐部里的一位聪明的保镖,专门负责把关政府的回答。其工作原理如下:

1. 五点清单(基于槽位的分解)
想象一下,机器人的回答不仅仅是一大块文本。该框架将回答分解为五个特定的“槽位”或类别,就像飞行的检查单一样:

  • 所需文件: 我需要哪些材料?
  • 主管机关: 谁是正确的联系对象?
  • 处理时限: 需要多长时间?
  • 费用: 需要多少钱?
  • 法律依据: 什么法律规定了这一点?

该框架会对每个类别分别进行检查。关于邮票价格的一个错误可能只是令人烦恼,但关于“适用哪项法律”的错误则是一场灾难。

2. 三个危险信号
对于每个类别,系统都会运行三个快速检查,以查看机器人是否正在产生幻觉:

  • “声音摇摆”测试(跨样本不稳定性): 系统向机器人提出同一个问题五次。如果机器人在“法律依据”方面给出了五个不同的答案,说明它在“摇摆”。这是一个红旗信号。
  • “出示收据”测试(引用覆盖率): 机器人是否指向了一个真实、官方的文件来支持其主张?如果它说“根据法律 X”,但数据库中并不存在法律 X,那么得分就是零。
  • “规则手册”测试(基于规则的验证): 答案是否违反了基本规则?例如,如果机器人说截止日期是“下周二”,但法律规定截止日期必须以“工作日”计算;或者它指出的市长并没有签署该文件的权力。

3. 幻觉风险指数 (HRI)
系统将这三个测试结合起来,形成一个名为“幻觉风险指数”(HRI)的分数。你可以把它想象成电子游戏中的“危险度计”。

  • 低分 (< 0.20): 答案是安全的。通过。 机器人可以直接将答案发送给你。
  • 中分 (0.20 至 0.35): 答案有些摇摆。警告。 机器人发送答案,但会加上一个巨大的警告标签:“嘿,请核实此部分内容!”
  • 高分 (0.35 至 0.50): 答案具有风险。推迟。 机器人会拦截答案。在人工检查之前,它不会发布任何正式内容。
  • 极高分 (≥ 0.50): 答案非常危险。路由。 机器人立即停止操作,并将整个问题转交给人类工作人员。不允许有任何机器人回答。

关键安全覆盖规则
作者非常谨慎地指出,分数并不是一切。他们建议了特定的“覆盖规则”,这些规则充当了紧急制动器。例如,如果机器人编造了法律依据(虚假法律),那么无论分数是多少——系统必须立即将其路由给人类。这可以防止系统被一个自信地犯错的机器人所误导。

该框架并非用于什么
重要的是要理解本文并未声称什么。

  • 并未声称发明了一种阻止机器人撒谎的新方法。它并没有修复机器人的大脑。
  • 并未声称已在数百万个真实案例中进行了测试。所呈现的结果是基于模拟场景和说明性示例,而非大规模数据集。
  • 并未表示这适用于能够看图或听声的机器人(多模态)。它仅专注于文本。

核心结论
作者提议,与其追求一个“完美的”机器人这一不可能实现的梦想,政府应该建立一个能在机器人犯错前将其拦截的安全系统。通过将回答分解为微小的部分、对照规则进行检查,并使用风险评分来决定何时呼叫人工,该框架提供了一种负责任地使用这些强大工具的方法。它将问题从“机器人是否正确?”转变为“这个答案是否足够安全可以发送?”

这种方法被建议作为将 AI 融入严谨、规则导向的政府环境的一种方式,确保即使机器人产生幻觉,系统也能在造成法律噩梦之前将其拦截。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →