Never the Number: Structural Abstention for AI Systems Whose Answers Are Consumed as Fact
本文提出了“结构化弃权”(structural abstention),这是一种为人工智能系统设计的架构模式,通过将生成式外壳与确定性内核分离,以确保无法回答或存在歧义的请求被明确拒绝而非产生幻觉,从而保证企业级及智能体部署中的事实可靠性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
信任陷阱:当 AI 表现得过于圆滑时
想象一下,你正在向一个非常聪明、非常健谈的机器人寻求作业帮助。你问:“我们的太阳系中有多少颗行星?”机器人立即回答道:“有九颗行星,包括冥王星!”它听起来信心十足,语法完美,语气友好。但你知道冥王星不再是一颗行星了。问题不在于机器人很笨,而在于它太擅长表现得“像那么回事”了。在人工智能(特别是大语言模型,LLM)的世界里,这是一个危险的陷阱。这些模型非常擅长预测下一个词应该是什么,但它们并不擅长做数学或核实事实。当它们出错时,它们不会说“我不知道”,而是会编造一个“幻觉”——一个听起来如此流利且自信的虚假答案,让你可能会信以为真。
对于依赖数据的企业和工具来说,这是一个巨大的问题。如果一个机器人告诉店经理:“我们卖出了 500 件商品,”但实际数字是 400,经理可能会基于这个谎言做出错误的决策。可怕之处在于,这个谎言看起来和真相一模一样。仅凭阅读句子,你无法分辨其中的区别。科学家和工程师一直试图通过让机器人变得更聪明或更谨慎来解决这个问题,但本文认为,真正的解决方案不是让机器人更擅长“猜测”,而是让机器人根本不要去“猜测”数字。
绝不猜数:“可信内核”解决方案
本文介绍了一种构建处理数据(如销售报告或医院床位统计)的 AI 系统的巧妙新方法。作者称这种方法为**“结构化弃权”(Structural Abstention)**。这是一种高级的说法,意思就是:“如果你不能 100% 确定数学计算是否正确,那就干脆不要尝试去做。”
为了理解这是如何运作的,请想象一个高端餐厅的厨房。
- 生成式外壳(服务员): 这是系统的友好、健谈的部分。它与你交流,理解你混乱的问题,并弄清楚你到底想要什么。如果你说:“我想知道上周关于‘红色东西’的情况,”服务员会将此转化为具体的订单:“客户想要上周‘红苹果’的销售数据。”服务员可以具有创造性,可以犯错,也可以要求澄清。如果服务员弄错了订单,你只需纠正他们,不会造成任何损害。
- 确定性内核(厨师): 这是系统的严格、遵循规则的部分。厨师绝不猜测。厨师只烹饪预先批准菜单上的菜肴。如果顾客要求的不是菜单上的内容(比如“月球上的红苹果”),厨师不会尝试发明食谱。厨师只会简单地说:“我无法制作该项内容。”然后,厨师使用计算器(数据库)进行精确计算并将结果记录下来。
这个系统的神奇规则是**“边界不变性”(Perimeter Invariant)**。它规定:系统中可以胡编乱造的部分(服务员)可以决定询问什么问题,但它绝不能决定答案是什么。 答案必须始终来自那个遵循固定食谱的严格厨师。
现实生活中的运作方式
作者用一个被销售经理使用了两年的真实系统测试了这个想法。以下是他们使用的步骤:
- 你提问: 一位经理问道:“上周二 Riverton 店卖出了多少部手机?”
- 服务员(外壳)倾听: AI 进行倾听。它可能不知道“Riverton”是指什么,或者“上周二”是否是公司日历中的有效日期。于是,它会询问:“您是指 Riverton 店,还是 Riverton 地区?以及您指的是财政周吗?”
- 确认: 一旦 AI 认为自己理解了,它不会直接吐出一个数字。它会说:“好的,我即将计算:财政周为 1 月 20 日期间的 Riverton 店手机销量。这正确吗?”
- 你说“是”: 你阅读这句话。如果正确,你就说“是”。
- 厨师(内核)计算: 只有在你说“是”之后,系统才会运行一段严格的、预先写好的计算机代码来获取数字。它不进行猜测,只是查找数据并进行累加。
- 结果: 系统给出数字。因为“厨师”从未猜测,所以你知道这个数字是真实的。
当 AI 卡住时会发生什么?
如果你问了一个系统无法处理的问题——比如“我们目前还不存在的商店卖出了多少销售额?”——“服务员”会意识到“厨师”没有对应的食谱。与其编造一个虚假的数字,系统会停止并说:“我无法回答这个问题。以下是我可以回答的三个问题。”
这就是所谓的**“结构化弃权”**。系统拒绝回答,因为它无法在其实际的严格规则中体现该请求。这不同于其他试图通过猜测置信度分数(例如“我有 80% 的把握”)来决定是否回答的 AI 方法。这个系统不需要猜测;它仅仅是因为如果问题不符合菜单,它就无法进行数学运算。
为什么这很重要
论文将这种“服务员与厨师”系统与另外两种类型的 AI 进行了比较:
- “端到端”模型: 这是一种试图独立完成所有工作的机器人。它倾听、猜测答案并编写代码。它速度快且涵盖话题广,但一旦出错,它会进行圆滑的谎言。你无法分辨正确答案与错误答案的区别。
- “工具型”智能体: 这是一种使用工具寻找答案的机器人。它更好一些,但仍可能在选择使用哪个工具或如何组合结果时感到困惑。
作者发现,对于商业决策,这种“服务员与厨师”系统是最安全的。尽管它能回答的问题较少(它的菜单较小),但它给出的答案是值得信赖的。论文指出,在为期两年的测试中,他们构建了一个“内核优先”的系统,该系统非常可靠,最终产生了足够的数据来训练更聪明的 AI。即便如此,他们在处理最终数字时依然保留了严格的规则。
局限性
这种系统并不适合所有人。如果你是一名正在探索全新数据集并希望提出各种天马行空、富有创造性问题的科学家,这个系统可能会让你觉得过于死板。它会经常说“我无法做到”。但在一个错误的数字可能会导致公司损失金钱或伤害病人的情况下,论文认为,能够说出“我不知道”比能够说出“这里有一个听起来很真实的假数字”要好得多。
简而言之,论文建议,对于关键数据,我们不应该试图让 AI 在猜测数字方面变得更聪明。相反,我们应该构建这样的系统:AI 仅被允许提出问题,而一个严格的、缺乏创造力的机器才是唯一被允许进行数学计算的对象。这是一种权衡:你得到的答案变少了,但你得到的答案是真相。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。