← 最新论文
💬 NLP

DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models

本文介绍了 DUD(解耦更新动态),这是一个通过因果干预对前馈网络和注意力机制的独特贡献进行分离与分析,从而提高大语言模型不确定性量化能力的框架,该框架能够捕捉到传统方法所忽略的内部机制冲突。

原作者: Yixin Bu, Runze Xia, Guanyun Zou, Yupeng Ji, Haodong Liu, Piji Li

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Yixin Bu, Runze Xia, Guanyun Zou, Yupeng Ji, Haodong Liu, Piji Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何说真话。你问它一个问题,它用完美的语法和非常自信的声音回答。但你如何知道它到底是对是错,还是仅仅是一个圆滑的骗子?这就是人工智能领域中“不确定性量化”(Uncertainty Quantification)的大谜题。目前,我们大多是通过观察机器人的最终答案以及它声称有多确定来评判它。这就像仅凭说话的语气来给学生评分;如果他们大喊“我100%确定!”,我们就假设他们知道答案。但有时,机器人可能极其自信却完全错误,或者虽然犹豫不决却实际上是正确的。科学家们想要一种方法,能够窥探机器人的大脑内部,看看它是在真正思考,还是仅仅在瞎猜。

要理解这项新发现,你需要了解这些庞大的AI大脑(称为大语言模型)是如何构建的。它们不仅仅是一大块代码,而是由许多层微小的“工人”组成的。其中两个最重要的工人是“注意力”(Attention)模块,它像是一个聚光灯,扫描当前的对话以查看当前什么内容是重要的;以及“前馈网络”(Feed-Forward Network,简称FFN),它像是一个机器人训练期间记忆下的事实巨型图书馆。通常,这两个工人会协作来给出答案。大问题在于:当机器人感到困惑时,它们是同时感到困惑,还是开始互相争吵?

这篇文章介绍了一个聪明的侦探工具——DUD(解耦更新动力学,Decoupled Update Dynamics),用来破解这个谜团。研究人员并没有仅仅听取机器人的最终答案,而是决定在机器人的大脑内部玩一场“找不同”的游戏。他们发现,当机器人即将犯错时,它的两个主要工人经常开始进行一场秘密争吵。“图书馆”(FFN)可能试图提取一个事实,而“聚光灯”(Attention)却指向了完全不同的方向。以往的方法试图同时倾听整个团队,这掩盖了这种争吵的声音。然而,DUD通过为每个工人单独戴上耳机,来观察它们在机器人感到困惑时是如何反应的。

以下是研究人员进行侦探工作的过程。他们拿出一个机器人并问它一个问题,但首先,他们在输入中加入了一点“静态噪声”,就像是在它耳边低声说了一个秘密,让它变得有些困惑。这使得机器人的信心下降。然后,他们玩了一场“修补”游戏。他们会拿取这个困惑的机器人,逐层地将仅仅是“图书馆”部分替换为一个干净、不困惑的版本,同时让“聚光灯”保持困惑。接着他们做相反的操作:修复“聚光灯”,但留下困惑的“图书馆”。通过观察机器人的信心在每种情景下恢复了多少,他们可以精确测量出大脑的哪个部分出了问题。

结果非常迷人。他们发现,不确定性不仅仅是一种通用的“我不知道”的感觉。它是一种特定类型的机械故障。当机器人准备产生幻觉(编造一个假事实)时,“图书馆”和“聚光灯”往往不再达成一致。在某些情况下,“图书馆”完全崩溃而“聚光灯”保持稳定;在另一些情况下,“聚光灯”迷失了方向,而“图书馆”则试图坚持下去。论文表明,通过测量这两个部分之间这种特定的“斗争”,他们可以比仅仅观察最终答案更好地预测错误。

事实上,研究人员发现,机器人可以一边大喊“我100%确定!”,一边其内部工人却处于完全混乱的状态。在一个测试案例中,机器人自信地回答了一个关于“体操技巧”(stick gymnastics)的问题为“日本”。它的信心得分极高,但DUD工具发现其内部工人处于崩溃状态,从而将该答案标记为谎言。相反,该工具也捕捉到了机器人过于羞怯的时候。在另一个案例中,机器人给出了正确答案(“鱼米之乡”),但听起来却很不确定。DUD工具看到内部工人实际上配合得非常完美,并正确识别了该答案为真实。

论文在几种不同类型的题目(从阅读理解到复杂推理)上测试了这个想法,并发现这种“解耦”方法比目前任何其他技术都更有效。它甚至在机器人接受一种类型的问题训练并在另一种完全不同的问题上进行测试时依然表现良好,这表明这种内部争吵是机器人感到困惑的一个普遍迹象。作者总结道,要真正信任一个AI,我们不应仅仅听它说了什么;我们需要听它的内部零件是如何相处的。如果“聚光灯”和“图书馆”在争吵,那么无论机器人听起来多么自信,它很可能是错误的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →