On the Effect of Uncertainty on Layer-wise Inference Dynamics
本文通过在多个模型和数据集上利用 Tuned Lens 分析,证明了确定性预测与不确定性预测的逐层推理动态在很大程度上是趋同的,从而挑战了简单不确定性检测方法的可行性,并暗示更胜一筹的模型可能会以不同的方式处理不确定性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,大型语言模型(LLM)就像一座巨大的多层工厂。当你向它提问时,“原材料”(你的话语)从底层进入,并穿过许多不同的楼层(层/layers)向上移动。在每一层,一个团队都会对答案进行精炼,将其传递给下一层团队,直到顶层的最终产品准备就绪。
这篇论文提出了一个简单但至关重要的问题:当模型对答案不确定时,工厂会改变其工作流程吗?
如果工厂非常确定答案,它是否会快速通过这些楼层?如果它在猜测并感到不确定,它是否会放慢速度、反复检查工作,或者在特定的楼层上花费更多时间以确保谨慎?
以下是研究人员利用一种被称为 “调优透镜”(Tined Lens) 的特殊“X射线照相机”,在窥探工厂运作过程时发现的内容:
1. “X射线”照相机(调优透镜)
通常,我们只能看到工厂产出的最终答案。而“调优透镜”就像一台神奇的相机,让研究人员能够捕捉每一层“在制品”的快照。它向我们展示了在旅程的每一步中,工人们的信心程度如何。
2. 主要发现:“直达电梯”
研究人员观察了两类问题:
- “确定的事”: 模型回答正确的题目。
- “猜测”: 模型回答错误的题目(研究人员将其视为模型“不确定”或缺乏知识的情况)。
令人惊讶的是: 工厂对这两类问题的表现几乎完全一样!
- 冲向顶峰: 无论模型是确定还是不确定,在前几层的信心度都保持在较低水平。然后,突然间,对于这两类问题,信心度都在完全相同的楼层像火箭一样飙升。
- 决策点: 模型似乎在特定的楼层做出最终决定,无论它实际上是知道答案,还是仅仅在瞎猜。它似乎不会说:“噢,我不确定,让我再往上走三层多思考一下。”无论如何,它都在同一时间做出决定。
比喻: 想象一个正在考试的学生。你可能会预期,如果他们知道答案,他们会立即写下来;如果他们在猜测,你可能会预期他们会盯着试卷,擦掉、重写,并思考很长时间。
这篇论文表明,对于这些人工智能模型来说,更像是有一个学生遵守着严格的规则:“无论如何,我都会在草稿纸的第15行写下我的答案。”无论他们是有信心还是毫无头绪,他们都会坚持在同一行。
3. 细微差别:“专家”与“新手”
研究人员还检查了更聪明、更有能力的模型(“专家”)是否表现得与能力较弱的模型(“新手”)有所不同。
- 发现: 有一丝微弱的迹象表明,“专家”模型可能会表现出略微不同的行为。当专家模型不确定时,它在做出决定之前有时会等待稍长一点的时间,相比于它确定时的表现。
- 症结所在: 这种效应非常微弱,且仅在最强大的模型中显现。对于大多数模型,“直达电梯”规则仍然适用:无论是否确定,它们都在同一时间做出决定。
为什么这很重要(根据论文观点)
论文得出结论,我们不能仅仅通过观察 AI 如何逐层处理信息,就依赖简单的技巧来检测它何时在产生“幻觉”(编造事实)。由于“不确定”的 AI 在处理信息时的路径与“确定”的 AI 几乎一致,因此我们无法通过观察其内部速度或决策时机来轻易区分它们。
为了在模型不确定时抓住它,我们需要更复杂、更微妙的方法来观察它的思维过程,而不仅仅是检查它是否采取了“更长的路径”来获取答案。
简而言之: 这个 AI 工厂有一个非常僵化的时间表。无论它是在陈述事实还是在瞎猜,它都会在同一时间决定要说什么。当它感到困惑时,它似乎并不会放慢速度去思考得更深入。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。