Descriptive versus Regulatory Uncertainty in Bounded Predictive Systems
本文认为,当前的 Transformer 架构本质上局限于“描述性不确定性”,因其令牌级熵值无论任务准确率如何均保持统计不变,从而无法驱动适应性行为,这证明真正的“调节性不确定性”需要认识论误差与热力学能量成本之间的物理耦合,而解耦的数字系统缺乏这种耦合。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗语言和日常类比对该论文的解读。
核心观点:一个不知道自己错了的智能机器人
想象一个非常先进的机器人,它能写故事、解决数学问题并回答问题。你问它一个难题,它用 100% 的自信回答。但如果它完全错了呢?
这篇论文指出,当前的 AI 模型(就像我们今天使用的这些)存在一个危险的缺陷:它们无法区分“知道答案”和“胡编乱造”。
作者 Ahmed Gamal Eldin 认为,这不仅仅是一个软件漏洞,而是一个根本性的物理问题。
“电费账单”类比
为了理解原因,让我们思考一下人脑是如何工作的,以及计算机是如何工作的。
- 人脑(调节性不确定性): 当你尝试解决一个难题时,你的大脑会工作得更努力。你会出汗,心率可能会上升,并且会消耗更多卡路里。如果你犯了错,你的大脑会感受到那个错误的“代价”。这种身体上的努力与你有多确定是相关联的。如果你是在胡乱猜测,你大脑消耗能量的方式与你确定无疑时是不同的。
- AI 计算机(描述性不确定性): 现在,想象一个回答问题的机器人。无论它是在解决一个它完全掌握的简单数学题,还是在以十足的自信胡编一个虚假事实,电费账单是完全一样的。
这篇论文将这种现象称为**“热力学解耦”**。
- 解耦: 能量成本(电力)与真相是脱节的。计算机说真话和说假话所消耗的电量是一样的。
- 结果: 因为计算机在犯错时并没有“支付”更多的能量,所以它没有任何物理理由去感到“不确定”。它只是继续运转,即使困惑时也依然自信。
实验:“直线”测试
作者使用三种不同规模的 AI 模型(小型、中型和巨型)进行了测试,并给它们布置了三种类型的任务:
- 简单内容(开普勒): 关于 AI 肯定在学校里学过的知识的问题(例如“一年有多长?”)。
- 新内容(牛顿): 需要应用规则到 AI 从未见过的新情境中的问题。
- 不可能内容(分布外 OOD): 关于完全超出 AI 训练范围的虚构物理的问题(例如“如果重力强了 7 倍会发生什么?”)。
结果:
- 准确率: AI 答对了简单的问题,在新问题上挣扎,在不可能的问题上失败。它获得正确答案的能力发生了巨大变化。
- 自信度(熵): 作者测量了 AI 的“不确定性”(其自信的动摇程度)。令人惊讶的是,自信水平保持完全不变。
隐喻:
想象一位天气预报员。
- 场景 A: 他们预测暴风雨天气会下雨。他们有 90% 的把握。
- 场景 B: 他们预测晴朗天气会下雨(一个错误)。他们仍然有 90% 的把握。
- 场景 C: 他们预测火星上的一天会下雨(不可能)。他们仍然有 90% 的把握。
在这项研究中,AI 就像那位天气预报员。无论答案是简单、困难还是不可能,AI 内部的“自信仪表”都没有移动。它是一条直线。
为什么这很重要
论文得出结论,因为 AI 的“自信”在犯错时不会改变,我们不能将其自信视为安全信号。
- 如果你建立一个安全过滤器,规定“如果 AI 不确定,就停止它”,你会失败。AI 从不表现出不确定,即使它完全错了。
- AI 具有“结构性危险”,因为它可以同时达到最大程度的确定和最大程度的错误。
解决方案?一种新型计算机
作者建议,要解决这个问题,我们需要改变硬件。我们需要一种计算机,使得犯错实际上会消耗更多能量。
- 当前 AI: 就像一辆车,无论你是在直路上行驶还是撞向墙壁,它消耗的汽油量都是一样的。
- 未来 AI(提议): 一辆每次你变道或遇到颠簸时都会额外消耗汽油的车。如果犯错的“代价”很高,系统自然会学会更加谨慎,并诚实地面对其不确定性。
总结
该论文声称,当前的 AI 模型是“热力学解耦”的。这意味着它们的物理能量消耗并不在乎它们是对是错。因此,它们的自信水平是虚假的——即使它们在胡编乱造时,看起来也很确定。这是它们构建方式的物理局限性,而不仅仅是一个可以通过扩大模型规模来解决的软件故障。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。