📊 statistics
LLMs as Implicit Imputers: Uncertainty Should Scale with Missing Information
本文认为,作为隐式插补器的大型语言模型应表现出随缺失信息增加而增大的不确定性,研究发现基于采样的置信度无法反映上下文质量的逐渐下降,而响应熵能有效追踪缺失程度并更好地预测准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名试图解开谜团的侦探。通常,你拥有一整份证据文件(即“上下文”)来帮助你找出罪魁祸首。但有时,这份文件被撕碎了,你只剩下几张纸片。
这篇论文提出了一个简单却至关重要的问题:当你的侦探(一个 AI 语言模型)在证据缺失的情况下工作时,它是否知道自已应该有多不确定?
作者认为,AI 应该像一名“统计侦探”,承认“我这是在猜测,因为我没有足够的线索”。相反,他们发现当前的 AI 往往表现得像过度自信的侦探,胡乱猜测却坚称自己有 100% 的把握。
以下是他们研究发现的分解,使用了简单的类比:
1. 核心理念:“缺失线索”测试
研究人员将 AI 视为一种多重插补器。在统计学中,当数据缺失时,专家不会只猜测一个答案;他们会生成许多可能的情景,以观察答案可能产生多大的变化。
- 测试方法:他们提出问题,并逐步撕碎背景信息(即上下文),直到 AI 除了问题本身外一无所有可读。
- 规则:随着线索消失,AI 的“不确定性”应当上升。如果没有线索,它应该非常不确定;如果拥有所有线索,它应该非常确定。
2. 衡量“不确定性”的两种方式
研究人员考察了两种衡量 AI 不确定性的方法,即当它们被连续询问同一个问题 10 次时:
- “大声的声音”(置信度):这衡量 AI 每次给出相同答案的频率。如果它在 10 次中有 10 次都说“丹佛野马队”,那听起来就非常自信。
- “人群嘈杂声”(熵):这衡量答案的差异程度。如果 AI 一次说“丹佛野马队”,一次说“新英格兰”,一次说“爱国者队”,还有七次说“我不知道”,那就有很多“嘈杂声”或多样性。这就是高熵。
3. 重大发现:“大声的声音”是个骗子
研究发现“大声的声音”(置信度)存在一个主要问题:
- 发生了什么:即使 AI 拥有零上下文(没有线索),它也经常连续 10 次给出相同的错误答案。尽管它完全是基于训练记忆中的内容进行猜测,但它听起来却极其自信。
- 类比:想象一个忘记带课本的学生参加考试。他对每一道题都猜"C"。他 100% 一致(高置信度),但他 100% 错误。AI 正是这样做的。
4. 赢家:“人群嘈杂声”(熵)
“人群嘈杂声”(熵)的表现要好得多:
- 发生了什么:随着研究人员移除上下文,AI 的答案开始分散。它不再连续 10 次说“丹佛野马队”,而是开始说“丹佛”、“野马队”、“那支球队”、“我不知道”等等。
- 类比:这就像房间里的一群侦探。当他们拥有所有证据时,他们都指向同一个嫌疑人。当你拿走证据时,他们开始指向不同的方向。他们越困惑,指向的方向就越分散。
- 结果:“人群嘈杂声”的指标随着 AI 准确性的下降而上升。这是一个真正的困惑信号。
5. “分辨率比率”(线索起了多大作用?)
作者创建了一个名为分辨率比率的简单分数。
- 把它想象成电灯泡的调光开关。
- 无上下文(关):房间是黑暗的(高不确定性)。
- 完整上下文(开):房间是明亮的(低不确定性)。
- 分数:这衡量了“光”(上下文)在多大程度上关闭了“黑暗”(不确定性)。他们发现,拥有完整上下文解决了约 80% 的不确定性,这很合理。
论文主张总结
- 问题:当前的 AI 模型往往是“不当的插补器”。当它们缺乏信息时,会抑制自身的不确定性,给出一个单一的、自信的但往往错误的回答。
- 解决方案:我们应该关注 AI 答案的变化程度(熵),而不是它重复相同答案的频率(置信度)。
- 证据:当移除上下文时,AI 的准确性下降,但其“置信度”却保持高位(对我们撒谎)。而其“熵”(答案的多样性)上升,正确地发出了它迷失方向的信号。
- 启示:如果你想了解 AI 是否因为缺少信息而在猜测,不要问它听起来有多确定。要问:“如果我问你 10 次,你会给我 10 个不同的答案吗?”如果是,它知道自己不确定。如果它给你 10 次相同的错误答案,那就是过度自信。
该论文得出结论,熵是比我们要通常看到的标准“置信度”分数更好的“黑盒”工具,能告诉我们 AI 何时是在盲目飞行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。