Probabilistic Attribution For Large Language Models
本文提出了一种与模型无关的概率归因框架,该框架利用贝叶斯规则对大语言模型(LLM)的 token 概率进行量化,以衡量 token 的重要性与熵,从而增强可解释性,并揭示模型在不同提示下的稳定性与行为特征。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,大型语言模型(LLM)并非像人类那样“思考”的魔法大脑,而是一个超级高级的老虎机或一个巨型的高速骰子滚动器。
每当模型写出一个词(或“词元”)时,它并非仅仅在猜测。它会基于到目前为止所写的所有内容,计算其整个词典中每一个可能下一个词的概率。它根据这些概率选择下一个词。
这篇名为《大型语言模型的概率归因》的论文,提出了一种窥探这台老虎机内部的新方法,以理解它为何选择了那些词。作者将这种新工具称为归因分数(Attribution Score, AS)。
以下是他们观点的分解,使用了简单的类比:
1. 核心思想:倒带
通常,当我们向人工智能提问时,它会给出一个答案。我们可能会想:“是我问题中的哪一部分让它说了那个?”
作者将人工智能的写作过程视为一个随机过程(这是一个数学术语,指随时间演变的随机过程,如天气模式或股票市场)。他们意识到,由于人工智能只是在计算概率,我们可以利用数学来“倒带”。
类比:
想象你在听一首歌,你想知道旋律中的哪个特定音符让歌手在结尾唱出了高音。
- 旧方法: 你猜测哪个音符很重要。
- 作者的方法: 他们把歌曲拿过来,一次移除一个音符,然后问歌手:“如果我不播放这个特定音符,你唱出那个高音的可能性会有多大?”
- 如果移除该音符使得高音变得不可能,那么该音符至关重要(高分)。
- 如果移除该音符没有任何改变,那么该音符只是背景噪音(低分)。
2. 魔法戏法:“如果”游戏
棘手之处在于,人工智能只知道如何向前写作。它无法自然地说:“如果我省略了这个词会怎样?”
作者使用了一个数学技巧(贝叶斯规则)来迫使人工智能玩这个“如果”游戏。他们本质上是在告诉人工智能:“这是你的提示和你的答案。现在,假设你提示中的单词‘苹果’实际上是词典中的任何其他单词。这会如何改变你答案的概率?”
通过进行这种数学运算,他们为提示中的每一个单词计算出一个分数。这个分数告诉你,那个特定的单词在多大程度上“推动”了人工智能走向其最终答案。
3. 测量“困惑”(熵)
该论文还考察了熵,这是不确定性或困惑的度量。
类比:
想象你试图猜测句子中的下一个词。
- 低熵(低困惑): 句子是“天空是……"。人工智能有 99% 的把握下一个词是“蓝色”。它并不困惑。
- 高熵(高困惑): 句子是“那个……东西……做了……"。人工智能完全不知道接下来是什么。它同样可能是“猫”、“狗”、“跑”或“跳”。
作者发现:
- 如果一个词具有高归因分数(它非常重要),但人工智能对于用什么词替换它仍然非常困惑(高熵),那就有些奇怪了。这可能意味着模型不稳定或尚未很好地学习数据。
- 如果一个词具有低分数(它不太重要),而人工智能对于用什么词替换它非常自信(低熵),那么该词很可能只是“填充物”或噪音。
4. 他们的发现
作者在 7 个不同的提示下测试了 8 个不同的人工智能模型。以下是他们的发现:
- 旧模型与新模型: 旧模型(如 GPT-2)即使在单词似乎不太重要时也显得更“困惑”(更高的熵)。新模型(如 Llama)则更加稳定和自信。这表明新模型在训练数据上更好地“收敛”了——它们更一致地知道自己在说什么。
- 发现“坏”词: 他们发现了人工智能感到困惑的具体实例。例如,在一个提示中,人工智能为了句子更通顺,更喜欢用“在”而不是用户的“当”。分数揭示了这种不匹配,显示人工智能对稍有不同的问题感到更“满意”。
- 词元敏感性: 有些词就像拱门的“拱心石”;如果你移除它们,整个答案就会崩塌。分数可以识别出这些拱心石词。其他词则像灰浆;你可以替换它们,答案保持不变。
5. 为什么这很重要(根据论文)
作者声称这种方法是模型无关的。
- 类比: 将不同的人工智能模型想象成不同品牌的汽车(福特、丰田、特斯拉)。大多数解释它们如何工作的工具只适用于一个品牌。这种新工具就像一种通用诊断扫描仪,适用于任何汽车,无论其引擎是如何构建的。
他们还声称它是无参数的。
- 类比: 许多工具需要您转动旋钮和拨盘(设置)才能获得结果。如果您错误地转动了旋钮,结果就会是一团糟。这个工具不需要旋钮;它只使用人工智能已经在进行的数学运算。这使得结果更加客观,也更容易信任。
总结
这篇论文为人工智能文本生成提供了一种数学“X 光片”。与其猜测人工智能为何这样说,他们利用概率数学精确计算出您问题中的每个词在多大程度上促成了答案。他们利用这一点来识别哪些模型是稳定的,哪些是困惑的,以及哪些词是人工智能行为的真正驱动因素。
重要提示: 该论文严格专注于理解模型的数学原理和稳定性。它并不声称能解决人工智能的幻觉、诊断医疗状况或解决法律案件,尽管它表明理解这些概率有助于用户关注人工智能生成中“不确定或不稳定”的部分。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。