Quantifying non deterministic drift in large language models
本文通过证明即使在零温度设置下,不同模型和提示词类型仍存在输出变异性,从而实证量化了大语言模型的基准行为漂移,为评估未来的缓解策略建立了一个系统性的参考点。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明、有创造力的机器人助手。你问它同一个问题:“天气怎么样?”并告诉它:“请尽可能精准且枯燥。”你会预期它每次给出的答案都完全一样,对吧?
这篇由 Claire Nicholson 撰写的论文研究了当你真的尝试这样做时,现代人工智能机器人(称为大语言模型或 LLM)会发生什么。令人惊讶的发现是:即使你告诉机器人要保持完美的一致性,它也往往做不到。
以下是该研究发现的简单拆解,使用了日常类比:
1. “机器中的幽灵”(非确定性)
研究人员将两个不同的 AI 模型视为一对双胞胎:
- 云端机器人: 一个名为
gpt-4o-mini的模型,它生活在大型服务器集群中(就像一个你看不到的餐厅厨房)。 - 本地机器人: 一个名为
llama3.1-8b的模型,它运行在实验室的一台单机上(就像一个在你自家厨房里烹饪的厨师)。
他们多次询问这些机器人相同的问题,并将设置调至“最大一致性”(温度值 Temperature 为 0.0)。
- 结果: 云端机器人大约有 4 次中有 1 次 会给出不同的答案。本地机器人更加稳定,但仍有 10 次中有 1 次 会改变答案。
类比: 想象你要求一位面包师使用完全相同的配方和原料来做一个巧克力蛋糕。你会预期每次做出来的蛋糕看起来都一模一样。但在本研究中,面包师(AI)有时会多加一撮盐,或者重新排列糖针的位置,尽管你已经要求他们严格遵守配方。
2. 为什么会发生这种情况?
论文提出了两个主要原因,导致了这种“漂移”:
- 模型本身: 更大、更复杂的模型似乎比较小的模型更“跳跃”,也更不稳定。
- 厨房(基础设施): 对于云端机器人来说,请求通过互联网传输的方式、计算机处理数据的方式,甚至服务器的组织结构,都可能改变结果。这就像是如果面包师的烤箱温度有轻微波动,或者搅拌碗的尺寸每次都有细微差别,即便配方是一样的。
3. “温度”旋钮
研究人员还测试了当他们调高“温度”(一个让 AI 变得更有创意和随机性的设置)时会发生什么。
- 低温度 (0.0): 机器人试图表现得枯燥且一致,但偶尔还是会出错。
- 高温度 (0.7): 机器人变得放飞自我。在这种模式下,每一次回答都是不同的。这就像是要求面包师做一个蛋糕,但告诉他们要“发挥创意”。突然之间,每一个蛋糕看起来都完全不同。
4. “词数”与“相似度”检查
他们是如何衡量这些的?他们不仅仅是阅读答案,还使用了数学方法进行比较。
- 唯一分数 (Unique Fraction): 他们统计了机器人给出全新答案的次数。
- Jaccard 相似度 (Jaccard Similarity): 这是一种衡量“有多少单词是相同的”的高级方式。
- 当机器人处于“枯燥”模式(0.0)时,答案大约有 90% 的相似度。
- 当机器人处于“创意”模式(0.7)时,答案的相似度不到 50%。
5. 这对你意味着什么(“方差预算”)
这篇论文并没有告诉你如何去解决这个问题。相反,它说的是:“在你尝试修复它之前,你需要知道这正在发生。”
把它想象成一个“方差预算”。
- 如果你正在构建一个生成财务数据的系统,你可能会说:“我只能容忍 5% 的输出差异。”
- 如果 AI 的漂移超过了这个范围,你就知道你需要介入了。
- 但首先,你需要知道在没有任何帮助的情况下,“正常”的漂移是什么样子的。这篇论文提供了这样一个基准地图。
总结
这项研究是一份“测量报告”。它并没有发明一种新的方法来阻止机器人改变主意。相反,它测量了在不受干预的情况下,机器人究竟会改变主意多少次。
核心结论是: 即使你认为你已经把机器人锁定在 100% 可预测的状态,它实际上仍在微微晃动。如果你依赖 AI 的单次回答,你可能会忽略掉这样一个事实:下次你再问时,它可能会给出略有不同的说法。为了获得全貌,你可能需要多次询问同一个问题,并观察其平均值。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。