When Mean CE Fails: Median CE Can Better Track Language Model Quality
本文表明,中位数交叉熵在合成事实学习和 top-K 蒸馏等场景下追踪语言模型质量时往往优于标准平均交叉熵,因为它通过关注分布的主体而非受尾部异常值偏斜,与任务表现具有更好的相关性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位正在批改学生作文的老师。通常,你会计算“平均”成绩来判断学生的表现。如果平均分上升,你就会认为学生进步了。
本文指出,对于人工智能语言模型而言,“平均”成绩(称为平均交叉熵)可能是一个极其糟糕的骗子。有时,平均分上升(暗示 AI 表现变差),但实际上 AI 正在创作更好的故事,或更准确地回答问题。
以下是这一现象发生原因的简明解析,以及作者提出的替代方案,其中运用了一些富有创意的类比。
1. 问题所在:“平均”极易受骗
在人工智能领域,我们通过观察模型的“损失”(一个数值越低越好的分数)来衡量模型的好坏。标准做法是计算模型所有错误的均值(平均值)。
类比:“一颗坏苹果”效应
想象一个装有 100 个苹果的篮子。
- 99 个苹果完美无瑕。
- 1 个苹果腐烂,气味难闻。
如果你计算篮子的“平均新鲜度”,那一个腐烂的苹果会拉低整个分数。尽管 99% 的苹果完美,但整个篮子看起来却很差。
研究发现,AI 模型往往表现得像这个篮子。在训练过程中,模型非常擅长预测“正常”的词汇(那 99 个完美的苹果)。但它开始在少数罕见、棘手的词汇上犯下奇怪且高误差的错误(那 1 个腐烂的苹果)。
- 均值看到了那个腐烂的苹果,说道:“模型变差了!”
- 现实是,模型实际上在它本该做的任务上变得更好了。
2. 解决方案:“中位数”是诚实者
作者建议不使用平均值,而是使用中位数。
类比:“中间的孩子”
如果你将所有苹果从最好到最差排成一队,中位数就是正中间的那个。
- 在我们 100 个苹果的篮子里,第 50 个苹果是完美的。
- 那个腐烂的苹果排在队伍的最末尾。
- 中位数不在乎那个腐烂的苹果。它告诉你,篮子里“典型”的苹果是新鲜的。
论文表明,当他们查看中位数分数而不是均值分数时,结果与 AI 在实际任务(如讲故事或回忆事实)中的表现完美契合。
3. 论文中的两个现实案例
作者在两种不同场景中测试了这一理论:
场景 A:“过度训练”的学生(Qwen 模型)
- 发生了什么: 他们教 AI 学习一系列虚构的事实。
- 陷阱: 随着训练持续,AI 对这些事实掌握得更好,但它开始在少数非常具体、奇怪的句子结构上感到困惑。
- 结果: 均值分数上升(看起来变差),但中位数保持低位(看起来变好)。实际测试分数(它记住事实的程度)跟随的是中位数,而非均值。均值只是对那几句令人困惑的句子做出了反应。
场景 B:“Top-K"蒸馏(TinyStories)
- 发生了什么: 他们试图教一个小 AI 模仿一个大 AI,但要求小 AI 只关注大 AI 最可能选择的前 5 个词(忽略其余部分)。
- 陷阱: 这使得小 AI 在常见词汇上非常自信(极佳的中位数),但在罕见词汇上表现糟糕(糟糕的均值)。
- 结果: 当人类(或充当裁判的其他 AI)阅读这些故事时,他们喜爱那个“前 5 名”学生创作的故事。它是最优秀的 storyteller。但如果你查看均值分数,它看起来像是最差的学生。中位数分数正确地将其识别为最佳。
4. “一致性”检查:何时信任平均值
作者引入了一个称为一致性(Concordance)的概念。将其想象为一种“团队共识”检查。
- 高一致性: 均值、中位数和“第 95 百分位”(最坏情况)都一致认为哪个模型最好。在这种情况下,使用均值是可以的。
- 低一致性: 均值说"Model A 最好”,但中位数说"Model B 最好”。这是一个危险信号!这意味着错误分布的形状发生了变化(就像那个苹果篮子)。
论文的建议:
不要只报告平均分数。请报告一组分数:
- 均值(平均值)。
- 中位数(典型情况)。
- 第 95 百分位(最坏情况的尾部)。
如果这三个数字讲述的故事不同,你就知道“平均”在欺骗你。你应该信任中位数来选择那些在实际任务中表现更好的 AI 模型。
总结
- 平均交叉熵(均值): 容易被少数几个糟糕的错误所误导。这就像根据一个在难题考试中不及格的学生来评判整个班级。
- 中位数交叉熵(中位数): 忽略异常值,告诉你“典型”的 token 表现如何。它能更好地追踪现实世界的表现。
- 修正方案: 始终在查看“平均”分数的同时检查“中间”分数。如果两者不一致,通常应该信任“中间”分数来挑选最佳的 AI 模型。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。