Beyond the Singular: Revealing the Value of Multiple Generations in Benchmark Evaluation
本文提出了一种分层统计模型,该模型利用多代生成来解决大语言模型基准测试中的采样方差问题,从而提高分数准确性、实现细粒度的提示级难度分析,并通过数据可视化促进基准测试的质量控制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在评估一位新厨师的烹饪水平。你给他一份包含 100 道菜谱的清单让他制作。
旧方法(“单次尝试”问题)
目前,大多数人通过向人工智能模型(如大型语言模型)提问并查看单一答案来评判它们。
- 如果厨师一次做出了完美的煎蛋卷,我们就说他是大师。
- 如果他一次烧焦了,我们就说他糟糕透顶。
问题在于,这些“人工智能厨师”有点不可预测。有时它们处于“贪婪”模式,坚持最安全、最标准的菜谱;有时它们又变得“随机”,尝试富有创意的变体。如果你只品尝一道菜,你可能会运气好或运气差。你无法确定这位厨师是否真的技艺高超,还是仅仅在那一次特定的订单中运气好。这就像通过观看篮球运动员投掷一颗球来判断其罚球命中率一样。
新方法(“多次生成”方法)
这篇论文提出了一种更好的方法:让厨师将同一道菜制作 50 次。
通过观察同一道菜谱的 50 次不同尝试,你会获得更清晰的图景:
- 真实技能与运气: 如果厨师在 50 次尝试中有 48 次做对了,你就知道他们确实技艺精湛。如果只有 25 次做对,你就知道他们很吃力,即使那一次幸运的尝试看起来完美无缺。
- 衡量难度: 你现在可以看到哪些菜谱实际上很难。如果所有厨师在 50 次尝试中都搞砸了某道菜,那么这道菜在客观上就是困难的。如果他们都做对了,那它就是简单的。这为每一个问题创建了一个“难度分数”。
- 发现糟糕的菜谱: 有时,菜谱书本身就有错误。也许菜谱说“加盐”,但答案键却说“加糖”。如果厨师尝试了 50 次并一直加盐(因为菜谱是这么说的),但答案键是错的,计算机就能发现这种混淆。论文将这种现象称为“数据地图”,它有助于发现并修复测试本身中存在的问题。
“掷骰子”类比
把人工智能想象成一对骰子。
- 贪婪解码(旧方法): 这就像强迫骰子总是落在可能的最高点数上。它是可预测的,但它无法展示骰子所能表现出的全部范围。
- 随机采样(新方法): 这就像让骰子自然滚动。
- 论文的洞见: 如果你只掷一次骰子,你可能会掷出"6",并认为这枚骰子有魔力。如果你掷 50 次,你就会看到真实的平均值。论文从数学上证明,掷骰子的次数越多(生成更多的答案),你对人工智能技能的评估就越准确,越不容易是偶然现象。
他们的实际发现
研究人员使用几种不同的人工智能模型,在四种不同类型的“测试”(基准测试)上测试了这种方法:
- 稳定性: 他们发现,对于高难度的推理任务,人工智能的行为有点像随机采样。一个答案不足以揭示真相。
- 差距: 人工智能在采取保守策略(贪婪)时得到的结果与冒险策略(随机)时得到的结果之间,往往存在巨大差异。仅仅依赖一次随机猜测是不稳定的。
- 清洗数据: 通过让人工智能对同一个问题回答 50 次,他们能够在数学数据集中发现约 44% 的问题,这些问题要么标记错误,要么表述令人困惑。
代价
论文承认,制作 50 道菜比只做一道菜需要更多的时间和能量。它需要更多的计算能力。然而,这种权衡的回报是,你会得到一份更诚实、更可靠的人工智能成绩单。
总结
不要通过单页来评判一本书,也不要通过单一答案来评判人工智能。通过让人工智能多次尝试同一项任务,我们可以看到它的真实能力,理解哪些问题实际上很难,并修复那些有缺陷的测试。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。