The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance
本文介绍了 BenchDrift,这是一个量化了保持语义不变的重表述如何导致大语言模型性能出现显著的双向波动的框架,揭示了表述敏感性在不同能力的模型中普遍存在,且这种脆弱性更多源于特定的重表述方式而非单个模型的弱点。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位才艺表演节目的评委,但你观察的不是一场表演,而是一个机器人解决谜题的能力。在人工智能的世界里,这些谜题被称为“基准测试”(benchmarks)。你可以把基准测试看作是一项标准化考试,就像是计算机的一场期末考试。多年来,科学家们一直认为,如果一个机器人在这次测试中获得了高分,就说明它真正理解了所学内容。但这里有一个陷阱:测试中的每一个谜题都是以一种特定的方式编写的。这就像是问一名学生:“2加2等于几?”并因为他答对了就给他满分,却从未问过:“你能告诉我二与二之和是多少吗?”或者“如果你有两个苹果,又找到了两个,现在一共有多少个?”
这篇论文深入探讨了自然语言处理(Natural Language NLP)的一个领域,该领域研究计算机如何理解人类的语言。核心观点在于,计算机对问题的“提问方式”异常敏感。就像人类如果遇到老师使用奇怪的口音或混乱的句子结构时可能会感到困惑一样,计算机如果词汇发生变化,即使数学逻辑完全相同,也可能会出错。为什么这很重要?因为如果机器人的得分完全取决于测试中特定的措辞,我们就无法真正相信那个分数能否反映出机器人的真实智力水平。它可能只是擅长猜中某个特定谜语的正确答案,而不是真正解决了问题本身。
这项研究背后的研究人员来自 IBM,他们决定利用一个名为 BenchDrift 的新工具来调查这种“措辞效应”。想象你有一台神奇的复印机,可以在不改变答案的情况下,将一个问题以数十种不同的方式重写。你可以将同一个数学问题写成一个礼貌的请求、一个戏剧性的故事、一个列表形式,甚至是一系列更小的子问题。团队使用 BenchDrift 将真实的测试问题按照四个不同的“维度”进行了重写:语言维度(改变词汇和风格)、指代维度(更换名称或数字)、语用维度(改变语气或场景,比如假装机器人是一名艺术家)以及结构维度(改变信息的组织方式)。
他们将这些重写后的问题输入到八个不同的 AI 模型中,涵盖了从小型到超大型的模型。他们的发现令人震惊。他们发现了一种被称为“漂移”(drift)的现象。有时,重写问题有助于机器人答对之前失败的问题(正向漂移);但通常情况下,重写问题会导致机器人原本能答对的问题变得答错(负向漂移)。
最令人惊讶的发现是:机器人越聪明,它看起来就越脆弱。那些通常能获得最高分的强大模型,在问题被重新表述后,丢失正确答案的数量实际上比增加的正确答案更多。这就像是那些顶尖的学生太习惯于老师提问的特定方式,以至于无法应对稍微不同的表达方式。事实上,对于表现最好的模型来说,单一的测试分数往往高估了它们的真实能力。研究人员发现,模型的“最佳情况”得分(当它因措辞而走运时)与“最差情况”得分(当措辞让它出错时)之间的差距巨大——平均波动高达 74.7 个百分点。例如,一个在原始测试中得分为 93.4% 的模型,在问题以某种方式重写后,得分会跌至 38.2%。
研究团队也排除了几种容易的借口。他们证明了机器人并不是仅仅因为问题变得更难或更长而失败;有时,让问题变长或变短会导致同样程度的麻烦。他们还发现,即使机器人对自己的答案非常有信心(给出了很高的概率得分),简单的重新表述仍然会破坏其逻辑。这表明这种脆弱性不仅仅是因为机器人不确定,而是因为机器人过度依赖于词汇的具体形态。
此外,研究人员注意到,不同的模型往往会在相同类型的重构上失败。例如,将一个问题分解为一系列更小、更明确的问题(一种结构性变化)会导致全线范围内的最多失败,而仅仅添加额外的空格或改变字体则几乎不会造成什么影响。这意味着这个问题并非某个特定机器人的特有问题,而是这些系统处理某些语言结构时的缺陷。
最后,论文认为,单一的基准测试得分就像是捕捉移动汽车的一个瞬间快照;它只能告诉你汽车在某一精确时刻的位置,但不能告诉你它的稳定性。研究人员建议,我们不应该只报告一个数字,而应该报告一个范围:模型可能得到的最低分、最高分以及平均分。这能提供关于 AI 实际能力的更清晰图景。他们发现,要获得一个模型真实实力的可靠画像,你需要对同一个问题的许多不同版本进行测试,而不仅仅是原始的版本。如果我们不这样做,我们可能会因为机器人恰好掌握了测试的措辞方式,就去赞美那些实际上非常脆弱的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。