← 最新论文
🤖 AI

Measuring Stability and Failure Behavior in Language Models Under Structured Perturbations

本文引入了一种分级的、多维度的压力测试框架,揭示了语言模型的推理稳定性及其失效点如何随特定的扰动类型和严重程度而变化,从而暴露了标准准确率指标所忽略的在处理冲突指令和不可能前提时的关键缺陷。

原作者: Samira Golsefid

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Samira Golsefid

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,一个能够阅读和编写语言的计算机程序通常由一个单一的数字来评判:其准确率得分。这个得分告诉我们机器在标准测试中获得正确答案的频率。但这个单一的数字掩盖了关于机器实际思维方式的许多信息。它没有向我们展示当问题以不同的方式提出时,或者当指令略显混乱时,或者当问题本身包含一个使回答变得不可能的陷阱时,会发生什么。正如一座桥梁可能在重型交通下稳固,却会在单个螺栓松动时坍塌一样,语言模型可能在一个格式下完美解决数学问题,但如果单词被重新排列或加入了一个干扰性的句子,就会完全失败。了解这些隐藏的弱点至关重要,因为现实世界中的问题很少是干净或表达完美的。如果我们依赖这些机器做出重要的决策,我们需要知道的不仅是它们能否解决问题,还要知道当条件变得困难或问题本身出现缺陷时,它们的表现如何。

一位研究人员致力于通过压力测试四种不同的语言模型来绘制这些隐藏的行为图谱。研究人员并没有向模型提一个问题并记录通过或失败,而是创建了一个包含 4,473 个变体的庞大实验室,这些变体源自 100 个简单的初等数学题。他们对每个问题进行了七种不同类型的压力测试,范围从轻微的变化到严重的扭曲。有些变化就像一阵微风,例如将句子改写得更正式,或添加一些拼写错误。另一些则像是强风,例如插入相互矛盾的指令,要求模型忽略数学计算并给出另一个答案,或者添加一长串与计算无关的无关事实。研究人员还包含了一类特殊的问题,即无法回答的问题,例如基于不存在的事实或缺失必要数字的问题,以观察模型是会承认自己不知道答案,还是会自信地编造一个数字。

研究显示,模型的失败方式并不统一。虽然最强大的模型可以应对对措辞或文本布局的大幅改动而不失控,但面对特定类型的困惑时,它们都会跌跌撞撞。每一款模型,无论多么先进,最终都会在指令相互冲突时崩溃。如果提示词要求模型解决一个问题,但随后又增加了一个忽略该问题的命令,模型往往会感到困惑并失败。更具启发性的是模型如何处理无法回答的问题。当研究人员提出基于不可能前提的问题时,例如询问一个依赖于虚构事件的计算结果,模型几乎总是会尝试照样求解。它们会计算出一个数字并将其作为事实呈现,而不是停下来说明这个问题毫无意义。即使是测试中最出色的那个模型也是如此,尽管它在其他方面的表现非常出色。

研究人员发现,模型失效的点完全取决于它所面临的麻烦类型。一个模型可能对拼写错误抵抗力很强,但对长篇干扰段落很脆弱;而另一个模型可能能很好地处理干扰,但在面对冲突指令时会崩溃。这意味着,单一的总分不足以描述一个模型的可靠性。研究表明,识别问题何时无法回答的能力是不均衡的。当信息明显缺失或证据显然造假时,模型能够拒绝回答;但它们在识别基于不可能前提构建的问题方面表现得很差。它们不会标记错误,而是会继续进行数学运算并返回一个自信但错误的结果。这些失败在标准测试中是不可见的,因为模型从未被要求以这种经过分级、系统化的方式去处理这些特定类型的压力。

通过测量性能随难度增加而下降的情况,研究人员为每个模型创建了详细的优劣剖面图。他们发现,最强大的模型对表面层面的变化(如改写或格式调整)具有鲁棒性,但在面对冲突指令和不可能的情景时,它们有着共同的脆弱性。这表明,虽然这些机器在遵循模式方面已经做得非常好,但在规则被扭曲或问题本身存在缺陷时,它们仍然难以维持任务。研究结论指出,要真正理解这些模型在现实世界中将如何表现,我们必须超越单一的准确率数字,去考察它们在压力下是如何退化的。结果显示,通往更可靠人工智能的道路不仅需要提高在标准测试中的表现,还需要具备一种更深层次的能力,即识别何时问题无法回答,并在指令相互矛盾时仍能保持专注。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →