← 最新论文
💬 NLP

ArithmAttack: Evaluating Robustness of LLMs to Noisy Context in Math Problem Solving

该论文提出了名为 ArithmAttack 的评估方法,通过向数学问题提示中插入标点符号噪声来测试大语言模型的鲁棒性,实验结果表明包括 Llama3 和 Mistral 在内的八种主流模型在面对此类噪声时均表现出脆弱性,且噪声越多性能越差。

原作者: Zain Ul Abedin, Shahzeb Qamar, Lucie Flek, Akbar Karimi

发布于 2026-03-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Zain Ul Abedin, Shahzeb Qamar, Lucie Flek, Akbar Karimi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的超级人工智能(大语言模型)做一场"抗干扰压力测试"。

想象一下,你正在教一个非常聪明的学生(AI 模型)做数学题。这个学生平时成绩很好,能解出各种复杂的算术题。但是,这篇论文的作者们想知道:如果我们在题目里故意加一些“噪音”,比如乱加标点符号,这个学生还能做对吗

他们给这个测试起了个名字叫 "ArithmAttack"(算术攻击)

以下是用通俗易懂的比喻和语言对这篇论文的详细解读:

1. 核心实验:给题目“撒胡椒面”

通常,我们担心 AI 会被故意篡改的词语(比如把“苹果”改成“香蕉”)骗倒。但作者们换了一种更隐蔽、更简单的方法:

  • 做法:他们不改变题目里的任何一个字,也不删掉任何信息。他们只是像往干净的白纸上乱撒胡椒面一样,在数学题的句子里随机插入一些标点符号(比如问号、感叹号、分号等)。
  • 例子
    • 原题:蒂芙尼烤了 8 个布朗尼,但派对需要 17 个。如果每个用了 8 杯面粉,她还需要多少杯?
    • 被“撒胡椒面”后的题:?蒂芙尼烤了 8 个布朗尼,但需要 17 ! 总共为 ; 她的派对。如果她 : 用了 8 杯面粉...
  • 目的:虽然意思完全没变(语义相似度 100%),但这些乱糟糟的符号就像背景噪音,可能会干扰 AI 的“注意力”,让它读题时“走神”或“卡壳”。

2. 测试对象:八位“数学高手”

作者找了 8 个目前市面上流行的 AI 模型(比如 Llama 3, Mistral, DeepSeek 等)来答题。这些模型有的像“全科优等生”,有的像是专门练过数学的“特长生”。

3. 实验结果:大家都“翻车”了,但程度不同

实验结果有点令人意外,但也很有启发性:

  • 普遍脆弱:所有的 AI 模型,一旦题目里标点符号变多了(噪音变大了),它们的解题能力就直线下降。噪音越多,错得越离谱。
  • 谁是冠军
    • Llama 3.1 表现最好,它就像那个心理素质最稳的学生,即使题目里乱加标点,它也能保持较高的正确率。
    • Zephyr 表现最差,就像那个一遇到干扰就慌了神的学生,稍微加点噪音,正确率就崩盘了。
    • Mathstral(专门学过数学的模型)比普通的 Mistral 更抗干扰,说明专业知识确实能帮它更好地过滤噪音
  • 难度差异:在更难的数学题集(GSM8K)上,AI 受到的打击比在简单题集(MultiArith)上更大。这说明题目越难,AI 越容易因为“噪音”而崩溃

4. 为什么这很重要?(比喻:大脑的“分心”)

这就好比你在做高数题时,旁边有人不停地敲桌子、喊你的名字,或者在你耳边乱按喇叭。虽然这些声音没有改变题目本身,但它们会打断你的思考逻辑流

这篇论文发现,目前的 AI 在“思考”数学题时,非常容易被这种无意义的符号噪音打断思路。这告诉我们,AI 虽然看起来像人一样聪明,但在处理非标准、混乱的输入时,其实非常脆弱。

5. 总结与启示

  • 主要发现:现在的 AI 在数学解题上,对“乱标点”这种噪音非常敏感。
  • 好消息:有些模型(如 Llama 系列)相对更 robust(鲁棒/强壮)一些。
  • 坏消息:只要噪音够大,再聪明的模型也会“变傻”。
  • 未来方向:我们需要训练 AI,让它们像人类一样,学会忽略背景噪音,专注于题目本身的逻辑,而不是被乱加的标点符号带偏。

一句话总结
这篇论文告诉我们,给 AI 出的数学题里加几个乱标点,就能让它“脑子短路”。虽然现在的 AI 很聪明,但它们还学不会像人类一样“耳旁风”地忽略这些无意义的干扰,这是未来需要改进的地方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →