GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models
本文介绍了 GSM-Plus-BN,这是一种基于扰动的孟加拉语数学推理新基准,它源自英文 GSM-Plus 数据集,旨在评估六个大语言模型的鲁棒性和推理能力,同时凸显了低资源语言环境下固有的显著性能差距与挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人解决数学问题。你不会仅仅要求它计算 ;你会想知道它是否真正理解为什么答案是 4,还是仅仅记住了“2 加 2”总是等于 4。这就是人工智能世界中的一个重大问题:大型语言模型(LLM)——即聊天机器人背后那些超级聪明的计算机大脑——是真的在“思考”,还是仅仅非常擅长猜测句子中的下一个词?
为了找出这一点,科学家们一直在用数学应用题测试这些机器人。但这里有一个陷阱:如果你问机器人同一个问题一千次,它可能会记住答案。要看它是否真的聪明,你必须去“欺骗”它。你改变数字、更换词汇,或者添加令人困惑的额外细节,看看机器人是否仍能得到正确答案。这被称为“扰动”(perturbation)。这就像问一个学生:“如果我有 3 个苹果并吃了 1 个,还剩几个?”然后,紧接着问:“如果我有 300 个苹果并吃了 100 个,还剩几个?”一个聪明的学生知道这道题的数学逻辑是一样的;而一个仅仅记住了第一个答案的机器人可能会感到困惑。
现在,想象一下在做所有这些测试时,不是使用机器人最常训练的英语,而是使用孟加拉语——一种有超过 2.3 亿人使用的语言。直到现在,几乎没有方法可以测试这些 AI 大脑能否处理孟加拉语中的数学陷阱。这篇论文填补了这一巨大的空白,它在问:这些 AI 模型真的能在孟加拉语中进行推理吗,还是它们在词汇变化时就会踉跄跌倒?
这项研究背后的研究人员(来自孟加拉国大学的一个团队)决定为 AI 构建一个巨大的、充满陷阱的游乐场,叫做 GSM-PLUS-BN。你可以把它想象成一个专门为孟加拉语设计的“数学障碍赛”。他们从 1,000 个标准数学题(“种子”问题)开始,然后使用一种巧妙的配方创建了 8,000 个新的、更难的版本。
他们是如何制造这些陷阱的呢?他们使用了八种不同类型的“扭曲”,就像魔术师在牌堆中换牌一样:
- 改变数字: 将“3”换成“4”,或者把一个小数字变成一个巨大的数字(比如把 2 变成 2,000)。
- 改变数学逻辑: 增加一个新的步骤,或者反转问题(不再问“总数是多少?”,而是问“如果总数是 X,那么初始数字是多少?”)。
- 改变措辞: 重写句子,使其意思相同但听起来完全不同。
- “红鲱鱼”(干扰项): 添加一句听起来很重要但实际上毫无用处的句子,比如在只讨论需要多少件衬衫的问题中提到一件衬衫的价格。
- “缺失的部分”: 移除一个关键信息,以观察机器人是会承认自己不知道答案,还是直接瞎猜。
他们在这种赛道上测试了六个不同的 AI 模型。有些模型很小且速度很快(就像一个聪明的计算器),而另一些则规模宏大且复杂(就像一个超级计算机大脑)。他们要求机器人以两种方式解决问题:首先,仅给出直接答案;其次,通过“逐步思考”(一种称为“思维链”的技术,即机器人必须展示其解题过程)。
他们发现了什么?
结果既有“哇!”也有“噢,糟了”。
首先,“逐步思考”的技巧对某些机器人效果显著,但对另一些机器人却适得其反。Qwen3-32B 模型就像是一个数学很差的学生,直到老师说:“展示你的解题过程!”突然间,它的得分从惨淡的 13.98% 跳升到了稳健的 76.25%。它似乎具有聪明的潜力,但需要一点点引导来释放它。
然而,最大的机器人并不总是获得最大的提升。GPT-OSS-20B(一个拥有 200 亿参数的模型)在解决标准问题时表现最好,无需任何额外帮助就能达到 96.08% 的正确率。但当被强制要求“逐步思考”时,它的表现反而略有下降,降至 87.80%。与此同时,庞大的 GPT-OSS-120B 巨兽在标准问题上的起始得分有 88.03%,在被要求展示解题过程时也出现了轻微下滑。看起来,这些巨头由于太擅长直接猜测答案,以至于额外的指令有时反而会让它们感到困惑。
最令人惊讶的发现是机器人对“批判性思维”陷阱的应对程度。当研究人员移除一个关键信息并询问“你能解决这个问题吗?”时,几乎所有的模型都惨败。即使是最优秀的模型也只有大约 33% 的正确率。这表明,虽然这些 AI 模型擅长遵循模式,但它们在意识到问题无法解决时仍然很吃力。它们倾向于直接猜测,而不是说:“我没有足够的信息。”
另一个重大发现是,无论使用哪种语言,数学对 AI 来说仍然很难。即使是最好的模型,在处理需要改变数字表达方式(例如将整数变为分数)或增加额外数学步骤的问题时也会感到困难。论文指出,这些模型可能过于依赖识别文本中的模式,而不是在它们的“脑海”中进行实际的数学运算。
最后,团队发现 AI 模型在孟加拉语中的表现比在英语中要脆弱得多。当问题发生轻微变化时,机器人的得分会显著下降。这告诉我们,尽管 AI 正在变得越来越聪明,但要实现像人类那样在孟加拉语中真正“理解”数学,还有很长的路要走。
简而言之,这篇论文不仅构建了一个新的测试,它还向我们展示了:虽然 AI 在数学方面表现得惊人地好,但它仍然很容易被陷阱迷惑,尤其是在它不如英语那样精通的语言中。“逐步思考”的技巧对某些模型有效,但它并不是能解决一切问题的万能药。机器人正在变得更好,但它们还没准备好成为终极的数学天才。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。