← 最新论文
🔢 mathematics

Auditing Generative AI Error Patterns in Applied Differential Calculus: Evidence from ChatGPT and Gemini

这项描述性评估研究审计了 ChatGPT 和 Gemini 在应用微分学方面的表现,揭示出尽管两种模型都能执行孤立的步骤,但它们在将叙述性条件转化为函数、处理边界约束以及保持算术一致性方面经常失败,从而表明其解题过程在教育中应被用作批判性素材而非不加质疑的答案。

原作者: Polemer M. Cuarto

发布于 2026-07-10
📖 1 分钟阅读🧠 深度阅读

原作者: Polemer M. Cuarto

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了两个超级聪明、极其健谈的机器人——ChatGPTGemini,来帮你解决关于现实世界问题的复杂数学谜题。你要求它们计算如何让企业赚取最多的钱、粒子移动的速度有多快,或者火箭能飞多高。你期望它们是完美的计算器,对吧?

然而,研究员 Polemer M. Cuarto 的一项新研究决定对这些机器人进行测试。研究结果有点像发现你最喜欢的机器人厨师能完美地切菜,却总是忘了加盐,或者更糟,竟然以为食谱里要加的是糖而不是盐。

核心发现:“流畅但有缺陷”的陷阱

研究发现,虽然这些 AI 工具在处理机械性的数学步骤(如求导或积分)方面表现出色,但当它们必须将一个故事转化为数学方程记住初始条件时,往往会栽跟头。

可以这样理解:如果你要求一个机器人盖房子,它可能会完美地铺设每一块砖(数学运算)。但如果它误解了你的蓝图,把你想盖的小屋错当成了城堡(数学模型),那么无论砖块堆叠得多么整齐,整座房子都是错的。

该论文指出,这些工具并非你可以直接复制使用的可靠“答案库”。相反,它们更适合作为寻找错误的练习伙伴。研究人员认为,这些工具最危险的地方不在于它们算错了数学,而在于它们在出错的同时,还能表现得如此自信且专业。

三大失误

研究观察了三种特定类型的题目,机器人在每种题目中都跌入了同样的障碍:

1. 商业混淆(语义到代数的转化)
想象一位店主说:“如果我降价 10 美元,我会多卖出 20 件商品。”

  • 专家做法: 这意味着价格下降,销量上升。数学斜率为负。
  • AI 做法: ChatGPT 和 Gemini 有时会将此逻辑搞反。它们构建的模型显示,降低价格反而会导致销量下降,或者完全颠倒了这种关系。
  • 结果: 随后,它们在一个错误的模型上进行了完美的数学计算。这就像是在为一个不存在的目的地计算最快路径。论文指出,在商业问题中,AI 产生了一个“正斜率需求关系”,这在经济学上是荒谬的(暗示高价格会导致销量增加,这与问题本身相悖)。

2. “幽灵”起点(边界条件的追踪)
在物理学中,如果你从 140 英尺高的塔上扔下一个球,你必须记住这 140 英尺的高度。

  • 专家做法: 你在整个过程中都会将这个“140”保留在方程中。
  • AI 做法: ChatGPT 经常会忘记初始高度,或者将其设为零。这就像机器人看着掉落的球,看到它在下落,就断定:“哦,它一定是从地面开始的!”尽管你告诉它球是从塔上掉下来的。
  • 结果: 球何时落地时的最终答案是错误的,因为机器人解决的是一个与你提出的问题不同的问题。

3. 算术失误(验证与语境)
有时,设定过程没问题,但最后的数值计算出了错。

  • AI 做法: Gemini 在建立火箭方程方面表现良好,但在求解最终的二次公式(寻找时间的数学过程)时却栽了跟头。它有时还会加入一些无关紧要的关于重力的奇怪解释,而这些解释是不需要的。
  • 结果: 答案看起来似乎合情合理,但在数值上却站不住脚。论文强调,这些工具会产生“流畅但有缺陷的解释”,插入无关信息来分散对实际错误的注意力。

论文告诉你不应该做的事

研究人员非常明确地说明了不应该做什么。他们反对将这些 AI 工具作为“不容置疑的答案来源”。

  • 不要仅仅因为解题过程看起来很整洁且包含所有正确的公式就直接复制答案。
  • 不要假设仅仅因为 AI 听起来很自信,它就是正确的。
  • 不要认为如果最终数字看起来接近,整个过程就是有效的。

论文明确排除了这些工具可以取代人类在微积分领域判断力的观点。事实上,研究表明,如果不经检查就依赖它们是危险的,因为错误隐藏在“精美”的陈述之中。

我们有多确定?

作者们很谨慎,并没有称其为对所有 AI 的“最终判决”。他们承认这项研究是基于一小组特定的问题(商业、粒子运动和垂直运动)在 2026 年初进行的。他们认为这些错误模式在这些特定任务中是真实且可观察到的,但他们并不声称已经测量了 AI 可能面临的所有数学问题。

他们发现,这些工具表现出“部分的程序能力”(它们能完成步骤),但在建模和检查方面“可靠性较弱”。结论是一个强烈的建议,即我们需要改变数学教学方式:与其要求学生仅仅“得到答案”,不如教导他们成为数学审计员

新的游戏计划:成为侦探

那么,对于一个好奇的学生来说,结论是什么?

不要把 AI 当作神奇的预言机。把它当作一个文笔很好但逻辑思维很差的学生

  • 策略: 让 AI 解决一个问题,然后扮演侦探。
  • 任务: 找出机器人出错的第一个步骤。它是误解了故事?它忘记了初始高度?还是它搞砸了算术?
  • 目标: 修正错误并解释为什么 AI 是错的。

论文建议,这种“审计”方法能将 AI 从一份“作弊纸”转变为一种强大的学习工具。通过寻找机器人的错误,你实际上比自己单纯解题学到的数学知识要多得多。

简而言之,机器人在进行繁重的计算工作方面很擅长,但在理解故事方面却很糟糕。你必须是那个拿着地图、检查指南针,并确保他们不会在你要求盖小木屋时却意外造出一座城堡的人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →