← 最新论文
💻 computer science

Automated Scoring of Handwritten Mathematical Problem Posing Using Large Language Models

本研究表明,在使用带有结构化评分标准的零样本提示方法时,大型语言模型 Gemini 3.5 Flash 在处理经修订 OCR 文本输入的初中手写数学命题任务时,能够实现可靠的自动化评分,尤其是在处理整数问题时。

原作者: Tuğrul Kar, Tarık Kışla, Muhammed Ali Kayici, Burak Aydın

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Tuğrul Kar, Tarık Kışla, Muhammed Ali Kayici, Burak Aydın

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位面对堆积如山的作业需要批改的老师。你深知,让学生们亲自“创造”数学题是学习的一种超能力——这能培养创造力和深度理解力。但批改这些具有创造性的手写答案却是一场噩梦。每个学生的写法都不一样,有些人编造了不可能出现的场景,有些人写的则是乱七八糟的内容。这非常耗时,甚至连人类老师对于什么是“好的”题目也会产生分歧。这正是人工智能(AI)可以介入的地方,它承诺成为一名不知疲倦的阅卷助手。但问题在于:AI 擅长阅读印刷文本,但它真的能理解凌乱的手写数学涂鸦,并分辨出这是一个精彩的学生提问还是一个混乱的废堆吗?这个问题处于教育学与计算机科学的交汇点,探讨机器是否能学会像数学老师那样去“思考”,从而评估学生的创造力。

这项研究的研究人员决定对一个非常聪明的 AI——名为 Gemini 3.5 Flash 进行测试。他们想看看这个 AI 是否能够阅读 235 名中学生创作的手写数学题,并像人类老师一样准确地进行评分。为此,他们设置了一个包含两种不同情境的“口味测试”:一种涉及整数(比如行驶距离),另一种涉及分数(比如分享蛋糕)。他们给了 AI 两个版本的同一段手写文本:一个是直接由计算机“眼睛”读取的版本(由于手写潦草,有时会出错),另一个是由专家仔细修正过的版本。他们还尝试以两种不同的顺序向 AI 提供评分规则——是从低分到高分,还是从高分到低分——以观察指令的顺序是否会改变 AI 的判断。

研究结果喜忧参半。研究发现,当 AI 使用专家修正后的文本时,它与人类老师的一致性比使用原始、混乱的计算机读取文本时要高得多。然而,数学题的类型非常重要。在处理关于整数的问题(驾驶任务)时,AI 的准确度远高于处理关于分数的问题(蛋糕任务)。看起来 AI 在处理分数的细微差别方面表现得更为吃力,它经常给那些虽然数学上正确、但并不符合学生所讲述的故事背景的答案打高分。有趣的是,向 AI 呈现评分规则的顺序完全没有影响;无论 AI 是从底部开始还是从顶部开始查看评分标准,其表现都保持不变。

简而言之,这项研究表明,AI 可以成为批改手写数学题的可靠助手,但它目前还不完美。它在处理清晰的手写体和涉及整数的数学题时表现最好。研究人员发现,仅仅通过提供更好的文本(即让人类修正计算机的读取错误)就能带来显著的改善,但 AI 在理解数学背后的“故事”方面仍然需要帮助,尤其是在涉及分数时。虽然 AI 不会被指令的顺序所迷惑,但它确实会被数学内容的复杂性所难倒。作者得出结论,虽然 AI 具有巨大的潜力来帮助教师,但我们需要谨慎使用它,特别是在处理像分数这样复杂的课题时,并且我们应该始终在计算机开始评分之前,先检查它是否正确读取了学生的手写内容。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →