AI-based scoring systematically underestimates conceptual understanding of linguistically weak students' explanations in physics
这项研究揭示了基于人工智能的评分系统系统性地低估了语言能力较弱的物理专业学生的概念理解能力,这种语言偏见反映了人类专家的倾向,并对高风险评估中的多语言学习者构成了重大风险。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜题的侦探,谜题是:“这个学生真的理解宇宙是如何运作的吗?”你手里唯一的线索只是一张手写便条。这正是物理老师的日常现实:他们无法窥视学生的大脑内部去观察其中的齿轮是如何运转的;他们只能通过学生书写的文字来判断其理解程度。但问题的关键在于:写作本身就是一种独立的技能。一个学生可能对声音如何穿过墙壁有着深刻且稳固的理解,却因为句子笨拙或词汇量有限而无法解释清楚。相反,一个学生可能会写出一篇文笔优美、听起来很有深度,但实际上却满是谬误的文章。几十年来,专家们一直知道人类教师有时会被这种情况所迷惑,从而在无意中给那些仅仅是不擅长写作、但精通物理知识的学生打出较低的分数。
现在,新一代侦探登场了:人工智能。学校开始使用人工智能来批改这些文章,因为它们速度快、一致性高且不会感到疲劳。但一个大问题悬在教室上空:人工智能是否比人类教师更能分辨出“聪明的想法”与“糟糕的写作”?如果人工智能像疲惫的老师一样容易被语法问题所误导,那么我们可能正在构建一种不公平的评分系统,它会惩罚那些仍在学习科学语言的学生,将他们的沉默或结巴误认为是智力不足。这正是德国的一个研究小组决定解决的谜题。
研究人员设计了一个大规模实验,旨在观察人工智能是否能够区分“不理解物理的学生”和“理解物理但写作水平较低的学生”。他们收集了来自德国九年级学生的116篇论文。学生们需要解释一个太空行走的情景:为什么宇航员在真空的太空中无法听到彼此的喊叫声,但如果他们把头盔靠在一起,就能听到彼此的声音?
首先,人类专家对这些论文进行了两次评分。一次是针对“概念理解”(他们是否掌握了正确的物理知识?);另一次是针对“语言质量”(德语语法和词汇是否优秀?)。这创造了一个完美的对照组,其中“聪明程度”和“写作技巧”是被独立测量的。
随后,他们将这些论文输入到九个不同的AI“大脑”中。其中一些是传统的机器学习模型(即通过阅读成千上上万篇已评分论文进行学习的旧式AI),另一些则是大语言模型(即类似于背后驱动聊天机器人的那种能够推理并遵循指令的高级AI)。AI的任务很简单:观察文章并猜测其“概念理解”得分。
结果令人警醒。AI通常能胜任工作,与人类专家的意见一致率在67%到78%之间。然而,当研究人员进行深入观察时,一个明显的模式出现了。AI存在一个系统性的盲点。当学生写的解释语言质量较低(句子笨拙、用词简单)时,AI极有可能低估他们的理解程度。换句话说,AI看到一个拥有出色想法但写作混乱的学生时,会认为:“这个学生不懂物理,”从而给出比人类专家更低的分数。
有趣的是,相反的情况并不经常发生。如果一个学生文笔优美但物理观点薄弱,AI并不会一致地高估其分数。这种偏差专门针对写作能力差的情况。无论是在传统机器学习模型还是在最前沿的大语言模型中,这种情况都普遍存在。无论使用哪种“大脑”,它们似乎都难以透过杂乱的文字去发现聪明的想法。
研究人员发现,对于写作质量每下降一个等级,AI低估学生物理知识的可能性就会增加约1.3到近4倍。这表明问题不仅仅是某个特定AI代码的故障。相反,这似乎是任务本身的一种根本性困难。因为我们只能通过语言来观察学生的思想,所以要分辨出语言表达不好是因为“想法不好”,还是仅仅因为“作者还在学习如何表达自己”,这对即使是超级智能的计算机来说也是极其困难的。
研究结论指出,虽然人工智能是一个强大的工具,但它目前带有人类教师多年来一直面临的“语言偏见”。它倾向于将词汇量的匮乏误认为理解能力的缺失。对于那些正在使用非母语学习物理的学生来说,这是一个严重的问题。如果学校开始使用这些AI系统来进行高风险决策(例如期末考试成绩),而又不解决这种偏差,它们就有可能系统性地惩罚多语言学习者,将他们在语言上的挣扎误读为在科学上的挣扎。该论文建议,在能够构建出真正对这些语言差异具有鲁棒性的AI之前,我们需要非常谨慎地使用它,或许可以将其作为一种辅助工具,而非最终的裁判。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。