Using an LLM to Investigate Students' Explanations on Conceptual Physics Questions
本研究证明,大型语言模型能够有效且准确地扩展对学生书面物理解释的评估,从而揭示出传统选择题格式未能捕捉到的更深层次的误解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位老师,正在批改一个拥有超过 1000 名学生的庞大物理班级。你不仅想知道他们是否答对了,还想了解他们为何这样思考。传统上,你不得不给他们做选择题测试,因为这是快速批改 1000 份试卷的唯一方法。但选择题测试就像一扇上锁的门:它们只能告诉你学生能否选对钥匙,却无法展示学生是如何尝试开锁的。他们可能靠猜选对了钥匙,也可能使用了完全错误的方法,却恰好通向那扇正确的门。
本文探讨的是利用一种名为“大语言模型(LLM)”的新型“数字助手”,特别是名为 GPT-4o 的人工智能版本,来尝试打开这扇门。
实验:将门换成窗
研究人员采用了一项标准的物理测试,名为“能量与动量概念调查”(EMCS)。通常,这项测试是选择题形式。在本研究中,他们选取了三道学生历史上一直感到困难的具体题目,并将它们改成了论述题。
学生不再需要圈选"A、B、C 或 D",而是必须按照特定步骤写出答案:
- 主张:你的答案是什么?
- 证据:你有哪些事实依据?
- 推理:这些事实如何证明你的答案?
这就像要求学生不仅说出“这辆车很快”,还要解释:“这辆车很快,因为引擎动力强劲(证据),而动力产生速度(推理)。”
测试:人类与机器
研究人员希望看看人工智能能否像人类教师一样给这些论述题打分。
- 人类评分员:一位真正的物理专家随机抽取并阅读了 231 份答卷。
- 人工智能评分员:大语言模型阅读了全部 1131 份答卷。
结果:人工智能与人类几乎完全一致。它们仅在判断学生是“正确”还是“错误”时,有约 0% 到 3% 的时间存在分歧。这就像你请两位不同的厨师品尝同一碗汤并评价其咸淡,他们会给出几乎相同的分数。研究人员得出结论,人工智能是一种可靠的“数字评分员”,能够处理庞大班级的阅卷工作量而不会感到疲惫。
重大发现:寻找隐藏线索
这里才是本文真正有趣的地方。研究人员要求人工智能做选择题测试无法做到的一件事:对错误进行分类。
当学生在选择题中答错时,他们只是选错了选项(即“干扰项”)。试题设计者假设该错误选项代表某种特定的误解。但人工智能通过阅读论述题发现,学生犯的错误是试题设计者从未想到的。
类比:
想象一名侦探在寻找窃贼。
- 选择题测试就像让三名嫌疑人站成一排。侦探选中了一个,但也许真正的窃贼根本不在名单上。
- 人工智能分析则像侦探阅读窃贼的日记。日记揭示了窃贼正在思考完全不同的罪行,或者使用了一种侦探从未知晓的工具。
论文中的真实案例:
- 第 5 题:选择题选项暗示学生混淆了“动量”或“牛顿定律”。然而,人工智能发现许多学生实际上对碰撞类型(弹性与非弹性)感到困惑,而这是测试从未询问过的方面。他们以选择题选项无法捕捉的方式,混淆了“反弹”和“粘连”等概念。
- 第 16 题和第 23 题:人工智能发现,有些学生虽然得出了正确的最终答案,但使用了完全错误的逻辑来推导。在选择题测试中,这些学生会得到“正确”的分数。然而,人工智能识别出他们的推理存在缺陷(例如使用了错误的物理原理),并将其标记为“误用”。
核心结论
该论文提出了两个主要观点:
- 可靠性:人工智能给物理论述题打分的准确度可与人类教师媲美,这使得在不耗尽工作人员精力的情况下,为庞大班级批改书面解释成为可能。
- 深度:人工智能能够揭示选择题测试所遗漏的“隐藏”误解。它就像一台显微镜,向教育工作者展示学生思考物理的具体、杂乱的方式,而不仅仅是一个简单的“对/错”分数。
研究人员谨慎地指出,他们仅在三道题目和特定学生群体上进行了测试。他们并未声称这能解决所有教育问题,但他们已证明,这位“数字助手”能够看到“选择题之门”所遮蔽的事物。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。