← 最新论文
🔬 physics

Using LLMs to Detect Growth in Computational Thinking in Introductory Physics

本研究表明,大型语言模型能够通过模拟人类对数据实践和问题解决类书面解释的评估,有效地规模化评估入门级物理课程中学生计算思维的成长情况,尽管这两种方法在可靠评估诸如系统思维等复杂构念方面都面临挑战。

原作者: Sean Savage, Anand Shanker, Grace Michlitsch, N. Sanjay Rebello

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Sean Savage, Anand Shanker, Grace Michlitsch, N. Sanjay Rebello

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,物理学的世界不仅仅是黑板上的一堆公式,而是一个宏大的、交互式的电子游戏,其中的自然法则就是游戏的底层代码。几十年来,教师们一直试图让学生不再仅仅是死记硬背规则,而是开始亲自编写代码。这种技能被称为“计算思维”(Computational Thinking)。它不仅仅是关于打字速度快慢或了解计算机语法,而是关于如何将一个巨大的、混乱的现实世界问题(比如一场车祸或一颗行星的轨道)拆解成计算机能够理解的微小、逻辑化的步骤。这就像是一个同时精通“人类语言”和“机器语言”的翻译官,思考如何描述一个掉落的苹果,以便让机器人能够精准预测它的落点。

教育工作者面临的一个重大问题是:我们如何知道学生是否真的在提升这种“翻译”能力?传统上,教师使用选择题进行测试,这种方式易于评分,却无法展示学生的思维过程。要观察真实的思维,学生必须用文字写出答案。但问题在于:阅读数百篇手写论文既耗时、缓慢又昂ó。这就像是在时钟滴答作响的过程中,试图靠手工去批改一百万篇论文。现在,一种新型的“超级阅读者”出现了:人工智能(AI),特别是大语言模型(LLMs)。这些就是那些能写故事或与你聊天的聪明计算机。一个迫切的问题是:这些 AI 机器人能否像人类教师一样,识别出学生思维能力的成长,而且不需要喝咖啡休息?

这篇由普渡大学研究人员撰写的论文,旨在回答这个问题。他们想看看 AI 是否可以作为一个庞大且不知疲倦的助教,来追踪学生在一个学期内计算思维的成长过程。他们不仅要求 AI 进行评分,还要求它寻找学生写作中的特定“超能力”:他们能否处理数据?他们能否拆解问题?他们能否理解复杂的系统是如何协同工作的?

为了测试这一点,研究人员在物理课中收集了 936 名学生的数据,在这门课中,学生们学习使用 Python 进行编程。在课程开始前和结束时,学生们针对物理问题回答了开放式问题,例如解释一个弹跳弹簧的图表,或设计一个雪橇滑下山坡的模拟实验。首先,一个专家团队阅读了一小部分这些论文,并根据严格的评分标准给出了分数。这建立了一个关于“人类认为什么是好答案”的“金标准”。随后,他们将完全相同的论文输入到一个 AI 模型(具体为 GPT-4o-mini 的多模态版本)中,并要求该模型使用相同的规则进行评分。

结果非常令人振奋。AI 表现得像是一个非常称职的助手。对于一些定义明确的技能,如处理数据(数据实践)和拆解代码步骤(计算问题解决),AI 的评分与人类专家的评分几乎完美契合。当研究人员观察这 936 名学生的整体情况时,AI 成功捕捉到了人类发现的相同大趋势:到学期结束时,学生在处理数据和解决计算问题方面的能力有了显著提升。事实上,AI 证实了学生在这些领域取得了巨大的飞跃,其中数据技能的进步尤为显著。

然而,这个故事并非一个完美的“AI 完胜”的故事。研究人员发现,人类和 AI 在处理最复杂的技能——“系统思维”(Systems Thinking)时都遇到了困难。这是一种观察系统中的所有微小部分如何相互作用从而创造出宏观图景的能力。由于这个概念非常模糊且难以界定,甚至连人类专家之间有时也会产生分歧,而 AI 在匹配人类专家方面也遇到了挑战。这篇论文表明,AI 在这里并不是“笨”,而是这项任务本身就很难被清晰地定义。

此外,关于设计雪橇模拟实验的一个特定问题还出现了一个有趣的转折。学生在课程开始前就已经在这个主题上表现得非常出色了,以至于他们无法进一步提升。这就像是要求一位专业厨师提高刀工,而他使用的已经是世界上最锋利的刀具了。分数触及了“天花板”,这意味着没有空间来衡量增长,而 AI 也正确地识别出那里并没有发生进步。

最后,这项研究表明,AI 是检查学生如何学习成为计算物理学家的一个可行且强大的工具。它可以规模化地阅读数千篇论文,并发现与人类相同的模式,从而让教师免于淹没在文书工作中。但它同时也提醒我们,AI 的表现取决于我们赋予它的规则。对于那些即使是人类也会产生分歧的、复杂且混乱的思维领域,我们仍然需要细致的设计和人类的监督。AI 并不是在取代教师;它是在为教师递上一把“超级放大镜”,让他们能够看清正在发生的成长。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →