A Tool-Invariant Framework for Teaching and Assessing Computational Methods in the Age of Agentic AI
本文提出了一个在智能体 AI 时代教授计算方法的工具无关框架,认为评估必须从评价代码创作能力转向通过无 AI 辅助的代码测试和口头答辩来验证学生解释并辩护计算人工制品的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
新型数学课:当计算器开始编写代码
想象一下你正在学习烹饪。几个世纪以来,烹饪最难的部分是切菜和搅拌锅里的东西。你必须学习刀工、掌握时机,并形成制作完美酱汁的肌肉记忆。但随后,有人发明了一个机器人厨师。这个机器人不仅会切菜,它还能读懂你用自然语言描述的食谱,切洋葱、搅拌酱汁、品尝味道,甚至能在味道太咸时进行修正。突然间,“烹饪”的行为发生了变化。你不再需要成为一名顶尖的用刀高手,你需要成为一名顶尖的“品尝者”和清晰的“指令发布者”。如果你只是说“做点好吃的”,机器人可能会做出一个看起来很诱人但实际上一团糟的作品。
这正是物理学和科学教育领域正在发生的事情。长期以来,学习“计算物理”意味着学习编写计算机代码——输入指令让计算机解决复杂的数学问题,比如预测行星如何运动或病毒如何传播。但一种新型的人工智能(AI)已经到来。它们不仅仅是回答问题的聊天机器人,而是“智能体”(agentic)工具。它们可以接收像“模拟具有空气阻力的弹跳球”这样简单的句子,然后编写代码、运行模拟、绘制图表,并修复自身的错误。
老师面临的一个重大问题是:如果机器人负责烹饪,那么学生需要学习什么?他们还需要学习如何“切菜”吗?如果机器人提交了一份看起来完美的报告,我们如何知道学生是否真的理解了“食谱”?本文探讨了这一确切的问题,认为旧的评分方式(仅仅看最终报告)已经失效,并提出了一种新的教学和测试方法,重点关注对“为什么”和“如何做”的理解,而非仅仅是打字。
论文的核心思想:从打字到思考
作者拉里·恩格尔哈特(Larry Engelhardt)认为,我们正在经历一场巨大的转变,类似于计算器取代算尺的时代。在过去,学生必须学习工具的“机械操作”:特定的命令、语法以及让计算机工作的打字技巧。现在,有了这些新的 AI 智能体,“机械操作”由机器处理。学生的角色已从“操作员”转变为“导演”。
论文指出,虽然工具发生了变化,但学生必须掌握的核心知识在几个世纪以来始终如一。恩格尔哈特将这些核心知识归纳为五个“支柱”,无论你是使用铅笔、计算器还是超级智能的 AI,这些支柱都保持不变:
- 输入与输出: 了解你向系统输入了什么,以及你期望得到什么。
- 概念理解: 了解该方法实际在做什么以及它是如何运作的,而不仅仅是知道如何输入代码。
- 术语: 使用正确的科学词汇来清晰地描述问题。
- 意义构建(Sensemaking): 能够观察结果并判断:“这合理”或“这看起来不对劲”。
- 操作工具: 使用当前工具的技能(过去是打字,现在是向 AI 提供清晰的指令)。
论文的主要发现是,在 AI 时代,最重要的技能变成了意义构建(支柱 4)。因为 AI 可以瞬间生成代码和图表,学生验证这些结果是否真实的能力现在成为了最关键的技能。作者称之为“验证权威”(verification authority)。仅仅因为 AI 说“这是答案”并不意味着它是正确的;学生必须担任裁判。
为什么旧的测试方式失效了
论文明确反对传统计算类课程的评分方式。几十年来,老师会布置一个项目:“编写代码模拟单摆,制作图表,并提交报告。”其假设是,如果学生提交了一份运行正常的报告,他们就一定理解了物理学。
恩格尔哈特表示,这已不再成立。他称之为“代理崩溃”(proxy collapse)。“代理”是其他事物的代名词。报告曾是学生理解能力的代名词。但现在,由于 AI 可以根据需求生成完美的报告,报告不再能证明学生掌握了任何知识。这就像如果一个学生提交了一篇由著名作家撰写的完美文章;文章很好,但它不能证明学生具备写作能力。论文认为,我们必须停止将“人工制品”(代码或图表)视为学习的证明。
新的解决方案:“口头答辩”
那么,如果我们无法信任作业,该如何测试学生呢?论文提出了一个针对物理学教学中常见的这类小型课堂设计的两部分实用系统:
- 无 AI 测验: 学生仍需参加课堂上的短时编程测验,且不能使用 AI。这确保了他们没有丧失代码运作的基本“肌肉记忆”。他们可能会被要求修复一段损坏的代码,或者从头编写一个小函数。
- 口头答辩: 这是全新的核心想法。在学生利用 AI 协助完成项目后,他们必须与老师进行一次 10 分钟的谈话。
- 转折点: 在会面前,老师会使用工具将学生提交的内容中的所有注释(解释代码的笔记)全部删除。
- 测试内容: 老师要求学生讲解他们自己的代码,解释图表的含义,并回答诸如“你为什么选择这种方法?”或“如果我们把质量增加一倍会发生什么?”之类的问题。
- 守门员: 存在一个特定的“验证关卡”。学生必须证明他们检查过自己的工作。如果他们无法解释结果为什么是正确的,即使代码运行完美,也会不及格。
作者认为,口头答辩是证明学生真正“拥有”这项工作的唯一途径。这类似于博士生进行论文答辩;评分的标准不仅在于写作,更在于学生在现场解释和捍卫其成果的能力。
论文说了什么(以及没说什么)
论文谨慎地指出,这是一个基于作者经验和适应性调整的新框架,而非基于大规模、长期的科学研究结果。作者承认,我们目前还不知道在转向 AI 之前,进行编程练习的完美“剂量”是多少。他们建议学生仍然需要至少一次看到“白盒”(透明运行的代码)的过程,以建立心理模型,但他们并不确定究竟需要多少。
论文也排除了仅仅通过“禁止”AI 来解决问题的想法。作者认为,试图阻止学生在家里使用 AI,就像试图阻止他们使用计算器一样,这是不可能的。相反,重点必须放在动机和评估设计上,使使用 AI 成为一种“正确”的学习方式,而非“作弊”的捷径。
总结
论文得出结论:计算物理课程的“产物”不再是代码或图表。这些东西现在既廉价又容易获得。真正的产物是学生利用物理语言解释并捍卫结果的能力。
在一个机器可以承担繁重工作的世界里,人类的价值在于判断力。论文指出,教学的未来不在于阻止机器人编写代码,而在于教导学生如何成为一名聪明的、具有批判性的“导演”,让他们清楚地知道机器正在做什么、为什么要这样做,以及答案是否真实。学生与老师之间的对话成为了课堂中最重要的部分,因为那是唯一可以证明真正理解的地方。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。