LLM-Generated Design Problems for Assessing Higher-Order Thinking in Project-Based Learning
本研究提出将大语言模型生成的设计问题作为项目制计算教育中的一种补充性评估工具,旨在有效评估高阶思维与迁移能力,从而克服传统的评分局限性与教师工作量障碍。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在参加一门烹饪课,整个学期都在致力于掌握制作完美披萨的艺术。你学习揉面团、选择酱料,并将其烘烤至金黄。在学期结束时,老师通常根据你实际制作出的披萨来为你评分。但问题在于:仅仅能做出美味的披萨,并不意味着你真正理解了其中的原理,或者你是否能利用这些技能去烤一个蛋糕或修理一个坏掉的烤箱。你可能只是记住了制作披萨的步骤,或者得到了机器人厨师(比如 AI)的帮助,让它承担了繁重的体力活,而你只是在一旁观看。
这正是计算机科学教师在面对项目式学习 (Project-Based Learning, PjBL) 时所面临的难题。学生们构建了酷炫的软件项目,但传统的测试往往只能检查他们是否能够复制粘贴代码,或者针对他们构建的具体事物写一份报告。这些测试忽略了“高阶思维”(Higher-Order Thinking, HOT)——即将所学知识应用到全新的、棘手的情境中的能力。
新工具:“设计问题” (Design Problems)
为了解决这个问题,论文作者引入了一种被称为**“设计问题” (Design Problems, DPs)** 的方法。你可以把它想象成披萨课之后的“厨房挑战”。老师不再问:“展示你的披萨”,而是说:
“好了,想象一下,有一家医院需要一个系统来追踪老年患者的手指运动,以检测健康问题。利用你之前制作披社应用时使用的相同逻辑,为这个新系统设计一个高层级的方案。你有 30 分钟时间。”
这迫使学生停止机械地背诵事实,转而开始迁移他们的知识。他们必须分析、评估并创造出新的东西,从而证明他们真正理解了概念,而不只是写出了那个特定的代码。
机器人助手:AI 能编写这些问题吗?
编写这些复杂的、具有新情境的问题是一项艰巨的工作。为每个学生的项目发明一个全新的、契合的情境需要耗费大量时间。因此,研究人员提出了一个疑问:大型语言模型 (LLM)——一种超智能的 AI 聊天机器人——能否为我们编写这些问题?
他们通过测试两种不同的 AI 模型(一种是标准模型,另一种是能够进行逐步思考的“推理型”模型)来验证这一点,让它们基于四个不同的学生项目(如安全工具、分布式游戏和移动应用)生成了 80 个设计问题。
他们的发现如下:
- AI 表现相当出色: “推理型” AI 的表现尤其令人印象深刻。它创建的情境非常真实,且完美契合学习目标。事实上,50% 的 AI 生成的问题获得了人类专家的满分评价。
- AI 并非完美: 有时 AI 会偷懒。它会创建一个与原始项目过于相似的情境(比如在你已经做了披萨的情况下,又让你做一个披萨),或者会让问题变得过于笼统。
- 结论: 论文表明,AI 可以成为巨大的助力,充当一名不知疲倦的助手来起草问题,但人类教师仍需进行审核,以确保问题不会太简单或令人困惑。
课堂测试:学生真的掌握了吗?
研究人员随后将这些由 AI 编写的设计问题投入到三个真实的大学课堂中。他们给学生 30 分钟的时间,让他们独立解决其中一个新情境。
这里有一个转折:
当研究人员将学生在这些新设计问题上的成绩与他们在整个学期项目中取得的成绩进行对比时,两者之间几乎没有任何关联。
- 有些学生是“大师”:他们既精通项目,也通过了新挑战。
- 有些是“执行者”:他们构建了一个很棒的项目(可能是借助了帮助或遵循了某种“食谱”),但在面对新挑战时失败了,因为他们无法在其他地方应用其逻辑。
- 有些是“概念构建者”:他们在项目过程中表现挣扎,但在新挑战中却表现出色,因为他们理解了深层的概念。
这证明了传统的项目评分并不能说明全部情况。一个学生可以开发出一款优秀的 App,但仍然不知道如何像工程师一样在新的情境中进行思考。设计问题捕捉到了这种差异。
学生实际是如何思考的
研究人员还观察了学生的输入过程(使用击键数据)。他们发现学生并不是在疯狂地打字。
- 他们在开始时会停顿约 2 分钟,这可能是在进行思考和规划。
- 他们会删除并重写部分答案(每输入 100 个字符,大约会删除 12–16 个字符的“修订率”)。
- 他们会频繁地休息(停顿超过 10 秒)。
这种行为表明,学生实际上正在进行分析和综合想法的深度脑力劳动,而不是仅仅在进行复制粘贴。
本论文排除的情况
论文谨慎地说明了这种方法不是什么:
- 它不是一种可以取代所有其他测试的“万灵药”。
- 它不是在学生可以使用 AI 进行测试的情况下也能完美运作的方法(这就是为什么老师要求他们在课堂上完成,且不准使用手机)。
- 它不是一种根据学生花费时间长短来评分的方法;数据显示,花费更多时间并不一定会带来更好的成绩。
- 它目前还不是一个完美的系统;论文明确指出,对这些开放式答案进行评分仍然具有主观性,且在没有帮助的情况下难以规模化。
核心结论
这项研究表明,利用 AI 生成这些“设计问题”是一种极具前景的方法,可以用来检查学生是否真正理解了计算机科学的概念,而不仅仅是死记硬背如何构建某一个特定的东西。它帮助教师识别出哪些学生只是在“照着食谱做菜”,而哪些学生具备“烹饪全新佳肴”的能力。虽然 AI 并不完美且需要人类监督,但它可能是确保学生做好迎接现实世界准备的关键——因为现实世界中的问题永远不会与他们在课堂上练习过的完全一样。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。