Revisiting the Performance of Generative Artificial Intelligence on Introductory Object-Oriented Programming Assessments: Insights from 2026
这项2026年的研究评估了五种先进的生成式人工智能系统在入门级面向对象编程评估中的表现,发现虽然它们普遍优于平均水平的学生并较前一年有显著进步,但在处理接口、抽象类等特定高级概念以及图形相关任务时仍然存在困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在年轻人初次学习构建软件的课堂上,一种新型的助手已经到来。它们不是人类导师,而是大型语言模型:这些计算机程序经过海量文本和代码库的训练,能够阅读问题并在其后编写程序。多年来,教育工作者一直观察着这些工具的演变,思考它们是真的理解了编程逻辑,还是仅仅在模仿模式。这个问题至关重要,因为编程通常是通过一种被称为“面向对象编程”的特定风格来教授的,在这种风格中,代码被组织成自包含的单元,这些单元既持有数据又执行动作,就像现实世界中的物体既有属性又有行为一样。如果这些人工系统能够解决与学生相同的问题,那么这将改变我们教学、测试以及思考编程学习未来的方式。
爱沙尼亚塔尔图大学的研究人员决定在真实的大学环境中对五种最流行的人工智能系统进行测试。他们并没有要求机器解决抽象谜题或在真空中编写代码。相反,他们直接将用于一年级入门课程的完全相同的编程测试和期末考试题目喂给了这些机器。任务是用当地语言爱沙尼亚语编写的,研究人员没有给系统任何特殊的指令或提示。他们只是要求机器像学生一样解决问题,并使用教师应用于人类作品的相同评分规则。目标是看这些工具是否能跟上平均水平的学生,更重要的是,看它们在哪些地方仍然会跌倒。
结果显示,人工智能系统表现得非常出色,经常超越与之对比的人类学生。在第一个要求构建包含多个部分的完整程序的编程测试中,除了一个系统外,所有系统的得分都高于平均水平的学生。其中一个集成在 Microsoft Office 中的工具,由于一个小小的语法错误,在一次实例中未能生成可运行的程序,但其他系统一致获得了高分。在第二个涉及更复杂数据处理的稍难测试中,机器再次占据优势,大多数系统取得了完美或接近完美的成绩。甚至在涵盖整个课程并包含棘手概念性问题的期末考试中,机器的得分通常也远高于班级平均水平。
然而,机器并非完美无缺,它们的错误揭示了其理解仍处于浅层阶段。虽然它们可以编写长且复杂的程序且运行不崩溃,但有时会忽略人类教师会捕捉到的特定细节。例如,有些系统未能正确格式化文本,或者忘记包含使代码运行所必需的一条指令,导致程序停止运行。它们在某些高级概念上也表现挣扎,例如程序的不同部分如何通过被称为“接口”的特定规则进行通信。在这些领域,机器有时会生成看起来正确但实际上并未按题目要求执行的代码。此外,研究指出,在涉及图像解释的图形相关问题上,性能受到了限制,这反映了人工智能在处理非文本信息方面面临的普遍挑战。
研究人员发现,与仅一年前的评估相比,这些系统有了显著的进步。在旧版本的工具可能无法通过课程的情况下,新的模型现在能够稳定地处于学生表现的高端水平。然而,一个清晰的模式出现了:机器擅长遵循指令构建标准结构,但在任务需要对系统中不同部分如何从概念上结合在一起进行深度推理时,可能会出错。它们经常添加未被要求的额外功能,或使用学生尚未学过的先进技术,这表明它们正从一个广泛得多的知识库中汲取营养。
最终,这项研究描绘了一幅工具虽强大但尚未完全能满足每种教育需求的图景。人工智能系统可以生成经常超越平均水平学生的可用代码,证明它们已经掌握了编程的机制。但它们仍然会犯一些特定的、反复出现的错误,这表明它们缺乏对底层逻辑的真正理解。对于教育工作者而言,这意味着虽然这些工具可以用于支持学习,但它们还不能取代人类监督的需求,也不能取代对那些旨在测试深度概念理解而非仅仅是编写代码能力的评估设计。机器每年都在变得更好,但在真正像程序员一样思考之前,它们还有很长的路要走。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。