← 最新论文
💬 NLP

Automated Knowledge Component Generation for Interpretable Knowledge Tracing in Coding Problems

本文介绍了 KCGen-KT,这是一个基于大型语言模型的自动化流程,用于为开放式编程问题生成并标注知识组件,并通过广泛评估证明,这些由人工智能生成的组件在预测学生表现和建模学习曲线方面优于传统的人工编写组件。

原作者: Zhangqi Duan, Nigel Fernandez, Arun Balajiee Lekshmi Narayanan, Mohammad Hassany, Rafaella Sampaio de Alencar, Peter Brusilovsky, Bita Akram, Andrew Lan

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhangqi Duan, Nigel Fernandez, Arun Balajiee Lekshmi Narayanan, Mohammad Hassany, Rafaella Sampaio de Alencar, Peter Brusilovsky, Bita Akram, Andrew Lan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位老师,正试图弄清楚学生在编程课上究竟哪里遇到了困难。在过去,你必须手动列出一份具体技能清单(例如“知道如何使用循环”或“理解如何相加”),然后逐一检查每一份作业,标记出每道题考察了哪些技能。这就像图书管理员为大型图书馆中的每一本书手动编写卡片目录:耗时极长、容易出错,而且极其枯燥。

本文介绍了一种利用人工智能(具体而言是大语言模型,即 LLMs)的新颖自动化方法,但有一个关键转折:它适用于开放式编程问题,即学生从头编写自己的代码,而不仅仅是从多项选择题列表中挑选答案。

以下是他们所做工作的简要说明,辅以简单的类比:

1. 问题:“开放式”的混乱

在多项选择题中,通常只有一个正确答案,因此很容易推断出考察的是哪项技能。但在编程中,学生可以用十种不同的方式解决同一个问题。一名学生可能使用“for 循环”,而另一名学生则使用“正则表达式”。两者都得出了正确答案,但运用的技能却不同。

  • 类比:想象你让人们搭建一个鸟屋。如果你给他们做多项选择题测验,你就能确切知道他们学到了什么。但如果你让他们去搭建它,一个人可能用锤子和钉子,另一个人则用胶水和木头。仅通过观察成品鸟屋,要准确判断每个人具体使用了哪些技能,是非常困难的。

2. 解决方案:AI“技能侦探”

作者构建了一个三步自动化流程,充当“技能侦探”的角色:

  • 第一步:调查(生成):他们将编程题目和大量不同的学生解决方案(包括正确和错误的)输入给 AI。AI 像侦探一样阅读代码,并指出:“啊,要解决这个问题,你需要知道如何使用‘条件语句(If statement)’以及如何‘进行绝对值运算’。”它会生成一份技能清单(称为知识组件,即 KCs)。
  • 第二步:分拣帽(聚类):AI 可能会为同一项技能生成 100 个略有不同的名称(例如"If-Else"、“条件逻辑”、“决策制定”)。该系统将这些相似的概念归为一组,就像把一堆混杂的袜子按配对整理一样。
  • 第三步:标签制作器(总结):最后,AI 审视每一组相似的技能,并为它们赋予一个清晰、人类可读的名称(例如“条件逻辑”)。随后,它用这些新的、规范的标签为每道题目进行标记。

3. 结果:更智能的辅导系统(KCGen-KT)

一旦 AI 获得了这些技能标签,研究人员便构建了一个新的“知识追踪”系统(一种追踪学生学习进展的方法),称为KCGen-KT

  • 工作原理:该系统不再仅仅猜测学生下一题会做对还是做错,而是审视学生在特定技能上的历史表现。它会问:“这名学生在‘循环’方面是否挣扎,但在‘变量’方面却表现优异?”
  • 神奇之处:该系统将学生的技能水平转化为 AI 可以读取的“软标记”(soft token,一种数字信号)。这使得 AI 不仅能预测学生是否会失败,还能预测他们下一段代码会是什么样子

4. 验证:它奏效了吗?

研究人员在两个包含数千份学生编程提交记录的真实数据集上测试了该方法(一个是 Java,一个是 Python)。

  • 优于人类:令人惊讶的是,AI 生成的技能标签在预测学生表现方面,实际上比人类专家编写的标签更准确
  • 优于旧 AI:新系统击败了此前未使用这些特定技能标签的最先进 AI 模型。
  • “学习曲线”检查:他们验证了该系统是否符合“练习定律”(即人们练习得越多,表现就越好)。AI 生成的技能显示出清晰的模式:随着学生练习特定技能的次数增加,他们的错误率随之下降。这证明了 AI 识别出了真实且有意义的技能。
  • 人类认可:当研究人员将 AI 的工作成果展示给实际的计算机科学教师时,教师们一致认为 AI 生成的技能描述清晰、易懂且准确。

总结

简而言之,这篇论文指出:“我们教会了 AI 自动识别学生在编程作业中具体使用了哪些技能。随后,我们利用这些 AI 生成的技能标签,构建了一个更智能的系统,用于预测学生未来的表现。它的效果优于人类专家,也优于以往的 AI 方法,并以一种清晰、可解释的方式帮助我们理解学生的学习情况。”

他们声称的内容

  • 他们并未声称这将取代教师;他们明确指出其目的是支持教师。
  • 他们尚未在数学或科学问题上测试此方法(仅限于编程)。
  • 他们并未声称它是完美的;他们指出,由于 AI 是逐个分析问题的,有时会遗漏跨题目共享的技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →