From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation
本文引入了一种随机学生知识图谱(SSKG)框架,该框架通过将答案正确性与生成过程解耦,克服了标准大语言模型倾向于默认高掌握度的倾向,从而能够忠实地模拟多样化的学生熟练程度并呈现清晰的掌握梯度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在教育领域,准确了解一名学生掌握了什么以及他们在哪里遇到困难,是有效教学的关键。几十年来,研究人员一直试图构建能够模拟学生思维的计算机模型,从而创建合成数据,用于在真实的教学系统接触到真实学生之前,测试新的辅导系统或训练人工智能。其希望是在无需承担招募真实课堂所带来的时间、成本和伦理障碍的情况下,生成数以千计的现实练习场景。最近,强大的语言模型作为这项任务的一个极具前景的工具脱颖而出。这些就是那些能够写论文、解决复杂逻辑谜题并用简单语言解释深奥概念的同类人工智能。其核心想法是只需要求计算机“扮演一名挣扎中的学生”并让它生成答案。然而,一个根本性的问题一直存在:这些模型太聪明了,以至于它们很难轻易地假装变笨。当被要求模拟一名知识匮乏的学生时,计算机往往会忽略指令并照常给出正确答案,因为其内在知识过于强大,无法仅通过简单的请求就被抑制。
德雷克塞尔大学(Drexel University)的一个研究小组致力于解决这个“虚假挣扎”的问题。他们想要创建一个模拟环境,使人工智能学生的表现能随着其知识量的减少而以一种可预测、现实的方式下降,而不是无论指令如何都保持完美。为了实现这一目标,他们不再要求计算机去猜测学生会如何表现,而是构建了一个关于学科本身的详细地图。他们采用了一本公开的代数教科书,将其分解为数千个微小且具体的知识点和步骤,创建了一个结构化的知识网络。随后,他们为这些微小的步骤分配了一个成功概率。如果一名学生有 20% 的概率掌握某个特定事实,模拟系统就会随机决定他们是否掌握了该事实,就像真实的人在压力下可能会忘记某个细节一样。
研究人员使用来自 SAT(一种用于评估大学准备情况的标准考试)的 379 道代数题测试了这种新方法。他们首先尝试了传统方法,即向三种不同的大型语言模型发出指令,让它们分别扮演不同水平的学生,从接近专家到严重挣扎的学生。结果非常悬殊。无论计算机被告知是天才还是新手,它回答问题的正确率都在 96.8% 到 100% 之间。这些模型实际上是在忽略“表现糟糕”的指令。模拟无法区分一个无所不知的天才和一个几乎一无所知的初学者。
为了修复这个问题,研究人员引入了一个新系统,将“判断答案是否正确”与“解释原因”这两个环节分离开来。首先,系统会查看解决数学问题所需的特定事实链。它会将模拟学生的知识图谱与这条链进行比对。如果学生应该在某个特定概念上遇到困难,系统就会通过一个简单的数学过程(而非由语言模型决定)随机判定学生在该特定步骤上失败。只有在系统已经决定了答案的正误以及导致错误的具体步骤后,才会要求语言模型编写解释。随后,模型会被指示根据预先确定的结果来叙述一段第一人称的故事。如果系统判定学生是因为忘记了单位换算而失败,模型就会写一段关于这种困惑的故事;如果系统判定学生成功了,模型则会写一段自信的解释。
这种新方法的实验结果与传统方法完全相反。在使用新系统时,模拟学生的准确率呈现出平滑且逻辑清晰的梯度下降。 “接近专家”的学生答对约 85% 的题目,而“挣扎中”的学生仅答对约 44%。至关重要的是,这些错误并非随机产生的。当研究人员为一名“擅长早期代数但对高级主题较弱”的学生创建画像时,模拟显示他们在需要高级知识的问题上确实出现了失败。同样,对于一个基础知识有漏洞的学生,模拟显示他们在基础问题上失败了。该系统甚至可以将每一个错题追溯到学生遗漏的那个极其微小的知识点,提供了在真实课堂数据中难以获得的诊断细节。
研究人员还测试了该系统的不同层级,以观察哪些部分最为关键。他们发现,仅仅告诉计算机忘记某些事实是不够的;系统需要理解某些事实比其他事实更为关键。例如,忘记一个词汇定义不一定会导致学生在整个题目上失败,但错过一个操作步骤则可能如此。通过为这些不同类型的知识赋予权重,模拟变得更加真实。他们还发现,该系统可以生成符合常见学生错误特征的具体错误答案,而不是仅仅随机选择一个错误选项。这使得模拟不仅能产生一个分数,还能生成一张关于学生思维运作方式的详细地图,展示其理解过程中的裂痕究竟在哪里。
这项工作表明,要真正模拟人类学习,我们不能依赖人工智能去猜测学生是如何思考的。相反,我们必须建立一个框架,明确地对知识结构和人类错误的随机性进行建模。通过将模拟植根于课程地图,并让随机性来决定每一步的结果,研究人员创造了一个能够生成大量现实且具有诊断意义的数据的工具。这可以帮助教育工作者和开发者测试新的教学方法并构建更好的辅导系统,确保这些系统在进入充满变数且不可预测的人类课堂之前,已经做好了应对现实挑战的准备。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。