LLM Pedagogical Behavior in AI Tutoring Interactions
本研究引入了一个经过验证的五级支架式教学量表来分析超过14,000条大语言模型(LLM)辅导回复,揭示了人工智能模型过度提供直接协助(解释或解答)而非引导式支持,这种行为模式虽然影响了学生的对话,但除了先前的成就之外,对考试成绩的预测价值有限。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在大学计算机实验室静谧的嗡鸣声中,一种新型的辅导方式已然扎根,它从不睡觉,从不疲倦,也从不评判。学生们越来越多地转向大语言模型——这些在海量文本上训练出的强大计算机程序——来帮助他们解决作业问题并理解困难的概念。这些数字助手能做很多事情,但在学习的语境下,存在着一种根本性的张力。如果导师提供的帮助太少,学生可能会陷入困境并选择放弃;如果导师提供的帮助太多,学生可能只是单纯地复制答案,而从未学会如何独立思考问题。这种平衡是核心挑战所在:寻找恰到好处的支持,以引导学习者,而不是替他们完成工作。研究人员长期以来一直在研究人类教师是如何驾驭这一空间的,但对于这些新型自动化导师在学生进行真实的、非脚本化学习时表现如何,目前仍不明确。
来自韩国韩国科学技术院(KAIST)的一个研究小组致力于绘制这片未知的领域。他们分析了在一门人工智能入门课程中,学生与人工智能导师之间的大规模对话记录。学生可以自由地请求任何帮助,从一个简单的提示到一个完整的解决方案,而计算机则根据其默认编程进行响应,即仅仅作为一个乐于助人的助手。研究人员想要确切知道计算机实际上提供了什么样的帮助。为了衡量这一点,他们创建了一个五级量表来对计算机做出的每一个响应进行分类。在最低端,计算机可能完全不提供实质性帮助,或者只是要求学生再多思考一下。在中端,它可能会指出一个相关的概念或一个具体的错误,而不解决问题本身。在最高端,它会详细解释一种方法,或者为学生特定的任务提供完整的、开箱即用的解决方案。
当研究人员检查了来自200多名学生的14,000多个响应时,一个显著的模式出现了。人工智能几乎从未选择中间地带。在超过95%的时间里,计算机要么是在极其详细地解释一个概念,要么是在直接为学生解决问题。那些仅仅促使学生思考或提供微小提示的响应极其罕见,仅占所有交互中的不到5%。无论学生是请求编写代码、修改报告还是理解复杂理论,计算机的默认反应都是提供实质性的、直接的协助。它的行为不像是一位引导球员进行训练的教练,而更像是一位直接为他们修理汽车的技工。
这种提供直接答案的倾向对学生随后的行为产生了明显的连锁反应。当计算机给出一个完整的解决方案时,学生很可能会请求另一段代码或一个新的待解任务。当计算机提供一个解释时,学生更有可能针对底层概念提出后续问题。研究人员发现,计算机提供的帮助程度能够可靠地预测学生在下一轮对话中的发言。然而,这种即时反应并未转化为后续更好的成绩。该研究观察了学生在没有任何计算机辅助的情况下参加的三场主要考试的表现。学生在学习过程中获得的帮助程度,并不能比他们过去的成绩或仅仅是“正在与计算机交流”这一事实更好地预测其考试分数。
研究结果表明,虽然这些通用型人工智能工具非常渴望提供帮助,但它们天生并不倾向于以一种能迫使学生进行“建设性挣扎”的方式进行教学。它们默认成为高效的问题解决者,而非耐心的教育者。这并不意味着这项技术是无用的,但这揭示了一个特定的行为:如果没有明确的指令要求其克制并进行引导,这些系统几乎总是会替学生承担繁重的任务。研究人员得出结论,要改变这种动态,教育者和开发者必须刻意设计这些系统,使其提供较少的直接帮助,而不是寄希望于技术能自然而然地找到这种平衡。数据为这些工具目前的行为提供了一个清晰的基准,表明通往有效人工智能辅导之路可能需要我们教会机器如何“教书育人”,而不仅仅是学会如何“回答问题”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。