AI-Assisted Grading in Biochemistry: Automated Long Answer Question Scoring with Expert-Level Accuracy
本研究表明,一种使用 GPT-4 的人工智能驱动工具能够实现专家级的准确度,并为本科生物化学简答题的评分提供一致的、基于评分标准的反馈,从而有效应对了大班额和教师短缺所带来的挑战。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在医学教育领域,教授生物化学不仅仅是记忆身体如何处理能量的事实,它还要求学生进行深度思考并用自己的语言解释复杂的生理过程。为了衡量这种理解程度,教师经常使用长答题,即学生必须写出对某一生物机制的详细解释。这些题目是学习的有力工具,因为它们迫使学生组织思路并展示真正的掌握程度。然而,批改这些题目是一项沉重的负担。当班级规模扩大时,单个教师无法投入必要的时间去仔细阅读每一篇论文、提供个性化的反馈,并确保每位学生都能根据相同的标准得到公平的评判。挑战不仅在于工作量,还在于对一致性的需求;一位教师可能重视某个特定的细节,而另一位教师则可能忽略它,从而导致结果的不均衡。
来自印度医学院的一支研究小组决定看看一种新型计算机程序是否能解决这个问题。他们想知道人工智能系统是否能够阅读这些长篇论文,以媲美经验丰富的教授的水平进行评分,并准确解释学生为何获得特定分数。研究人员构建了一个类似于数字考官的工具。该系统并非仅仅通过统计字数或检查关键词,而是被赋予了一套特定的规则,即“评分标准”(rubric),该标准将一个完美的答案分解成更小的部分。计算机被指示在学生的文章中寻找这些特定部分,为发现的内容评分,然后建议如何改进答案。该系统使用了一种复杂的语言模型——一种在海量文本上训练过的计算机程序,用以理解人类语言——来执行这项任务。
该研究涉及了三百名学生,他们针对两个不同的生物化学问题撰写了答案。研究人员收集了这六百份响应,并进行了两次评分:一次由计算机完成,另一次由两位拥有多年教学经验的人类专家完成。人类教师使用相同的规则对试卷进行评分。为了确保计算机不是在瞎猜,研究人员要求它对每份试卷进行五次带有轻微变化的评分,然后取中间分数为最终结果。这种方法有助于平滑计算机可能产生的任何随机误差。随后,研究团队将机器给出的分数与两位人类教师给出的分数进行了对比,以观察它们的匹配程度。
结果显示,机器与人类之间存在着惊人的一致性。人工智能给出的分数与人类专家的评分几乎完美契合。当研究人员测量计算机的评分与教师评分的接近程度时,数据表明两者匹配度极高,甚至优于通常两个不同的人类对同一份试卷进行评分时的表现。计算机并没有一致地给出比教师更高或更低的分数;其平均分与人类的平均分几乎完全相同。事实上,计算机的评分与专家的评分如此一致,以至于它可以被视为课堂中可靠的伙伴。该系统还能针对学生答案中的薄弱环节提供具体的评论,提供有助于学生从错误中学习的细节水平。
这项工作表明,人工智能可以处理科学领域复杂书面答案的评分任务,且不会丢失人类教师所提供的细微差别。研究人员发现,通过给计算机一套明确的指令来告知其寻找的目标,它便能以专家级的准确度评估学生的作品。这并不意味着计算机取代了教师,而是指它可以承担评分的繁重工作,从而让教育工作者能够专注于教学和指导。该研究表明,这种方法已准备好应用于真实的课堂,以使评估更加公平高效,确保每位学生都能获得真正反映其对材料理解程度的分数。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。