Beyond Automated Scoring: An Evidence-Informed Human–GenAI Complementarity Framework for Formative Writing Assessment
本研究采用混合方法设计,旨在证明尽管生成式人工智能与人类教师在评分一致性方面表现有限,但两者在大多数评分维度上达到了实际等效性,并呈现出截然不同的反馈特征,从而开发出一个将生成式人工智能定位为形成性写作评估中教师判断之补充支持而非替代品的框架。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在全球各地的课堂上,教授写作是一项深刻的人类活动。它依赖于教师阅读学生的作业,理解文字背后的挣扎,并提供有助于作者成长的指导。这一过程被称为形成性评估,其目的不在于给出最终评分,而在于提供能够塑造下一稿的反馈。几十年来,教育工作者一直在寻求让这种反馈更加及时且一致的方法,尤其是在班级规模不断扩大的背景下。最近,一个新工具进入了讨论范围:生成式人工智能。这些计算机系统能够阅读文本并生成类人的响应,包括评论和建议。教育工作者面临的核心问题不是这些机器能否阅读,而是它们能否教学。计算机能否提供与资深教师同样有用且以学习为中心的反馈,还是说它们在看待学生作品的方式上存在本质的区别?
一组研究人员试图通过将人类教师与三种不同的人工智能系统进行对比测试来回答这个问题。他们收集了一百篇由学习英语作为第二语言的大学生撰写的文章。这些文章涵盖了不同的技能水平,随后由三位经验丰富的教师和三个不同的AI系统分别进行独立评估。目标不仅是看机器是否能达到教师的分数,而是为了理解它们产生的反馈在实质和风格上有何异同。研究人员使用了一套标准的评分指南,从四个特定领域进行考察:写作内容、观点组织方式、语言运用以及拼写和标点等机械细节。
结果揭示了一种令人惊讶的复杂性。当三位教师对文章进行相互评分时,他们彼此之间的意见高度一致,表现出极高的一致性。三个AI系统彼此之间的意见也几乎同样一致。然而,当研究人员将教师与AI系统直接进行比较时,一致性显著下降。人类与机器给出的分数经常并不匹配,尽管两组在统计学上都没有表现出暗示完全失败的“错误”。事实上,对于大多数写作类别,分数的差异微小到可以被视为在实践中等同,这意味着机器并没有严重偏离目标。但在文章内容方面,AI与教师的分歧更为明显,机器对写作实质内容的评价往往与人类不同。
然而,真正的故事并非源于数字,而是源于教师和机器所撰写的反馈文字。人类教师高度关注具体的错误。他们的评语直接且具有纠错性,指出句子在语法上的具体错误、段落缺乏清晰主题之处,或是某个单词拼写错误的地方。他们就像教练发现球员动作中的瑕疵一样,提供精准的修正。相比之下,AI系统则采取了更为宽泛的方法。它们倾向于在单次响应中涵盖写作的所有四个领域,通常会将赞扬与批评结合起来。AI可能会告诉学生其观点有力且组织良好,然后再委婉地指出语法需要改进。它们提供的是广泛的观察,而非针对特定错误的精准打击。
这种方式上的差异促使研究人员提出了一种看待这些工具的新思维方式。研究表明,不应将人工智能视为教师的替代品,也不应将其视为需要训练得像人类一样思考的机器。相反,两者提供了互补的优势,在结合时效果最佳。AI可以充当不知疲倦的“初审员”,提供即时的、全面的反馈,覆盖写作的所有方面,并确保没有学生在等待回复中被遗忘。随后,教师充当“专家编辑”,审查那些宽泛的反馈,为特定的学生确定最重要的议题,并提供只有人类才能提供的深度、具有情境感的指导。
研究人员称之为“证据支持的互补框架”。该框架承认,虽然机器擅长扫描模式并生成一致的多维度反馈,但它们缺乏教学判断力,无法知道什么样的反馈能在特定的时刻真正帮助特定的学习者。人类教师则凭借经验来决定什么才是最重要的。研究结论认为,写作评估的未来不在于在人类与机器之间做出选择,而在于将二者进行协调。通过让AI处理初步审查的广度,让教师处理教学的深度,学校可以建立一个让学生既能获得技术速度,又能获得人类智慧的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。