SEFORA: Student Essays with Feedback Corpus and LLM Feedback Evaluation Framework
本文介绍了 SEFORA,一个包含真实教师反馈的大规模学生论文语料库,以及 UniMatch,一个新颖的评估框架,该框架揭示了当前的语言大模型在生成与人类教师优先级一致的反馈方面存在困难,在广泛的实验中最高 F1 分数仅为 0.4。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在批改一叠学生论文的老师。你需要阅读每一句话,找出出彩之处,指出令人困惑的地方,并在页边空白处写下具体的笔记来帮助学生改进。这是一项艰苦的工作,要同时为数百名学生做这件事,对人类来说几乎是不可能的。
最近,我们尝试使用“AI 老师”(大语言模型)来承担这项工作。但问题在于:我们并不真正清楚 AI 给出的建议是否真的“好”,而且我们缺乏一个衡量它的有效标尺。
这篇论文介绍了两个用于解决该问题的工具:一个庞大的真实教师笔记库 SEFORA,以及一个新的测量工具 UNIMATCH。
1. 图书馆:SEFORA(“金标准”收藏集)
把 SEFORA 想象成一本巨大且有组织的剪贴簿。
- 内容物: 它包含了来自真实大学课程的 564 份学生论文草稿(有些是仅写了一次,有些是经过多次修改的)。
- 特别之处: 在每篇学生论文旁边,都附带了由真实人类教授撰写的实际笔记。这些不仅仅是写着“错误”的红笔标记。它们是像“这个角色感觉很真实”或“这里的‘那个’指的是什么?”这样的便签和高亮标注。
- 重要意义: 在此之前,大多数 AI 数据集只包含分数(如“85/100”)或简单的错误标签。SEFORA 的特别之处在于,它捕捉到了真实教师与学生交流时的细微差别,包括他们所针对的具体文本部分。
2. 标尺:UNIMATCH(“反馈侦探”)
现在,假设你要求 AI 对一篇学生的论文撰写反馈。你如何知道它写得好不好?
- 旧方法: 你可能会将 AI 的话与老师的话进行比较,看它们看起来是否相似。但这就像是通过判断厨师是否使用了与食谱相同的词汇来评判厨师,而不是看食物的味道是否正确。如果老师说“把它写短一点”,而 AI 说“删减冗余”,简单的词数检查可能会判定它们不同,尽管它们的含义是一样的。
- 新方法 (UNIMATCH): 这个工具扮演着侦探的角色。它将老师的笔记和 AI 的笔记拆解成微小的、独立的“反馈单元”(每个单元代表一个特定的想法)。
- 第一步: 它将笔记拆分成碎片。
- 第二步: 它会询问:“这个来自 AI 的片段是否与老师的一个片段在意思上相匹配?”(例如:“删减冗余”是否匹配“把它写短一点”?)。
- 第三步: 它使用一种智能匹配系统(类似于配对袜子)来观察 AI 成功捕捉到了多少老师认为重要的观点,以及 AI 凭空捏造了多少多余且无用的观点。
3. 重大发现:“话痨”问题
研究人员测试了 74 种向 AI 模型索要反馈的提问方式。结果令人惊讶,也有些令人失望:
- 得分: 即便是最聪明的 AI 模型,也只能获得约 0.4 分(满分 1.0) 的得分。这意味着它们遗漏了大部分人类教师会给出的具体且高优先级的反馈。
- 主要元凶: 导致低分的主要原因是冗赘性(说话过多)。
- 类比: 想象一个学生请求关于一道数学题的帮助。一个好的导师会给出一个清晰的提示。然而,AI 表现得像个紧张的“话痨”。它给出了那一个提示,但随后又增加了五个老师绝不会提出的额外建议,或者以三种不同的方式重复同一个观点。
- 结果: 因为 AI 生成了如此多的“额外”噪音,其精准度下降了。这就像一个学生为了回答一个单句问题而写了一篇 10 页的论文;他可能得到了正确答案,但他把答案埋在了过多的废话之下,导致其不再具有帮助性。
总结
这篇论文告诉我们,虽然 AI 可以生成文本,但它目前仍难以表现得像一位深思熟虑的人类教师。它倾向于过度解释,并且会错过人类教师优先考虑的那些具体且高价值的点。
为了解决这个问题,我们需要:
- 更好的数据: 真实展示教师实际交流方式的范例(SEFORB 提供了这一点)。
- 更好的测量方法: 一种能够判断 AI 是否击中了要点,而不只是使用了正确词汇的方法(UNIMATCH 提供了这一点)。
在 AI 学会变得简洁并精准击中目标之前,它还没有准备好取代课堂中的人类触感。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。