Human-in-the-Loop Benchmarking of Heterogeneous LLMs for Automated Competency Assessment in Secondary Level Mathematics
本文引入了一种基于多维度评分标准的人机协同基准测试框架,用于评估尼泊尔自动化中学数学评估中异构大语言模型的表现,研究结果表明,模型架构与指令约束的兼容性比模型规模对于达成与人类专家的一致性更为关键,并得出结论:这些模型最适合用于辅助性证据提取,而非自主认证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个教室:老师们被文书工作淹没。他们不再仅仅给学生一个单一的数字(比如"85%"),而是希望提供一份详细的报告单,上面写着:“你理解了为什么"、“你擅长计算"、“你能连接不同的想法”。这被称为基于能力的教育。这是一种更丰富的评分方式,但对人类来说,手动完成这项工作极其困难且耗时。
本文提出了一个简单的问题:人工智能(AI)能否帮助教师承担这项繁重的工作?
以下是他们实验的故事,简单阐述如下:
1. 设置:“人类 vs. 机器人”测试
尼泊尔的研究人员决定在10 年级数学(一门涉及矩阵、几何和三角函数的棘手学科)上对此进行测试。
- 学生:他们收集了 33 份真实学生的手写数学试卷。
- 人类评委:两位资深数学教师对这些试卷进行了评分。他们不仅仅寻找正确答案,而是使用一套非常严格的“规则手册”(评分标准)来评估四项具体技能:
- 理解力:他们是否理解了问题?
- 知识:他们是否掌握了事实?
- 流畅度:他们能否正确执行数学步骤?
- 行为/关联:他们能否连接不同的概念?
- AI 评委:他们部署了四种不同的人工智能模型,使用同一套规则手册对相同的试卷进行评分。
- Eagle:一个小型、快速的 AI(像短跑运动员)。
- Orion:一个庞大、强大的 AI,拥有巨大的算力(像重量级冠军)。
- Nova:一个聪明、高效的 AI,采用特殊的“团队”结构(像专家团队)。
- Lyra:一个顶级 AI,用作裁判。
2. 转折:更大并不总是更好
通常,我们会假设最大、最强大的人工智能(Orion)会获胜。但结果令人惊讶,就像一位相扑巨人在被一颗小石子绊倒时,而一位灵巧的舞者却轻盈地滑过。
- “巨人”(Orion)失败了:尽管拥有最多的“脑力”(700 亿参数),Orion 却感到困惑。它与人类教师的分歧如此之大,以至于衡量其一致性的数学分数实际上是负数。这就像一个试图评分的机器人,却发明了一套毫无意义的规则。
- “专家”(Nova)获胜了:更小、更高效的 AI(Nova)表现最佳。它在约 38% 的情况下与人类教师达成一致(在这个严格的世界里,这被视为“公平”)。它比那个“巨人”更好地遵循了指令。
教训:在这项特定任务中,遵守规则比拥有大头脑更重要。庞大的 AI 被自身的复杂性“分心”了,而专门的 AI 则专注于工作。
3. 解决方案:“人在回路”
论文得出结论,我们目前不应让 AI 完全取代教师的工作。AI 尚未准备好成为最终裁决者。
相反,应将 AI 视为一名高效的实习生。
- 实习生(AI):快速扫描学生的作业,标出亮点,并根据规则手册建议分数。
- 老板(人类教师):查看实习生的建议,仔细复核棘手部分,并做出最终决定。
这种“人在回路”的方法意味着 AI 负责寻找证据的繁重工作,而人类则保留“可信度盾牌”以确保公平。
4. 这意味着什么(以及不意味着什么)
- 它是什么:证明了 AI 可以帮助教师识别模式并从学生作业中提取证据,使评分过程更快、更细致。
- 它不是什么:一个准备好取代教师或独立颁发最终证书的系统。论文明确警告,如果我们让 AI 独立评分,它可能会犯错(产生幻觉)或带有偏见,因为我们并不总是知道它是如何得出结论的(即“黑箱”问题)。
简而言之:研究人员在传统评分与未来之间架起了一座桥梁。他们发现,虽然 AI 还不是这艘船的船长,但只要人类依然手握方向盘,它就是一位出色的领航员。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。