← 最新论文
💻 computer science

Calibrating Gemini to Human Raters in Spoken Language Assessment for EFL Learners in Asia

这项研究表明,虽然 Gemini 2.5 Flash 在人类评分者表现出中等一致性时,可以通过 10-shot 提示词在评估英语作为外语(EFL)学习者的英语口语方面达到人类水平的一致性,但当人类一致性极佳时,其表现会发生退化,这凸显了尽管其具备超越单纯词汇准确性的评估能力,仍需进行仔细的校准和人工监督。

原作者: Christopher Robert Cooper, John Maurice Gayed

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Christopher Robert Cooper, John Maurice Gayed

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正在批改数百篇论文的老师。这是一座难以逾越的工作大山,虽然你可以轻松阅读学生写下的文字,但要评判他们的口语表达则是另一回事。语言是“响亮且转瞬即逝的”——它在瞬间发生,然后便消失无踪,这使得捕捉和公平评判变得非常困难。多年来,计算机一直擅长阅读文本,但在“倾听”人类对话方面却表现不佳,往往依赖于书面转录文本,从而忽略了语气、停顿和口音中的细微差别。现在,新一代“生成式人工智能”已经到来。把这些人工智能想象成超级聪明的数字助手,它们不仅能阅读,还能倾听并理解语境。大家心中最大的疑问是:我们能否训练这些数字助手,使其像人类教师一样公平、准确地评判英语口语?这不仅仅是为了节省老师的时间,更是为了确保无论学生来自哪里或发音如何,都能获得有助于进步的正确反馈。

本论文深入探讨了这个问题,测试了一个名为 Gemini 2.5 Flash 的特定人工智能模型。研究人员想要看看他们是否可以通过向 AI 展示人类教师如何为口语对话评分,来“校准”这个 AI——本质上就是教它如何评分。他们不仅仅是给 AI 输入书面文本;他们还把学生说话的实际音频文件交给了它,这是一个巨大的进步,因为这让 AI 能听到真实的声音,而不仅仅是转录后的文字。

研究人员设计了一个巧妙的实验,使用了 129 段亚洲英语学习者与教师之间的录音对话。他们要求 AI 使用三种不同的方法对这些演讲进行评分:

  1. 零样本(Zero-shot): AI 只得到规则并立即评分,没有任何示例。
  2. 5 样本(5-shot): 在开始之前,AI 看过了五个由人类教师评分的示例。
  3. 10 样本(10-shot): AI 看到了十个示例。

他们将 AI 的评分与两组人类教师进行了对比。其中一组教师之间的意见达成程度中等(他们的分数相似但不完全相同),而另一组教师的意见几乎完全一致(他们在评分上就像双胞胎一样)。

这里有一个转折:当 AI 学习那些具有中等一致性的教师时,效果最好。当 AI 被展示来自“完美一致”教师组的示例时,它的表现反而变差了,完全无法匹配他们的分数。这就像是 AI 需要看到一点人类的分歧,才能理解“好”或“坏”分数的完整范围。如果示例过于完美,AI 就会对边界在哪里感到困惑。

研究还检查了 AI 是否真的能正确地“听见”学生。他们使用了一种被称为**词错率(WER)**的指标来衡量这一点,该指标统计了 AI 在转录过程中出错的单词数量。AI 确实犯了错误,但主要是在区分说话者(学生还是老师)方面,而不是漏掉了单词本身。研究人员发现,AI 听错单词的能力并没有改变它对学生评分的严厉或宽容程度。这表明 AI 不仅仅是在听单词的词典定义,它还在捕捉言语的流动感和节奏。

然而,出现了一个微小且令人意外的小插曲。尽管 AI 转录其语音非常准确,但它似乎给来自巴基斯坦的学生打了稍低的分数。研究人员指出,这是一个需要进一步调查的潜在偏见,特别是因为该研究中只有四名来自该国的学生。

最后,论文指出 Gemini 2.5 Flash 是一个很有前景的工具,可以帮助教师评定英语口语,但它并不是一根魔杖。它在通过展示现实评分范围的人类示例进行校准时效果最好,并且仍需要人类监督员来密切关注。AI 可以倾听演讲,理解语境,并给出非常接近人类教师的反馈,但它仍然需要精心的调优,以确保对每个人都是公平的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →