Evaluative Judgement in Teaching AI-based Translation: A Class-room Case Study of AI-Mediated Translation and Post-Editing
本文通过分析一个包含23名翻译专业学生的课堂案例研究,旨在论证对人工智能与机器翻译系统进行结构化比较如何能够培养评估判断力,并揭示学生在选择用于译后编辑的输出结果时,比起自动指标,更看重准确性、流畅度及译后编辑工作量等因素。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,把一堂翻译课比作一场烹饪比赛。老师并没有要求学生从零开始烹饪,而是给了他们一个特别的挑战:品尝四种不同的预制菜,选出最好的一份完成最后一道工序,并准确解释为什么选择它。
这篇论文是一份关于 23 名大学翻译课学生在面对“预制菜”——即由人工智能(AI)生成的译文时,如何应对这一挑战的报告。
以下是过程的详细拆解,使用了简单的类比:
背景设定:“品鉴测试”作业
学生们拿到了一段短小且具有专业性的文本(类似于关于动物或技术的维基百科文章)。他们必须完成五件事:
- 从零开始烹饪: 先亲自翻译这段文本(以理解配方)。
- 点外卖: 要求四位不同的 AI “厨师”(两款高级聊天机器人和两款标准翻译引擎)翻译同一段文本。
- 获取机器人评分: 将四份 AI 译文通过一个计算机程序进行评分,该程序根据译文与原文词汇的匹配程度给出等级(就像是加强版的拼写检查器)。
- 品尝并评判: 仔细阅读译文,观察它们是否真的通顺、读起来是否自然,以及是否使用了正确的专业术语。
- 选出胜者: 选择四份 AI 版本中的其中之一进行“修整”(译后编辑),使其成为一篇可发表的文章。至关重要的一点是,他们必须写一份报告,解释为什么选择了那个特定的版本。
大惊喜:机器人评分并非最终判官
最有趣的发现是,学生们并没有盲目相信机器人的评分。
把自动评分想象成一场“人气竞赛”或一张“营养标签”。它能告诉你匹配了多少成分,但它无法告诉你食物是否美味,或者是否可以食用。
- 结果: 在大约一半的情况下,获得最高机器人评分的 AI 译文,并不是学生最终选择去修整的那一个。
- 原因: 学生们意识到,AI 可能会通过一种让计算机看起来正确、但人类读起来很怪异的方式来重新排列单词,或者遗漏关键的技术术词,从而获得高分。
学生们在寻找什么?
学生们不再仅仅盯着分数看,而是扮演了质量控制检查员的角色。他们寻找的是:
- “风味”(自然度): 读起来像是真人写的,还是像一个试图模仿人类的机器人?
- “食材”(术语): 是否准确使用了动物的科学名称或技术术语?
- “工作量”(译后编辑难度): 如果选择了这个版本,修复它需要多少工作量?有时一个版本看起来很完美,但却隐藏着需要花费数小时才能修复的陷阱。
- “结构”(语法): 它是否保持了句子的逻辑顺序,还是把句子搞乱了?
核心教训:学生成为了“质量仲裁者”
论文认为,这门课的目标并不是要找出世界上哪种 AI 是“最好的”。其目标是教会学生如何成为聪明的评判者。
在此之前,学生可能会想:“电脑说这是 95% 的完美,那我就直接用吧。”
完成这次作业后,他们学会了说:“电脑说这是 95% 的完美,但是它把医学术语弄错了,而且句式很别扭。我要选那个得分 85% 的版本,因为它更容易修改,读起来也更自然。”
总结
这项研究表明,当你教导学生对比不同的 AI 工具并强迫他们为自己的选择辩护时,他们就不再是只会接受机器产出物的被动使用者。相反,他们成为了批判性的编辑,能够识别出哪些译文在计算机屏幕上“看起来”很好,而哪些译文对于人类读者来说才是真正“好”的。
简而言之,这篇论文证明了,通过合适的作业设计,学生学会了让大脑保持在驾驶座上,将 AI 视为一个得力的工具,而不是主宰。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。