When the Gold Standard Isn't Necessarily Standard: Challenges of Evaluating the Translation of User-Generated Content
本文认为,评估用户生成内容的翻译需要遵循指南的框架,因为非标准语言缺乏单一的“黄金标准”,导致参考译文存在差异,并显著影响大语言模型的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名翻译,受雇翻译一系列短信、推文和论坛帖子。这些并非正式信函,而是充满了拼写错误、俚语、用于强调的重复字母(如"soooooo")、表情符号,甚至一些脏话。
现在,想象你有四位不同的老板,他们各自就如何处理这些杂乱文本向你下达指令。这正是本文研究人员所探讨的内容。他们问道:“当原文杂乱无章时,什么样的翻译才算‘好’?我们又该如何公平地衡量它?”
以下是他们研究发现的拆解,辅以一些日常类比。
1. “黄金标准”实际上是一个光谱
在翻译界,通常存在一个“黄金标准”——即一个公认的完美参考译文。但作者发现,对于用户生成内容(UGC),并不存在单一的黄金标准,而是一个光谱。
他们考察了四个不同的数据集(翻译文本集合),发现这些“老板”(制定指南的人)有着截然不同的理念:
- “严格编辑”(RoCS-MT): 这位老板说:“修正一切!纠正拼写,修复语法,去除俚语,让译文听起来像一篇正式的报纸文章。”他们希望输出干净、规范。
- “原样保留者”(PFSMB): 这位老板说:“保持氛围!如果原文有重复字母或俚语,译文也应如此。不要清理它,只需传达那种感觉。”
- “中间派”(FooTweets 和 MMTC): 这些老板介于两者之间,修正部分内容,但保留文本的个性。
类比: 想象你在翻译朋友的手写便条。
- 严格编辑会将你朋友的便条重写成完美、打印的字体,纠正语法并去除涂鸦。
- 原样保留者会翻译文字,但保留手写风格、涂鸦和杂乱的页边距。
- 论文认为,两种方法都可以是“正确”的,这取决于客户想要什么。
2. 翻译的“操作菜单”
为了理解这些不同的风格,研究人员创建了一个包含 12 种“杂乱”元素(如拼写错误、表情符号、标签和脏话)的菜单,以及翻译可以采取的 5 种操作:
- 规范化(NORMALISE): 修正它(例如,将"u"改为"you")。
- 复制(COPY): 原样保留(例如,保持标签#WorldCup 不变)。
- 转移(TRANSFER): 将“杂乱”特征翻译到目标语言中(例如,将英语的"LOL"转换为法语的"MDR")。
- 省略(OMIT): 完全忽略(例如,跳过用户名)。
- 审查(CENSOR): 软化冒犯性词汇(例如,将"f**k"改为"heck")。
论文发现,不同的数据集采用了这些操作的不同组合。一个数据集可能要求“转移俚语”,而另一个则要求“规范化俚语”。
3. AI 机器人与“操作手册”
研究人员测试了多种现代 AI 模型(大语言模型或 LLM),观察它们如何处理这些不同的指令。他们向 AI 提供相同的杂乱文本,但更改“操作手册”(提示词),使其匹配四个不同数据集中的某一个。
他们的发现:
- AI 对指令敏感: 当 AI 被告知“保留俚语”(匹配原样保留者老板)时,它做得很好。当被告知“修正一切”(匹配严格编辑)时,它也做到了。
- 不匹配导致混乱: 如果你告诉 AI“保留俚语”,却用“严格编辑”的参考译文来给它打分,AI 会得到低分,尽管它完美地遵循了你的指令。这就像给一个按照蛋糕食谱制作蛋糕的学生打分,而评委想要的却是派。
- 某些 AI 很固执: 一个模型(Tower)大多无视指令,按自己的意愿行事。另一个(LLaMA)如果内容包含“不安全”词汇(如脏话),就拒绝翻译任何内容,实际上等于放弃了工作。
4. “记分牌”问题
我们如何知道翻译是否好?通常,我们使用自动评分工具(指标),将 AI 的输出与“黄金标准”参考译文进行比较。
问题所在: 这些评分工具有偏见。
- 如果参考译文是“干净且规范”的,评分工具会喜欢干净的译文,而讨厌杂乱的译文。
- 如果参考译文是“杂乱且充满俚语”的,评分工具可能会感到困惑,即使杂乱的译文忠实于原文,也会给出较低的分数。
类比: 想象才艺表演中的评委。如果评委在寻找古典小提琴手,他们会给摇滚吉他手打低分,即使这位摇滚吉他手在摇滚方面非常出色。论文表明,当前的 AI 评分工具就像这位评委——它们偏向“干净”的文本,除非明确告知其预期风格,否则难以公平地评估“杂乱”的文本。
5. 主要结论
论文得出结论:如果不了解游戏规则,就无法公平地评估翻译。
- 对于数据集创建者: 你需要非常明确你的指南。你是希望文本被清理,还是希望保留个性?
- 对于 AI 开发者: 你需要明确告知 AI 应使用哪种风格。
- 对于评估者: 你不能仅使用通用分数。你需要一个“指南感知”的评估系统,该系统能理解 AI 本应是“严格编辑”还是“原样保留者”。
简而言之:“好”的翻译不仅仅是准确;它是准确到你被要求产生的风格。如果你不定义风格,就无法公平地评判结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。