← 最新论文
💬 NLP

Beyond "To whom it may concern": Tailoring Machine Translation to Audience and Intent

本文通过一项系统性评估表明,明确指定交际意图能显著提升跨多种语言和领域的机器翻译质量,其表现优于传统的上下文方法,并揭示了当前指标在衡量此类目的驱动型适配方面的不足。

原作者: Raphael Merx, Ekaterina Vylomova, Trevor Cohn

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Raphael Merx, Ekaterina Vylomova, Trevor Cohn

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名专业的翻译。如果有人请你翻译“Excuse me”这个短语,你会怎么做?

  • 如果你是在短信里和最好的朋友聊天,你可能会说:“嘿,抱歉!”(Hey, sorry!)
  • 如果你是在一个正式的商务会议上,你可能会说:“请原谅。”(Pardon me.)
  • 如果你是在和一个爱开玩笑的损友斗嘴,你可能会说:“噢,我的错,好吧。”(Oh, my bad, I guess.)

意思是一样的,但**氛围(vibe)**完全不同。

长期以来,计算机翻译系统(机器翻译)就像是一个只会一种说话方式的机器人:那种“正式商务会议”式的说话方式。它并不在乎你是在给朋友发短信还是在写小说;它只是机械地按照一套单一、僵化的规则手册将英语转换成另一种语言。

这篇题为**《超越“致相关人士”(Beyond "To whom it may not concern")》**的论文提出了一个简单的问题:现代 AI 翻译器真的能听懂我们关于“如何翻译”的要求吗?

以下是研究人员发现的内容,我们使用了一些日常类比来进行说明。

1. “指令”的魔力

研究人员测试了是否可以在 AI 开始翻译之前给它一个“简报”。他们不再只是说“翻译这句话”,而是添加了一个备注,例如:“将这句话翻译成两个女性朋友之间随意的短信,且带有讽刺意味。”

  • 结果: 这效果简直像魔法一样。当 AI 收到这些指令时,翻译变得更加自然,并且更符合情境。
  • 难点: AI 的“大脑”越大(模型规模越大),它遵循指令的效果就越好。一个微小的 AI(4B 参数)有时会感到困惑并崩溃,但大的模型(27B 和 31B)在调整语气方面表现得非常出色。
  • 甜点区(最佳平衡点): 指令对于非正式内容(如社交媒体帖子和聊天)帮助最大。对于正式的新闻文章,AI 本身就已经做得相当好了,所以指令并没有改变太多东西。

2. “展示,不要只说” vs. “直接告诉我”之争

研究人员想知道:是向 AI 展示翻译示例(比如给它看几篇样本文本)更好,还是仅仅用文字告诉它要做什么?

  • 类比: 想象你在教一名学生做饭。
    • 少样本学习(展示): 你给他们三张完美煎饼的照片,并说:“做得像这样。”
    • 指令(告知): 你说:“把这些煎饼做得蓬松香甜,但不要烤焦了。”
  • 结果: 告诉 AI 该做什么(指令)赢了。 给它例子并没有像给出关于语气和受众的清晰书面指令那样有效。当明确告知其“氛围”时,AI 对氛围的理解得更好。

3. “旧尺子”问题

这里有一个有趣的转折:研究人员尝试使用科学家用来评分翻译的标准“尺子”(指标),结果这些尺子失效了

  • 类比: 想象一位老师在批改学生的诗歌。老师使用一份清单,只计算有多少单词与字典定义相匹配。如果学生写了一首充满幽默感和俚语的诗,捕捉到了原作的神韵,老师却会因为他们没有使用“正确”的字典词汇而给他们低分。
  • 结果: 当 AI 使用指令使翻译变得更随意、更有趣时,旧的计算机指标反而给了它更低的分数。它们认为翻译变“差”了,因为看起来不像那种死板、正式的参考译文。研究人员不得不发明一种新的评分方式(使用另一个 AI 作为评委),这种方式能够理解为什么在目标是“幽默”时,“有趣”是一件好事。

4. “自我指令”的小技巧

在现实世界中,用户并不总是会花时间写下像“让这听起来像一部 1920 年代的侦探小说”这样详细的指令。通常,他们只是粘贴一段文字。

  • 问题: AI 能否观察周围的文本,自己找出氛围,然后进行翻译?
  • 结果: 可以。 研究人员教会了 AI 先阅读整个段落,写下自己的小指令备注(例如:“这是一个童话故事,使用简单的词汇”),然后再翻译句子。
  • 魔力: 这种“自我指令”技巧找回了大约 80% 由人类编写完美指令所带来的收益。这就像 AI 在进入派对前先观察环境,并调整一下自己的领带,即使没有人提醒它这样做。

5. “小脑”的挣扎

这里有一个警告。当他们尝试在处理困难语言(如爪哇语或乌克兰语)时使用最小的 AI 模型时,指令有时会导致 AI 崩溃。这就像给一个蹒跚学步的孩子一套复杂的指令;他们会感到不知所措,甚至忘了怎么走路。

  • 解决方法: 他们找到了一种方法,利用一个大 AI 作为老师来“训练”这个小 AI。这解决了崩溃问题,让小 AI 能够在不“坏掉”的情况下遵循指令。

核心结论

论文总结道,翻译不仅仅是交换单词;它关乎目的

  • 旧方式: “翻译这个。”(一刀切)。
  • 新方式: “为特定的人,以特定的情绪,翻译这个。”

研究人员证明了现代 AI 可以做到这一点,但我们需要停止使用那些惩罚创造力的旧评分系统,转而使用新的方式来衡量翻译是否真正契合情境。他们还表明,如果你没有人类来编写指令,AI 通常可以通过观察上下文来为自己编写指令。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →