Analysis of Numerical Localisation in LLM Translations
本文通过评估五种商品兼容的大型语言模型,扩展了先前关于数值翻译的研究,发现将嵌入本地化原则直接纳入提示词上下文,与直接翻译或其他策略相比,在翻译时间、数字和日期方面的准确度上取得了显著的统计学提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图给一位身处不同国家的的朋友寄一张明信片。你把日期写成“07/04/2024”。对你来说,那是7月4日;但对你的英国朋友来说,那是4月7日。如果你是在发送一份食谱、一笔银行转账或是一个科学公式,把数字和日期弄错就不只是一个笔误了,而是一场灾难。这就是**本地化(localisation)的世界。如果说翻译(translation)**是更换词汇(比如将“dog”变为“Hund”),那么本地化就像是为信息更换整套服装,以适应当地文化。它是在决定你是该穿西装还是礼服,或者在这种情况下,是用逗号还是用点来分隔小数。
**大语言模型(LLMs)**登场了。把它们想象成极其聪明、速度极快的机器人,它们几乎读过了互联网上的所有内容。它们擅长写故事和翻译句子,但在面对数字和日期的严格规则时,有时会踉跄跌倒。它们可能知道“1,000”代表一千,但可能会忘记在德国,同一个数字会被写作“1.000”。这篇论文深入探讨了人工智能科学的一个特定领域:这些“机器人大脑”能否不仅翻译文字,还能为新国家正确地“打扮”数字和日期?这是一个至关重要的问题,因为如果人工智能在本地化上出错,它可能会把安全的医疗剂量变成危险的剂量,或者把微小的利润变成巨额的损失。
数字大变身
在这项研究中,研究员帕特里齐亚·凯(Patrizia Kaye)对五种不同的 AI 模型进行了测试。这些并不是那种运行成本高达数百万美元的超级计算机级别的庞大模型;相反,她选择了五种较小的、“商品级”的模型,它们可以在标准硬件(如一台性能强大的游戏笔记本电脑)上运行。她想看看这些模型是否能够处理将英文文本翻译成德文(以及反之亦然)的棘手任务,同时根据当地规则确保数字、日期和时间完全准确。
为了实现这一目标,她设计了一个小实验。她从欧洲议会记录和医学文件等现实世界来源中提取了 700 个包含日期、时间和数字的句子。然后,她要求 AI 模型使用四种不同的“策略”或方法进行翻译:
- 直接翻译: 只要求 AI,“翻译这个句子”。
- 上下文学习 (ICL): 在提示词(prompt)中给 AI 一个参考,比如说:“记住,在德语中,我们使用点作为千位分隔符,使用逗号作为小数分隔符。”
- 思维链 (CoT): 要求 AI “大声思考”,在给出答案之前解释它的步骤。
- 后编辑 (Post-Editing): 让 AI 先进行翻译,然后使用一个单独的计算机脚本来搜寻数字并手动修复它们。
令人惊喜的赢家
结果带来了一个情节转折。在之前一项关于英中数字翻译的研究中,研究人员发现“后编辑”方法(事后修复数字)效果最好。但在帕特里齐亚针对英德翻译进行测试时,后编辑实际上是最差的策略,准确率经常低于 30%。似乎当 AI 感到困惑时,试图事后修复数字只会把事情搞得一团糟。
“思维链”方法(即 AI 解释其推理过程的方法)也并没有起到太大作用。它往往会导致模型在试图表现得“聪明”地解释如何得出答案的同时,给出了错误的答案。
真正的冠军竟然是上下文学习。当研究人员只是在提示词中添加了一些清晰的指令——明确告诉 AI 如何格式化数字和日期时——模型的表现显著提升。对于表现最好的模型(Qwen3-4B-Instruct-2507),这种简单的“参考”将英译德方向数字的准确率提升到了 91.7%,相比于仅靠直接翻译达到的 92.2% 虽略有下降(注:原文此处逻辑为对比提升,此处依原文翻译),但研究发现这种改进并非偶然。统计测试证实,将这些规则添加到提示词中,与其它策略相比,确实产生了显著且可衡量的差异。
更大的大脑如何?
你可能会认为,拥有更多“脑力”(参数)的更大 AI 模型总会做得更好。然而,论文发现,规模并不总是等于成功。测试的模型规模从 20 亿到 70 亿参数不等。令人惊讶的是,40 亿参数的模型在许多情况下实际上优于 70 亿参数的模型。这表明对于这项特定任务而言,拥有正确的指令比拥有最大的大脑更重要。
研究还测试了告知 AI 使用哪个版本的英语或德语(例如“英式英语”对比“德国本土德语”)是否有帮助。这确实有一点帮助,但不如直接在提示词中给出格式规则那么有效。
核心结论
这篇论文表明,如果你希望 AI 在翻译时能正确处理数字和日期,不要只要求它“尽力而为”。不要依赖它在事后修复自己的错误,也不要强迫它解释自己的思考过程。相反,请在开始时就给它一套清晰的规则。 通过将本地化原则直接嵌入到对话中,你可以将一个困惑的机器人变成一个精准的翻译官。虽然结果针对的是所测试的模型和语言对,但该方法提供了一种可复制的方式,让处理跨境资金、科学或日程安排的人们能够获得更安全、更准确的 AI 翻译。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。