← 最新论文
💬 NLP

The Price of Reasoning: Cost-Quality Tradeoffs in Reinforcement Learning for Neural Machine Translation

本文研究了带有可验证奖励的神经机器翻译在强化学习中的成本-质量权衡,证明了在推理过程中包含推理轨迹尽管增加了生成额外输出标记的计算成本,但能显著提高翻译质量。

原作者: Michael Jungo, Aixiu An

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael Jungo, Aixiu An

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机不再仅仅像自动售货机那样吐出答案,而是会在开口说话之前真正地进行“思考”。这就是人工智能的领域,特别是被称为“机器翻译”的一个分支,在这里,计算机尝试将一种语言转换为另一种语言。长期以来,这些计算机是通过向它们展示数百万个正确翻译的示例来进行训练的,有点像学生在背诵字典。但最近,科学家们发现了一种教导它们的新方法,叫做“强化学习”。把这想象成一个电子游戏,每当计算机做得好时,它就会获得一个“奖励点”,从而鼓励它更加努力地尝试,并弄清楚为什么答案是正确的,而不仅仅是答案是什么。

然而,这里有一个陷阱。有时,为了获得奖励,计算机会在给出最终答案之前开始写出它的“思维过程”。这就像一个学生在写下最终数字之前,先写了一篇长篇大论来解释他的数学步骤。这种“推理”通常会让翻译变得更好,但也让计算机话变得更多,这既耗时又费钱。对于任何使用这些工具的人来说,最大的问题是:这种额外的思考是否值得那份额外的账单?

这篇题为《推理的价格》的论文深入探讨了正是这个问题,重点关注翻译法律文件,因为在这些文件中,确保准确性至关重要。研究人员迈克尔·容戈(Michael Jungo)和艾修·安(Aixiu An)设计了一系列实验,观察当他们在两个不同的阶段——即“教学”(训练)阶段和“使用”(推理)阶段——开启或关闭“思考”功能时会发生什么。

他们发现,最重要的规则是一致性。如果你教计算机去思考,那么在它工作时也应该让它思考。如果你教它直接给出答案,就不要在后来强迫它思考。最好的结果出现在他们让计算机在训练和最终翻译过程中都进行思考时。这种组合产生了最高的翻译质量,在衡量计算机工作与人类专家接近程度的测试中得分最高。

然而,这也需要付出“代价”。当计算机大声思考时,它会生成大量的词汇。研究人员发现,如果你在训练模型时进行思考,但在最终任务中却试图强迫它进行思考,计算机就会感到困惑,并产生过多的词汇——有时甚至比平时多出一倍以上——却并没有实际提高翻译质量。这就像雇佣了一位翻译员,他突然决定不再翻译合同,而是写一部小说;这既费钱又费时,但结果却并没有更好。

另一方面,如果训练模型进行思考,它会学会保持思考的简洁。研究人员发现,带有思考过程的训练实际上有助于模型变得更高效,减少了它稍后需要生成的额外词汇量。在他们的测试中,使用特定的模型 Qwen3.5 9B 并在训练和测试时都启用思考功能,得到了最高的质量得分(COMET 得分为 82.50),但与“无思考”版本相比,它的运行成本也略高一些。

这项研究表明,对于准确性至关重要的法律翻译而言,思考带来的额外成本通常是值得的,但前提是你必须从一开始就做好规划。最后时刻才加入思考功能是一种浪费金钱和时间的行为。他们发现的“甜点位”(最佳平衡点)是在大约 1,500 个高质量法律案例上训练模型;增加更多数据似乎并不能带来足以抵消额外成本的收益。最终,这篇论文表明,虽然思考让 AI 变得更聪明,但也让它变得更昂贵,而最明智的做法是及早决定是否需要这种额外的脑力,并始终如一地为此付费,而不是试图混搭使用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →