← 最新论文
💻 computer science

Comparative Evaluation of Machine Translation Systems on Images with Text

本文对含文图像翻译系统进行了比较评估,结果表明多模态大语言模型在翻译质量与语境理解方面均优于模块化光学字符识别流水线及端到端方法。

原作者: Blai Puchol, Sergio Gómez González, Miguel Domingo, Francisco Casacuberta

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Blai Puchol, Sergio Gómez González, Miguel Domingo, Francisco Casacuberta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一张外国街道标志的照片。你想知道上面写了什么,但你不懂那种语言。这篇论文就像是一场由三支不同的“数字翻译”队伍进行的比赛,看看哪一支能最准确地读出那个标志并告诉你它的含义。

以下是论文如何运用简单的类比来分解这场竞赛:

三位竞争者

研究人员测试了三种不同的解决问题的方法:

  1. 流水线(模块化管道):
    这就像是一个拥有两名不同工人的工厂。

    • 工人 A(眼睛): 首先,一个专门的机器人查看图片,并准确写下字母的内容。这被称为 OCR(光学字符识别)。
    • 工人 B(翻译): 然后,第二个机器人接过这份字母列表,将其翻译成你的语言。
    • 论文的发现: 这支队伍使用了最好的“眼睛”(一种名为 docTR 的工具)和最聪明的“翻译”(像 Llama 和 EuroLLM 这样的 AI 模型)。
  2. 超级大脑(多模态大语言模型):
    这就像雇佣了一位天才,他能同时看到图片并阅读文字。这个人不是将工作从一个环节传递给另一个环节,而是单个 AI 直接查看图像,理解上下文,并立即告诉你翻译结果。

    • 论文的发现: “超级大脑”(特别是谷歌的 Gemini 模型)是当之无愧的获胜者。它们不仅翻译了单词,而且比任何人都更好地理解整张图片。
  3. 直接绘制者(端到端模型):
    这是一个试图将原始照片直接“魔法般”地在新文字上重新绘制、覆盖旧文字的机器人。它跳过了“阅读”和“翻译”步骤,试图一步到位完成所有工作。

    • 论文的发现: 这种方法最为吃力。这就像试图在不先勾勒轮廓的情况下画出一幅完美的肖像。它犯的错误比其他两支队伍都多。

赛道(实验)

为了确保比赛公平,研究人员没有使用那些光线模糊或标志歪斜的杂乱现实照片。相反,他们利用计算机生成的图像创建了一个“练习赛道”。他们将德语、法语和罗马尼亚语的句子用黑色字体输入,并放置在不同旋转角度的彩色背景上。

这确保了每个 AI 队伍都面对完全相同的条件,从而很容易看出谁才是真正的最佳翻译者,谁只是在猜测。

结果:谁赢了?

尘埃落定后,结果显而易见:

  • 获胜者: 多模态模型(超级大脑) 夺得第一名。它们最灵活,对文本上下文的理解最好。它们不会被图像的布局搞糊涂;它们只是“懂了”。
  • 亚军: 流水线(模块化管道) 获得第二名。它表现非常出色,特别是当它们使用了最好的“眼睛”和最聪明的“翻译”时。这证明了将大问题分解为更小、更专业的步骤是非常有效的。
  • 失败者: 直接绘制者(端到端) 排名最后。它在获得正确的翻译方面遇到了困难,这表明在不先阅读文本的情况下直接翻译图像,对计算机来说仍然是一个非常艰巨的挑战。

注意事项(局限性)

论文也承认了关于这场比赛的一些情况:

  • 赛道是虚构的: 图像是由计算机完美生成的。在现实世界中,照片往往是杂乱的(模糊、昏暗或被雨水覆盖)。当面对现实生活的混乱时,获胜者可能会表现得更好或更差。
  • 语言有限: 比赛仅包含几种欧洲语言。我们不知道这些获胜者在使用不同脚本(如中文或阿拉伯语)或非常罕见的语言时是否同样出色。
  • 评分表: 评委使用计算机公式来评分。虽然这些公式是标准的,但它们无法衡量翻译听起来有多“人性化”或自然。

核心结论

主要的启示很简单:如果你今天想要翻译图像中的文本,最好的策略要么是使用能同时看见和阅读的“超级大脑”AI,要么是使用将阅读与翻译分离的高质量“流水线”。试图一步到位完成所有工作(直接绘制者)尚未准备好进入主流应用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →