← 最新论文
💬 NLP

Benchmarking and Boosting Multilingual Capabilities of LVLMs via OCR-Centric Reinforcement Learning

本文介绍了 PM4Bench,这是一个严格并行的多模态基准测试,它揭示了 OCR 是导致大型视觉语言模型(LVLMs)跨语言差异的主要原因,并提出了一种无标签、以 OCR 为中心的强化学习策略,以有效提升多语言能力并缩小性能差距。

原作者: Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Weijia Li, Bin Wang, Lijun Wu, Conghui He

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Weijia Li, Bin Wang, Lijun Wu, Conghui He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:计算机能够观察一张照片,并像人类一样精准地理解它所看到的一切——阅读其中的标牌、菜单和手写笔记。这种被称为“视觉语言理解”的能力,已成为现代人工智能的基石。这些系统现在成为了数字助手的“眼睛”,帮助它们在我们的手机、电脑以及周围的物理世界中进行导航。然而,一个显著的问题一直存在:虽然这些机器在理解英语方面表现出色,但在面对其他语言时(尤其是当文本嵌入在图像之中时)却经常出错。目前尚不清楚这种性能差距是因为机器无法学习新语言,还是仅仅因为用于衡量它们的测试存在不公平之处,即在进行“苹果与橘子”式的错误比较。研究人员长期以来一直致力于构建一个公平的测试,以将机器的真实能力与其数据本身的特性区分开来。

一组研究人员现在构建了一个名为 PM4Bench 的全新、严谨的测试场,旨在解决这一问题。他们没有为不同的语言使用不同的图片(因为这会引入隐藏的偏差),而是创建了一套内容严格一致的十种语言集。无论文本是英文、中文、阿拉伯文还是俄文,其布局、背景、答案以及问题的含义都保持完全相同;改变的仅仅是语言本身。这实现了一种真正的公平比较,就像在同一个秤上称量十种不同的水果一样。此外,他们设计该测试以模拟现实世界的使用场景,即计算机代理将屏幕视为包含文本和图形的单一图像,而不是接收单独的文本文件和图片文件。这种“视觉设置”迫使模型直接从图像的像素中读取文本,就像人类看智能手机屏幕时那样。

当研究人员在这个新的基准测试上测试了十种不同的视觉语言大模型时,他们发现了一个清晰的模式。与提供单独文本的情况相比,当文本嵌入在图像中时,模型的表现明显下降。更重要的是,在图像化设置下,模型理解英语与其他语言之间的差距剧烈扩大。团队通过进行一项受控实验调查了原因:他们提取了相同的基于图像的问题,并为模型提供了正确的文本内容,从而消除了从图片中读取文本的需求。当模型直接获得文本时,其性能得到了提升,且语言间的差距缩小了。这一证据指向了一个单一且共同的瓶颈:识别图像中文字的能力,即光学字符识别(OCR)技术。研究发现,模型阅读图片中文字的成功程度,与其回答关于该图片问题的成功程度密切相关,且无论使用何种语言都是如此。

为了解决这一瓶颈,研究人员开发了一种全新的训练方法,完全专注于提高模型从图像中读取文本的能力。他们生成了海量的合成训练数据,创建了包含十种不同语言、带有随机文本的数千张图像,且无需任何人工编写标签或答案。随后,他们使用了一种强化学习策略——这是一种通过尝试最大化得分来学习的训练类型——来教导模型更准确地识别这些文本。至关重要的是,他们设计的评分系统不仅奖励正确识别文本,还奖励维持模型进行复杂问题思考与推理的能力。结果显示,新版本的模型在各项任务中都表现出了显著的进步。它变得更擅长阅读图像中的文本,而这种进步也转化为了它在所有十种语言中回答问题及与图形界面交互的能力。这种提升并不局限于特定的测试,模型在其他现有基准测试上也表现得更好,这表明这种进步是真实的且具有迁移性的。

该研究得出结论:这些强大的人工智能系统在不同语言之间表现不均,往往是由阅读图像中文字这一特定弱点驱动的,而非由于其对语言本身存在根本性的理解障碍。通过识别这一特定弱点,并利用一个庞大的无标签数据集训练模型来克服它,研究人员展示了一条通往更公平的人工智能之路。他们的工作表明,如果我们希望人工智能代理能够为每一个人可靠地工作,无论他们说哪种语言,我们首先必须确保它们能够“看见”并“读出”环绕在视觉世界中的文本。这种方法提供了一种实际且高效的方式来提升这些系统的能力,确保人工智能带来的红利能更广泛地惠及全球人口。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →