METATR: A Multilingual, Evolving Benchmark for Automatic Text Recognition
本文介绍了 METATR,这是一个多语言且不断演进的基准测试,旨在评估自动文本识别系统在涵盖 29 种语言和多种文字的真实世界多样化文档上的表现,从而为有意义的模型比较与选择提供标准化框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在聘请一个翻译团队,去阅读一座庞大、积满灰尘的图书馆,馆内收藏着来自世界各地的书籍。有些书籍是崭新、现代的报纸,用完美的英语印刷;而另一些则是 crumbling 的中世纪手稿,用褪色的墨水书写,字迹古怪、排版奇特,且使用的是无人再说的语言。
长期以来,针对这些翻译团队的“测试”(论文中称为自动文本识别或 ATR),就像是在一条空旷、阳光明媚的高速公路上进行驾驶考试。汽车(AI 模型)能够以 99% 的完美度行驶,因为道路太过简单。人们开始说:“驾驶问题已经解决了!我们不再需要测试了。”
但在现实世界中,道路上布满了坑洼、迷雾和令人困惑的绕行路线。这篇论文的作者,METATR,意识到旧的测试在欺骗我们。他们建造了一条全新、更加艰难的测试赛道,以观察哪些 AI 模型真正能够应对混乱、真实的图书馆环境。
以下是他们发现的简要说明:
1. 新的测试赛道(METATR)
作者没有仅仅在干净、现代的英语文本上进行测试,而是创建了一个名为METATR的“压力测试”。
- 多样性:他们收集了来自 17 个不同来源的 453 页文档。这就像一张困难文档的“精选集”专辑。
- 混合性:其中包含 29 种不同的语言(从阿拉伯语到越南语)、不同的文字系统(如古希腊文或日文),以及不同的条件(手写信件、旧报纸、多栏排版)。
- 目标:他们不仅想看谁最快;他们想看谁能阅读混乱的手写页面,即使是在没有专门针对该语言进行训练的情况下,也不会编造词语(幻觉)或按错误的顺序阅读文本。
2. 参赛者(模型)
他们让三种类型的“驾驶员”在这条赛道上行驶:
- 专业技工(传统 OCR):这些是专门为阅读文本而构建的旧式工具。它们就像专业的叉车:擅长搬运箱子(干净、印刷的文本),但在导航拥挤、杂乱的客厅(手写、复杂排版)时却表现糟糕。
- 开源 tinkers:这些是由社区构建的模型。有些小巧快速,有些庞大强大。它们就像车库里的技工团队。有些出奇地好,但往往不一致——有时像冠军一样驾驶,其他时候则撞墙。
- 科技巨头(专有模型):这些是来自 Google(Gemini)、Anthropic(Claude)和 OpenAI 等公司的庞大、昂贵的模型。它们就像拥有最大引擎和最佳燃料的 F1 赛车。
3. 比赛结果
当他们在这一困难赛道上进行比赛时,结果显而易见:
- 科技巨头获胜(大部分情况):“F1 赛车”(特别是Gemini 3 Pro和Claude Opus 4.5)表现最为稳定。它们处理混乱的手写、奇怪的排版和稀有语言的能力优于任何其他模型。它们犯的错误最少。
- 专业技工挣扎:旧式工具在阅读干净、现代的报纸时表现出色,但面对历史手写体或复杂排版时却分崩离析。它们无法适应。
- 开源 tinkers 表现参差不齐:较大的开源模型(如Qwen或olmOCR)在某些赛道上能与巨头竞争,但它们更加不可预测。有时它们表现极佳;其他时候,它们会犯下巨大错误,尤其是在高棉语或日语等困难文字系统上。
- “手写”障碍:阅读印刷文本对所有人来说都很容易。但阅读手写文本才是真正的杀手。即使是最好的模型在这里也感到吃力,尽管科技巨头模型失败的可能性仍然最低。
4. 速度的代价
论文还考察了“燃料账单”(计算成本和速度)。
- 巨头既慢又贵:表现最佳的模型(Gemini、Claude)阅读一页需要很长时间,且使用成本高昂。它们就像豪华出租车:服务一流,但你需要为此付费。
- 技工既快又便宜:专业工具(如PeroOCR)速度快得惊人,且能在微型计算机上运行。它们就像自行车:便宜且快速,但无法应对陡峭的山坡(复杂文档)。
- 中间地带:开源模型处于中间位置。它们需要强大的计算机(昂贵的显卡)来运行,速度比技工慢,但比巨头快。
结论
论文得出结论,“文本识别已解决”这一观点是错误的。
如果你只在干净、现代的英语上进行测试,你会获得一种虚假的安全感。但如果你将这些系统扔向混乱、历史、多语言的文档,它们的性能会显著下降。
对于任何试图使用这些工具的人的启示:
没有单一的“最佳”模型能应对所有情况。
- 如果你需要在混乱的历史文档上获得最高准确率,且不介意为此付费或等待,那么科技巨头模型目前是最好的选择。
- 如果你需要阅读成千上万页干净、现代的页面,并且需要速度和低成本,那么专业工具仍然是首选。
- 开源模型是一个充满希望的中间地带,但你必须小心,因为它们可能不可预测。
作者建立这一基准,是为了让我们在未来不仅能追踪“它能阅读英语吗?”的进展,还能追踪“它能阅读任何地方的任何内容,且不编造内容吗?”的进展。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。