← 最新论文
💻 computer science

MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios

本文介绍了 MME-VideoOCR,这是一个包含 44 个视频场景、25 个任务的综合基准测试,旨在评估多模态大语言模型中的光学字符识别(OCR)能力,并揭示了尽管顶尖系统已取得进展,但目前的先进模型在整体视频理解、时空推理以及跨帧整合方面仍然表现挣扎,其准确率仅为 73.7%。

原作者: Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zh
发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zhang, Liang Wang, Haoxuan Li, Zhouchen Lin, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Wenjing Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代计算机静谧的嗡鸣声中,一种新型的智能正在学习如何观察。这些被称为多模态大语言模型的系统,旨在不仅处理文字,还处理图像和视频,将它们融合进单一的理解流之中。它们在从静态图片中读取文本方面已变得异常熟练,能够将一张街标或文档的照片转化为高精度的数字文字。这种能力为机器进入现实世界、阅读指令以及组织信息打开了大门。然而,现实世界很少是静止的。它在移动、在变化。当这些同样的智能系统被要求从动态视频中读取文本时,这项任务变得困难得多。文本可能会随着疾驰而过的汽车而变得模糊,可能只出现刹那之间,或者散落在不同的时间点上。理解运动中的文本不仅需要“看见”,更需要记忆、连接以及跨越一系列事件进行推理。

一支研究团队现在仔细观察了这些先进系统在动态视频世界中处理文本的表现。他们构建了一个名为 MME-VideoOCR 的新测试场,这是一个综合性的视频片段集合,旨在针对人类眼睛和大脑在处理移动文本时感到困难的特定方式来挑战机器。这个基准测试不仅仅是要求计算机读取一个单词;它要求计算机去寻找赛车上的特定数字,追踪车辆变换车道时的车牌,或者拼凑出一个被拆分并散落在数秒钟画面中的句子。研究人员收集了 1,464 个视频,涵盖从短片到长序列的各种类型,覆盖了驾驶、烹饪、看新闻和听讲座等 44 种不同的现实场景。对于每个视频,他们精心设计了两千个问答对,并经过人类专家验证,以确保准确性和公平性。

当他们将 18 个最先进的视频阅读模型投入测试时,结果揭示了当前能力与现实世界需求之间的显著差距。即使是表现最好的系统——一个被称为 Gemini-2.5 Pro 的强大模型,也仅能实现 73.7% 的正确率。虽然这看起来是一个很高的分数,但研究人员发现,在需要观察整个视频并在时间维度上连接信息的任务中,模型的表现大幅下滑。例如,当被要求识别由移动物体路径形成的字母,或从散落在不同帧中的随机顺序字母中重构一个单词时,顶尖模型的得分接近于零。它们可以清晰地读出单帧画面中可见的标牌,但当信息分散开来时,它们往往会失去线索。

研究还揭示了这些机器思考时的一种奇特习惯。当面对模糊或拼写错误的文本时,模型经常忽略屏幕上实际显示的内容,而是根据常见的语言模式去猜测文本“应该”是什么。如果视频中的标牌清晰地显示为“OFF COURS”(缺少一个字母),模型往往会自信地报告为“OFF COURSE”,即优先考虑其关于单词通常如何拼写的内部知识,而非视觉证据。这种依赖于“预期所见”而非“实物所见”的倾向表明,这些系统仍然深受其书面语言训练的影响,有时甚至以牺牲视觉准确性为代价。

此外,研究人员发现视频输入的质量至关重要。当他们向模型输入低分辨率图像或较少的视频帧时,性能会急剧下降。机器需要高清晰度的画面以及足够的时间片段来拼凑出完整的故事。这一发现强调了仅仅让模型变得更大或更聪明是不够的;它观察世界的方式必须是清晰且连续的。研究结论指出,尽管这些人工智能在静态图像读取方面取得了巨大进步,但它们仍缺乏完全理解文本在运动中那种流动、破碎且往往混乱本质的能力。未来的道路不仅需要更好的算法,还需要更深层次的视觉记忆集成,以及抵抗基于习惯进行猜测的冲动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →