在现代计算机静谧的嗡鸣声中,一种新型的智能正在学习如何观察。这些被称为多模态大语言模型的系统,旨在不仅处理文字,还处理图像和视频,将它们融合进单一的理解流之中。它们在从静态图片中读取文本方面已变得异常熟练,能够将一张街标或文档的照片转化为高精度的数字文字。这种能力为机器进入现实世界、阅读指令以及组织信息打开了大门。然而,现实世界很少是静止的。它在移动、在变化。当这些同样的智能系统被要求从动态视频中读取文本时,这项任务变得困难得多。文本可能会随着疾驰而过的汽车而变得模糊,可能只出现刹那之间,或者散落在不同的时间点上。理解运动中的文本不仅需要“看见”,更需要记忆、连接以及跨越一系列事件进行推理。
一支研究团队现在仔细观察了这些先进系统在动态视频世界中处理文本的表现。他们构建了一个名为 MME-VideoOCR 的新测试场,这是一个综合性的视频片段集合,旨在针对人类眼睛和大脑在处理移动文本时感到困难的特定方式来挑战机器。这个基准测试不仅仅是要求计算机读取一个单词;它要求计算机去寻找赛车上的特定数字,追踪车辆变换车道时的车牌,或者拼凑出一个被拆分并散落在数秒钟画面中的句子。研究人员收集了 1,464 个视频,涵盖从短片到长序列的各种类型,覆盖了驾驶、烹饪、看新闻和听讲座等 44 种不同的现实场景。对于每个视频,他们精心设计了两千个问答对,并经过人类专家验证,以确保准确性和公平性。
当他们将 18 个最先进的视频阅读模型投入测试时,结果揭示了当前能力与现实世界需求之间的显著差距。即使是表现最好的系统——一个被称为 Gemini-2.5 Pro 的强大模型,也仅能实现 73.7% 的正确率。虽然这看起来是一个很高的分数,但研究人员发现,在需要观察整个视频并在时间维度上连接信息的任务中,模型的表现大幅下滑。例如,当被要求识别由移动物体路径形成的字母,或从散落在不同帧中的随机顺序字母中重构一个单词时,顶尖模型的得分接近于零。它们可以清晰地读出单帧画面中可见的标牌,但当信息分散开来时,它们往往会失去线索。
研究还揭示了这些机器思考时的一种奇特习惯。当面对模糊或拼写错误的文本时,模型经常忽略屏幕上实际显示的内容,而是根据常见的语言模式去猜测文本“应该”是什么。如果视频中的标牌清晰地显示为“OFF COURS”(缺少一个字母),模型往往会自信地报告为“OFF COURSE”,即优先考虑其关于单词通常如何拼写的内部知识,而非视觉证据。这种依赖于“预期所见”而非“实物所见”的倾向表明,这些系统仍然深受其书面语言训练的影响,有时甚至以牺牲视觉准确性为代价。
此外,研究人员发现视频输入的质量至关重要。当他们向模型输入低分辨率图像或较少的视频帧时,性能会急剧下降。机器需要高清晰度的画面以及足够的时间片段来拼凑出完整的故事。这一发现强调了仅仅让模型变得更大或更聪明是不够的;它观察世界的方式必须是清晰且连续的。研究结论指出,尽管这些人工智能在静态图像读取方面取得了巨大进步,但它们仍缺乏完全理解文本在运动中那种流动、破碎且往往混乱本质的能力。未来的道路不仅需要更好的算法,还需要更深层次的视觉记忆集成,以及抵抗基于习惯进行猜测的冲动。
技术摘要:MME-VideoOCR
问题陈述
尽管多模态大语言模型(MLLMs)在静态图像的光学字符识别(OCR)方面已取得了显著的准确性,但它们在视频场景中的效能仍然显著下降。视频内容引入了独特的挑战,例如运动模糊、时间变化和视觉效应,这些都会降低性能。此外,现有的基准测试主要侧重于静态图像 OCR 或狭窄的视频感知任务,往往忽略了动态视频理解所需的更深层次的基于文本的理解与推理。目前的评估未能充分解决对时空视觉-文本关联、跨多帧碎片化信息整合以及在视频语境下对识别出的文本进行推理的需求。
方法论
为了填补这些空白,作者推出了 MME-VideoOCR,这是一个旨在评估 MLLMs 在视频场景下基于 OCR 能力的综合基准测试。
基准构建:
- 数据收集: 该基准包含 1,464 个视频,涵盖 9 个主要场景类别(如日常生活、教育、体育、商业)和 44 个特定场景类型。数据来源包括现有的视频问答数据集(如 BOVText、M4-ViteVQA)、人工收集的公开视频(YouTube、Bilibili、快手)以及用于覆盖新兴合成内容的 AI 生成视频(使用 Wan 和 Llama3.1-8B)。
- 标注质量: 为了确保可靠性,作者采用了严格的人工标注流程,涉及 2,000 个问答(QA)对的创建。这包括一个两阶段筛选过程(初步标注后进行专家筛选)以及专家验证,以纠正歧义并确保答案分布平衡。
- 去偏差: 进行了一项特定的去偏差测试,以量化并最小化文本先验和知识泄漏的影响。模型在没有视觉输入的情况下进行评估,以确保其依赖于视频内容而非预训练的语言偏见。
- 任务分类法: 该基准定义了 10 个类别下的 25 个不同任务:
- 文本识别: 指定位置和特定属性。
- 视觉文本问答: 以文本为中心的问答和翻译。
- 文本定位: 空间和时间定位。
- 属性识别: 颜色、命名实体识别和计数。
- 变化检测与追踪: 检测文本变化并追踪移动的文本元素。
- 特殊文本解析: 表格、图表、文档、数学公式和手写体。
- 跨帧文本理解: 滚动文本、轨迹识别和乱序识别。
- 基于文本的推理: 需要综合分散线索的复杂推理。
- 基于文本的视频理解: 基于字幕的理解和多跳“大海捞针”任务。
- 鲁棒视频测试: 在 AIGC 视频、长视频和带有插入黑帧的对抗性视频上进行评估。
评估指标:
作者根据任务类型采用了三种指标:
- 包含匹配(Containment Match): 用于开放式文本识别任务。
- GPT 辅助评分: 用于处理语义等价性的翻译任务。
- 多选题: 用于需要定位或复杂推理的任务,以减少评分歧义。
核心贡献
- 全面的基准测试: MME-VideoOCR 提供了一套多样化的 25 个视频 OCR 任务,涵盖感知、上下文理解和跨帧推理,并利用人工策划的高质量 QA 对。
- 广泛的评估: 本文评估了 18 个最先进的 MLLMs,包括闭源模型(GPT-4o、Gemini-2.5 Pro、Gemini-1.5 Pro)和参数规模从 7B 到 78B 不等的开源模型(如 Qwen2.5-VL、InternVL3、LLaVA-Video)。
- 实证发现: 研究揭示了当前模型中存在的显著性能差距和特定的失效模式,特别是在时间整合和语言先验偏见方面。
实验结果
- 整体性能: 即便是表现最好的模型 Gemini-2.5 Pro,其准确率也仅为 73.7%。表现最差的模型 LLaVA-OneVision 7B 得分为 46.0%。
- 规模效应: 更大的参数规模通常与更高的准确性相关联(例如,Qwen2.5-VL 72B 的表现优于 7B 版本),但架构起着关键作用。使用 Token 压缩方法的模型(如 VideoChat-Flash、Slow-fast MLLM)表现出明显的劣势,表明在 Token 合并过程中存在信息丢失。
- 特定任务缺陷:
- 跨帧理解: 模型在需要多帧整合的任务上表现挣扎。大多数模型在“跨帧文本理解”任务上的得分低于 25%,且在前 5 名模型中,轨迹识别的准确率为 0%。
- 时间整合: 虽然模型在文本出现在单帧中的任务(如基于字幕的视频理解)上表现良好,但在信息分散在多个帧中的任务(如多跳“大海捞针”)上则会失败。
- 语言先验偏见: 模型经常优先考虑语义合理性而非视觉保真度,将视频中拼写错误的文本纠正为符合常见语言模式的形式(例如,将 "throuh skin" 识别为 "through skin")。
- 输入敏感性: 实验表明,高分辨率视觉输入和充足的时间覆盖(帧数)对于可靠的 OCR 至关重要。降低分辨率或减少帧数会显著降低性能。
重要性与主张
本文主张 MME-VideoOCR 可作为引导实际 MLLMs 训练和优化的关键工具。通过暴露当前模型在处理动态视频文本方面的局限性——特别是在时空推理、跨帧信息整合以及抵御语言偏见方面——该基准强调了未来发展的必要方向。作者断言,要在动态视频场景中实现可靠的 OCR,不仅需要更好的文本识别,还需要强大的时间上下文聚合机制以及减少对语言先验的依赖。该基准旨在推动 MLLMs 向能够有效利用文本作为全面视频理解核心驱动力的方向发展。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。