← 最新论文
💬 NLP

Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions

本文表明,对古希腊语文本执行光学字符识别的视觉 - 语言模型(VLMs)往往依赖语言先验来生成流畅但缺乏视觉依据的错误,这种失效模式即使在解码时进行干预后依然存在,并且与传统光学字符识别系统的噪声模式存在显著差异。

原作者: Antonia Karamolegkou, Nicolas Angleraud, Benoît Sagot, Thibault Clérice

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Antonia Karamolegkou, Nicolas Angleraud, Benoît Sagot, Thibault Clérice

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试阅读一封用古希腊语手写的古老信件。墨水已经褪色,字迹古怪,页面边缘还布满了杂乱的批注。你有两位助手帮你阅读:

  1. “老式扫描仪”(传统 OCR):这就像一个严格、字面化的机器人。它看着纸上的墨水说:“我看到一个看起来像'A'的波浪线,所以我写一个'A'。”如果墨水太模糊,它可能会写下一个随机符号或错别字。它不猜测;它只报告它看到的东西,即使结果看起来很杂乱。
  2. “智能 AI 助手”(视觉 - 语言模型):这就像一个精通古希腊语但有点懒得仔细观察纸张的聪明学生。当他们看到一个模糊的斑点时,他们会想:“嗯,根据到目前为止的句子,下一个词应该是‘国王’。”所以,他们写下“国王”,即使纸上的墨水实际上看起来更像“狗”。

这篇题为《阅读还是猜测?视觉 - 语言模型在古希腊语版本 OCR 中的视觉 grounding 失败》的论文,调查了当这两位助手尝试阅读困难、低资源量的古希腊语文本时会发生什么。

以下是研究人员发现的,使用了简单的类比:

1. “流利的谎言”与“杂乱的真相”

当“老式扫描仪”犯错时,它通常看起来像错别字或字母的乱码(例如"kng")。很明显出了什么问题。

然而,当“智能 AI 助手”犯错时,它经常写出一个完美、流利且真实的古希腊语单词,但这并不是纸上实际写的内容。

  • 类比:想象 AI 正在阅读食谱。如果配料表被弄脏了,写着“面粉”,但 AI知道这个食谱通常要求用“糖”,它可能会自信地写下“糖”。乍一看,句子看起来完美无缺。但这实际上是一个谎言。AI 依赖的是它对食谱通常如何编写的记忆(它的“语言先验”),而不是观察它面前的具体纸张。

2. “魔法墨水”测试

为了证明这一点,研究人员玩了一个把戏。他们打乱了文本,将单词内部的字母重新排列(将真实的单词变成无意义的胡言乱语),然后将这些胡言乱语展示给助手们看。

  • 老式扫描仪:它看着这些胡言乱语,写下了胡言乱语。它忠实于视觉证据,即使结果是垃圾。
  • 智能 AI 助手:它看着这些胡言乱语,感到困惑,然后“修复”了它。它将胡言乱语重写回真实、流利的希腊语单词。它忽略了视觉证据(打乱的字母),完全依赖其对语言的内部知识。

3. 并非所有“智能”AI 都一样

研究人员发现了一个令人惊讶的反转。并非所有 AI 助手的行为都一样。

  • 通用型 AI:这些是用于许多任务的大型知名模型。即使它们错了,它们仍然在“看”图片。它们试图阅读墨水,但它们的大脑只是太急于猜测正确的单词。
  • 专用型 AI:有一个专门为阅读文档而构建的模型(称为 OlmOCR)。这是最严重的违规者。当它犯错时,几乎就像它根本没有看图片。它纯粹是根据它认为文本应该说什么来进行猜测。这就像一个闭上眼睛、凭记忆背诵教科书而忽略实际考卷的学生。

4. 我们能修复 AI 吗?

研究人员尝试了几种“补丁”来迫使 AI 查看图片而不是猜测:

  • “词汇围栏”:他们试图告诉 AI:“你只能写希腊字母。”结果:这让情况变得更糟。AI 感到困惑,开始写胡言乱语,因为它无法使用它通常的把戏。
  • “对比测试”:他们试图同时向 AI 展示图片和图片的模糊版本,以迫使其关注细节。结果:这对某些模型有一点帮助,但对专用模型没有帮助。
  • “赛后编辑”:他们让 AI 先写下答案,然后让第二个 AI(纯文本编辑器)修正错误。结果:这很好地清理了文本,但并没有解决根本问题。第一个 AI 仍然忽略了图片;第二个 AI 只是在谎言被说出后进行了修正。

主要启示

主要的教训是,仅仅因为 AI 的答案听起来完美且流利,并不意味着它实际上阅读了文档。

在古代历史和稀有文档的世界里,这是危险的。如果数字图书馆使用这些 AI 模型扫描古老的希腊书籍,AI 可能会悄悄地将一个罕见、生僻的词替换为一个常见、"合理"的词。阅读数字版本的历史学家永远不会知道发生了这种变化,因为句子在语法上看起来仍然完美。

该论文得出结论,我们需要新的方法来测试 AI,而不仅仅是检查最终得分是否高,而是要检查 AI 是否真正"grounded"在视觉证据中,或者它是否只是根据它认为应该存在的内容进行猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →