Do VLMs Read or Rewrite? On Transcription Faithfulness in Vision-Language Models
本文介绍了 FaithC4 基准测试,旨在证明视觉-语言模型往往会将不完美的文本改写为看似合理的形式,而非进行忠实转录,从而揭示了不同模型类型之间截然不同的退化模式,并识别出了触发这种改写行为的具体层表示和词长。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人阅读你祖母的一封手写信。你期望这个机器人表现得像一台超级精确的复印机,捕捉每一个扭曲、污渍或拼写错误的单词,原样呈现。这就是光学字符识别(OCR)的技术,这项技术存在了几十年,旨在将文本图像转化为数字文字。但最近,一种新型机器人出现了:视觉语言模型(VLM)。你可以把它们想象成不仅能“看到”字母,还能“思考”句子应该表达什么意思的机器人,它们将摄像头与一个经过整个互联网训练的极其聪明的“大脑”结合在了一起。
核心问题在于:当这些聪明的机器人看到一个混乱的单词时,它们是忠实地复制,还是试图去“修复”它?这有点像人类经历的“拼写错乱”(typoglycemia)效应——即使单词中间的字母被打乱了,我们仍然能读懂句子,因为我们的大脑会猜测原本的词。虽然这对人类很有帮助,但如果你的需求是一个法律合同或历史信件的完美、字面副本,这对机器人来说可能是一场灾难。如果机器人决定“纠正”一个原本属于原始文档的一部分的拼写错误,那么它记录的是被改写的历史,而非真实的记录。本论文深入探讨了这些新型 AI 机器人究竟是忠实的抄写员,还是过度热心的编辑。
VLM 是在阅读还是在重写?
在这项研究中,来自亚马逊的研究人员旨在测试这些视觉语言模型(VLM)的一个特定习惯:当它们看到一个看起来有点奇怪的单词时,它们是如实读取,还是在心里偷偷将其重写为更有意义的内容?
为了查明真相,团队创建了一个特殊的游乐场,名为 FaithC4。想象一下,他们提取了数千页正常的英文、中文和韩文文本页面。然后,他们在将这些文本转化为图像之前,玩了一场单词版的“传声筒”游戏。他们选取了 8% 的目标单词,并以三种创意方式对其进行了破坏:
- 打乱(Scramble): 他们打乱了内部字母的顺序(例如将 "standard" 变成 "sdanartd")。
- 随机(Random): 他们将字母替换为完全随机的其他字母(例如 "xkpmewqi")。
- 视觉(Visual): 他们将字母替换为外观几乎相同的字母(例如将 'a' 变成 'c',或将 'o' 变成 '0')。
随后,他们将这些“破碎”的图像展示给 15 个不同的系统。这些系统分为三组:
- 旧守卫(The Old Guard): 传统的 OCR 工具(如 Tesseract),它们仅仅观察像素并判断“这看起来像个 'a'”。
- 专家型(The Specialists): 专门针对文档阅读进行训练的 VLM。
- 通用型(The Generalists): 那些擅长数学到诗歌等各种领域的强大通用型 VLM(如 Qwen、GPT-4V 和 Gemini)。
结果:聪明的机器人太聪明了
研究结果令人惊讶,对于任何需要完美副本的人来说也有些令人担忧。研究人员发现,机器人越“聪明”,就越倾向于重写文本。
- 旧守卫(传统 OCR): 它们是最忠实的。当文本被弄乱时,它们的回答几乎没有变化。其错误率上升不到 0.6 个百分点。它们只是看到了混乱,并复制了混乱。
- 专家型: 它们的表现比通用型稍好,但仍会做出一些改动。它们的错误率上升了 0.2 到 2 个百分点。
- 通用型: 它们在忠实度方面表现最差。当文本被打乱或进行视觉修改时,它们的错误率跃升了高达 4.5 个百分点。
为什么会这样?因为这些通用型模型非常擅长预测一个句子“应该”长什么样,因此它们经常忽略实际写了什么。如果它们看到 "prbolem",它们会自信地输出 "problem",即便图像清晰地显示为 "prbolem"。这就像一个学生对数学题的答案了如指掌,以至于他忽略了老师在黑板上潦草书写的错误,直接写下了正确答案。
隐藏机制:重写何时发生?
为了理解为什么会发生这种情况,研究人员逐层观察了其中一个模型 Qwen3-VL-4B 的“大脑”。他们想看看机器人是由于“看不见”错误,还是仅仅选择了“忽略”错误。
他们发现了一个迷人的规律:只有当机器人认为该单词看起来仍然“熟悉”时,它才会进行重写。
- 如果机器人对打乱后的单词的内部表示仍然非常接近原始单词(就像一张模糊的照片看起来仍像一只猫),机器人就会说:“哦,这绝对是‘猫’!”然后进行重写。
- 但如果打乱程度过大,导致内部表示偏离原始单词太远(照片变成了一个色块),机器人就会停止猜测,最终如实转录所见。
这解释了为什么单词长度如此重要。短单词(4 到 6 个字母)会有高达 10% 的概率被重写,因为对于机器人来说,猜测原词很容易。但一旦单词达到 8 个字符或更长,重写率就会降至 0%。这种打乱程度超出了机器人的“猜测大脑”能够恢复的范围,于是它放弃了猜测,转而进行忠实的转录。
连锁反应
这是最令人惊讶的部分:弄乱仅仅几个单词的影响并不仅仅限于这些特定的单词。研究人员发现,对于通用型模型来说,仅仅破坏文档中 5% 的单词,就会导致那些完美、未受影响的单词的错误率上升 5 到 10 倍。
这就像机器人被其中一个拼写错误搞糊涂了,以至于它开始误读周围的整个段落。传统的 OCR 系统没有这个问题;即使在混乱的环境中,它们也能保持冷静和准确。
这意味着什么
论文得出结论:虽然这些高级 AI 模型在理解文档和回答问题方面非常出色,但它们并不可靠,无法胜任需要字面、完美副本的任务。如果你正在数字化一份历史手稿、检查一份法律合同,或者分析每一处拼写错误都至关重要的医疗记录,你应该坚持使用传统的 OCR 或专门工具。通用型 VLM 太渴望通过“修复”那些不该被修复的东西来提供“帮助”了。
研究人员建议,我们在使用这些模型时需要保持谨慎。仅仅因为一个模型能够阅读文档,并不意味着它会忠实地阅读。目前,如果你需要得到与原文完全一致的真相,那些老派的机器人仍然是最诚实的抄写员。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。