ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation
本文介绍了第一个具有定位能力的对抗性 OCR 基准测试 AdvSpot,并提出了 ArmorOCR,这是一个利用观测转移自蒸馏和组相对策略优化(GRPO)的两阶段训练框架,旨在显著增强大型多模态模型针对对抗性视觉文本的鲁棒性,同时保持通用的 OCR 性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,出现了一类被称为“大型多模态模型”的新兴系统。这些是强大的计算机,能够像人类观察街标或手写便条的照片一样,看到图像并读取其中的文本。多年来,这些系统在阅读清晰、标准的文本方面已经变得非常出色。然而,人类视觉与机器视觉之间出现了一个显著的差距。人类拥有一种直觉能力,即使在文本被隐藏、扭曲或融入复杂背景时,也能拼凑出其含义。我们可以通过观察点阵图案,瞬间理解它们所构成的单词,或者阅读印在拥挤衬衫上的微小文字。相比之下,目前的各种人工智能在处理这些特定任务时往往会失败。它可能会观察同一张图像,却只看到了噪声,完全忽略了文本,或者聚焦在了错误的图像部分。这种脆弱性不仅仅是一个小故障;它揭示了这些机器在感知视觉世界方面的根本缺陷,使它们无法处理现实世界中那些杂乱、经过处理的文本。
研究人员长期以来一直试图通过教计算机对图像进行更深入的“思考”来解决这个问题,通常是要求它们对图片进行放大、裁剪或翻转,以揭示隐藏的细节。虽然这行之有效,但每次计算机查看图片时都需要额外的步骤,速度较慢。一项新研究引入了一种不同的方法,即教导模型在无需预先改变图像的情况下,就能瞬间识别出这些隐藏的模式。由林汉·曹(Linhan Cao)及其同事领导的这项工作,首先创建了一个新的测试场,名为 AdvSpot。这是一个由 390 张图像组成的集合,专门设计用来“陷阱”人工智能。这些图像包含人类可以阅读但对机器具有挑战性的文本,并分为 13 种不同类型的视觉技巧。这些技巧范围广泛,包括旋转或镜像的文本,以及隐藏在复杂图案中的单词,甚至包括看起来像是手写或由其他人工智能系统生成的字母。该数据集的独特之处在于,它不仅要求计算机猜测单词,还要求计算机精确指出文本所在的位置、读取它并回答相关问题,从而确保机器确实看到了正确的部位,而不仅仅是基于上下文进行猜测。
为了解决这些棘手图像的问题,研究人员开发了一种名为 ArmorOCR 的新训练方法。他们意识到,虽然计算机可能难以识别原始形式的单词,但如果将图像稍微拉伸、旋转或缩放,同一个单词可能会变得易于阅读。研究人员并没有要求计算机在每次看图时都执行这些变换,而是教导模型在训练期间从中学习。他们建立了一个两步学习过程。在第一步中,他们使用了一个能够以多种变换方式观察图像的“教师”模型。这个教师模型由于能在图像经过处理后清晰地看到文本,因此可以引导一个仅能看到原始、困难图像的“学生”模型。教师模型不仅给出答案,还会通过分享其对变换视图的内部理解,向学生展示如何感知隐藏的文本。这使得学生能够在实际测试中,无需看到这些技巧,就能内化这种看穿视觉技巧的能力。
第二步训练侧重于优化模型如何利用这种新能力。研究人员根据模型正确完成不同部分任务的表现给予特定的奖励。如果模型成功指出了图像中的正确区域,它会获得定位奖励;如果它正确读取了文本,它会获得识别奖励;如果它能在单张图像中找到所有隐藏文本并回答相关问题,它也会获得相应的任务奖励。通过结合这些奖励,模型学会了同时平衡所有这些技能。结果是一个能够观察单张未经修改的图像,并能瞬间识别、阅读并解释此前对机器而言不可见的文本的系统。
在测试其新基准测试时,结果令人瞩目。大多数现有的 AI 模型,包括一些最庞大且最先进的模型,在 AdvSpot 测试中的得分都非常低,经常在超过一半的情况下无法识别文本。然而,新的 ArmorOCR 系统显著超越了它们。它大幅提升了识别对抗性文本的能力,在各项指标中均取得了最高的准确率。至关重要的是,研究人员发现这种新训练并没有降低模型阅读普通、清晰文本的能力。该系统在处理标准阅读任务时,与之前一样出色,证明了它在习得新技能的同时并未丢失旧有的技能。这项研究表明,通过教导模型在训练期间从变换视图中学习,我们可以构建出更加稳健且可靠的人工智能,使其能够应对人类日常生活中所面对的复杂且经过处理的视觉世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。