Do Transformers Understand Ancient Roman Coin Motifs Better than CNNs?
本文介绍了视觉 Transformer (ViT) 在利用多模态数据对古罗马钱币语义元素进行自动识别方面的首次应用,证明了 ViT 模型在准确率上优于传统的卷积神经网络 (CNN)。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一座巨大的、布满灰尘的古罗马钱币图书馆。有些钱币闪闪发光,有些已经磨损,还有许多被泥土覆盖。几个世纪以来,只有经过数十年训练的少数专家才能盯着这些微小的图案,眯起眼睛说:“啊,这枚有一个马,”或者“这枚有一个盾牌。”
这篇论文讲述了如何教计算机完成同样的工作,但有一个转折:研究人员想看看一种被称为视觉 Transformer (Vision Transformer, ViT) 的新型“计算机大脑”是否比传统的卷积神经网络 (Convolutional Neural Network, CNN) 更擅长此道。
以下是他们实验的故事,用简单的术语进行了拆解。
问题所在:100,000 枚钱币的图书馆
研究人员从一个在线拍卖网站开始,收集了 100,000 张钱币图像及其描述。可以把它想象成一大堆拼图碎片。
- 挑战: 古代钱币非常棘手。它们经常有划痕,图案是风格化的(而非写实的),而且同一种类型的钱币可能会因为使用的模具(die)不同而略有差异。
- 目标: 他们不仅仅是想让计算机进行“找孪生兄弟”(即匹配一枚钱币与另一枚)的游戏,而是希望计算机能理解图像的“含义”。计算机能否识别出一个“丰饶角”(cornucopia)?它能否分辨出一个人物是“站立”还是“坐着”?
对手:老派守卫 vs. 新人
为了解决这个问题,他们让两种不同的计算机架构展开了对决:
CNN(“局部侦探”):
想象一位侦探,通过逐一检查微小的局部区域来观察图片。他看左上角,然后看右上角,再看中间。他非常擅长发现局部模式,比如特定的曲线或线条。然而,他有时会产生“隧道视野”,过于关注某一个微小的点而忽略了大局。ViT(“全局观察者”):
视觉 Transformer 是这个领域的新人。它不像侦探那样逐个查看局部,而是想象一位侦探能瞬间观察整幅图像,并理解左上角是如何与右下角联系在一起的。它将图像视为一个句子,其中每个部分都与其他部分相连。这使得它能够看到局部侦探可能会错过的“长程”联系。
实验:训练大脑
研究人员首先必须清理数据。原始照片经常同时显示钱币的两面(正面和背面)或多枚钱币堆在一起。他们编写了一个程序,专门切出钱币的背面(“背面/reverse”),因为背面通常包含更有趣的图案。
随后,他们将这些清理后的图像输入到两类计算机中。
- CNN 是针对一个特定概念进行训练的(例如:“寻找所有的鹰”)。
- ViT 则是一个“多面手”;它在一个模型中同时学习识别所有概念(鹰、盾牌、马等)。
结果:谁赢了?
训练完成后,他们在从未见过的钱币上测试了这些计算机。
- 获胜者: 视觉 Transformer (ViT) 通常赢得了胜利。它在识别语义元素(图案)方面的准确度高于 CNN。
- 速度: CNN 的训练速度快得多(像短跑运动员),而 ViT 的训练时间要长得多(像马拉松选手),但在准确度方面,ViT 最终跑出了更好的成绩。
- “为什么”: 研究人员发现,ViT 更好地处理了钱币杂乱、磨损的特性。当图像与预期稍有不同时,它不会像 CNN 那样轻易感到困惑。
“X 射线视觉”(显著性图/Saliency Maps)
为了理解计算机是如何思考的,研究人员使用了一种叫做“显著性映射”的工具。这就像是对图像进行 X 射线扫描,以观察计算机在做决定时正在注视哪些部分。
- CNN 的 X 射线: CNN 倾向于关注一个特定的、微小的点。例如,在寻找鹰时,它几乎总是盯着钱币的右下角,因为那里经常出现鹰的翅膀。这就像是一个只会死记硬背“鹰总是在右下角”的学生,而不是真正识别出了那只鸟。
- ViT 的 X 射线: ViT 的焦点更加分散且多样化。有时它看鹰的羽毛,有时看背景,有时看附近的文字。它的注视点很难预测,但这表明它实际上是在“理解”整个场景,而不仅仅是记忆某个位置。
缺陷:噪声标签
论文承认了实验中的一个主要缺陷:他们给计算机提供的“答案”是混乱的。
计算机是使用拍卖网站上的文本描述进行训练的。但这些描述经常同时提到钱币的两面。
- 例子: 一个描述可能会说:“正面:皇帝头像。背面:一只站立的马。”
- 错误之处: 计算机只看到了背面(马),但标签却写着“站立”。然而,有时描述之所以提到“站立”,是因为指的是钱币的“正面”,尽管背面并没有站立的人物。
- 结果: 计算机有时是在根据错误的线索进行学习。研究人员指出,这种“噪声”可能限制了两个模型的表现,尤其是在处理“站立”或“坐着”这类概念时。
结论
论文得出结论,视觉 Transformer 是研究古代钱币的一种极具前景的新工具。 它们的表现优于旧有的 CNN 模型,这表明“全局观察者”的方法更适合应对复杂、混乱的古代历史世界。
然而,研究人员也警告说,为了获得更好的结果,我们需要更干净的数据。如果我们能教会计算机在观察“钱币背面”时忽略“钱币正面”的文字,这些数字历史学家将会变得更加强大。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。