← 最新论文
🤖 AI

Logographic Character Visual Pretraining via Semantic-based Contrastive Learning

本文提出了一种新颖的基于语义的对比学习预训练策略,该策略利用多模态视觉与上下文语义来增强用于表意文字识别的深度视觉表示,从而有效解决了由不平衡且稀有的字符数据集所导致的性能限制问题。

原作者: Daqian Shi, Wei Cao, Xiaoyu Zheng, Lida Shi, Xiaolei Diao, Cedric M John

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Daqian Shi, Wei Cao, Xiaoyu Zheng, Lida Shi, Xiaolei Diao, Cedric M John

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人识别世界上每一个字符,从你名字里的字母到刻在石碑上的古老符号。这就是计算机视觉的世界——人工智能的一个分支,在这里,机器学习如何“看”并理解图像。长期以来,这些机器人非常擅长识别像猫或汽车这样简单的物体,但在处理语素文字(logographic characters)时却显得力不从心——这类书写系统中的一个符号代表一个完整的词或概念,例如汉字或日文汉字。问题不仅在于这些字符有成千上万个,还在于有些字符每天都在使用(如“的”或“水”),而另一些则极其罕见,可能千年才出现一次。这就像是在学习一门语言,其中有一百万个“苹果”的副本,却只有一个“斑马”的副本。机器人会感到困惑,过度关注常见的词汇,从而遗忘了那些罕见的词汇。为了解决这个问题,科学家们使用了一种叫做对比学习(contrastive learning)的技术,这就像是一场“找不同”的游戏。机器人会被展示两张图片,并被问到:“它们是同一个吗?”如果是,它会在大脑中将它们拉近;如果不是,则将它们推开。但问题在于:机器人通常将每一对“不同”的组合视为同样不同,这在面对某些差异细微而另一些差异明显的场景时并不奏效。

这篇论文介绍了一种聪明的新方法,通过给机器人一个参考依据——上下文(context),来教它更好地理解稀有和常见的字符。作者们是一支来自英国和中国大学的研究团队,他们意识到,仅仅观察字符的形状是不够的。在人类语言中,我们理解单词不仅是通过它们的外观,还通过它们所处的环境。例如,“果园”会让你想到树木和水果,而“花园”会让你想到鲜花和路径。尽管它们是不同的词,但在语义上是接近的。研究人员注意到,语素文字也是如此运作的:一个看起来像鱼的字符通常意味着“鱼”,且具有相似含义的字符往往拥有相似的视觉部分。他们提出了一种名为基于语义的对比学习(Semantic-based Contrastive Learning)的方法。他们不再只是告诉机器人,“这两个不同,把它们推开”,而是利用一个语言模型(一个超级聪明的文本预测器)来告诉机器人它们到底有多么不同。如果两个字符在语义上接近(如“果园”和“花园”),机器人会被告知保持它们在一定程度上的接近,即使它们看起来不同。如果它们完全无关,则将其推得更远。这创造了一个关系的“软”地图,而非一个僵化的黑白列表。

该团队在多个数据集上测试了这一想法,包括手写汉字、日本历史文献以及现实世界的街头标牌。他们发现,由于其新方法在数据杂乱且不平衡的情况下表现尤为出色,其性能显著优于现有的最先进技术。例如,在一个存在严重失衡的 HWDB1.1 数据集上(其中最常见的类别样本量是最稀有类别的 100 倍),他们的方法在使用标准 ResNet18 骨干网络时达到了 83.46% 的准确率,击败了此前表现最好的对比学习方法 SimCLR(仅达到 56.68%)。即使在更平衡的 K-Kanji 数据集上,他们的方法也达到了 95.30%,以明显的优势超越了次优方法。研究人员还进行了“消融实验”(即通过关闭系统部分组件来进行实验),以证明视觉学习和上下文参考都是必要的;仅使用其中之一都会导致得分降低。他们还发现,仅仅尝试匹配单词之间的精确距离(一种称为 MSE 的方法)效果并不如匹配关系“模式”(分布级对齐)好。通过将字符之间的关系视为一个灵活的、等级分明的光谱,而非一条固定的规则,机器人能够以更高的信心识别出即使是最罕见、最晦涩的字符。这表明,通过借鉴人类理解上下文的方式,我们可以为阅读世界上最复杂的书写系统构建更聪明、更均衡的人工智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →