← 最新论文
💻 computer science

DiffImaginE: Imagine to Verify Entity Types with Diffusio

本文介绍了 DiffImaginE,一种新颖的多模态命名实体识别框架,该框架通过使用类型条件的潜在扩散模型取代确定性视觉验证器,以生成概率基础的兼容性评分,从而通过更好地捕捉实体类型的多样化视觉呈现,在 Twitter 数据集上实现了持续的性能提升。

原作者: Feng Zhang, Feiyu Han, Rongxin Yang, Yang Liu, Yancheng Chen, Rui Wang, Yingguang Yang, Tian Xueyun, Chongyang Zhang, Hao Zheng, Xu Kefu, Congjing Ran, Fuhai Chen, Bin Chong

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Feng Zhang, Feiyu Han, Rongxin Yang, Yang Liu, Yancheng Chen, Rui Wang, Yingguang Yang, Tian Xueyun, Chongyang Zhang, Hao Zheng, Xu Kefu, Congjing Ran, Fuhai Chen, Bin Chong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在一个拥挤的房间里破解一个谜团。你看到一个人,但不确定那是一位名演员、一位地方政客,还仅仅是一个普通的游客。在人工智能的世界里,这被称为“命名实体识别”(Named Entity Recognition)。当我们把图片也加入其中时——比如看到那个人身边有一条红地毯或一张竞选海报——这就变成了“多模态命名实体识别”(Multimodal Named Entity Recognition)。其目标是结合文本和图像来推测出正确的类别。但问题的关键在于:同一个词根据视觉线索的不同,可能会有完全不同的含义。一张关于“乔丹”(Jordan)的照片可能指代一名篮球运动员、一个鞋履品牌或一个地方。AI 需要成为一名侦探,不仅要进行猜测,还要实际“检查”其猜测是否与证据相符。

长期以来,AI 侦探使用一种叫做“想象”的方法。它们会观察一个词和一个类别,然后想象出一张代表该类别应有的、完美的单张图片。如果真实的图片看起来有点像那张想象中的图片,AI 就会说:“是的,就是它!”但这种方法存在缺陷:它过于僵化。一个“人”可以是一张脸、一个轮廓,或者远处的一个身影。仅仅想象一个完美的版本会错过所有其他的可能性,使得 AI 在面对混乱的现实世界时显得非常脆弱。这篇名为 DiffImaginE 的新论文提出了一种更聪明的玩猜谜游戏的方法。它不再想象一张静态的图片,而是使用一种“扩散”(diffusion)过程——这种技术类似于 AI 通过将随机噪声逐渐转化为清晰图像来生成艺术品的过程。通过从噪声中向后工作,AI 可以理解一个类别可能呈现的整个范围,而不仅仅是一个冻结的瞬间。

“一刀切”式想象的问题所在

这篇论文的作者注意到,旧的方法就像是试图通过只记得朋友戴着特定帽子时的样子来认出他们。如果你的朋友没戴帽子,或者换了顶帽子,你旧有的心理图像就会失效。用技术术语来说,旧模型将每种类型的实体(如“人”或“组织”)映射到数学空间中的一个固定点。它们会将真实图像与这个单一的点进行比较。如果真实图像稍有不同——例如,“人”是从侧面看到的而不是正面——这种比较就会失败,AI 就会感到困惑。

论文指出,这种“确定性”方法过于脆弱。它将实体丰富多样的呈现方式压缩成了一个单一、乏味的点。这就像是通过指向其中一棵树来描述整片森林。旧方法也无法真正告诉你一个猜测有多大的“可能性”;它只是根据图像与那个单一想象点的接近程度给出一个分数。

新型侦探:DiffImaginE

为了解决这个问题,团队构建了 DiffImaginE。它不再想象一张静态的图片,而是像一位能够想象出许多不同版本的嫌疑人的侦探。它使用了一种“扩散”模型,这是一种通过学习去除噪声(如旧电视上的雪花点)来揭示清晰图像的 AI 类型。

以下是其运作方式的简单解释:

  1. 证据: AI 查看句子中的一个特定词汇(“跨度/span”)以及与该词匹配的部分图像。
  2. 噪声测试: AI 不再将图像与一张完美的图片进行比较,而是给该图像添加随机“噪声”,使其变得模糊。
  3. 猜测: AI 随后会问:“如果这张模糊的图像属于‘人’这一类别,我能通过清理噪声来还原出一个清晰的‘人’吗?”它会对每一个可能的类别(人、地点、组织等)进行这样的尝试。
  4. 评分: 在“清理”噪声方面表现最好的类别将获得最高分。如果图像实际上是一个“人”,那么“人”过滤器在去除噪声方面会表现得非常好。如果你尝试用“组织”过滤器去处理一张人的照片,它在清理噪声时会很吃力,得分也会很低。

这是一个巨大的转变。与其问:“这张图看起来像不像我心中那个完美的‘人’?”,不如问:“哪个类别最擅长解释这张杂乱的、真实的图片?”这使得模型能够处理“人”可以是一个脸部、一个背影或一个远景的事实,因为扩散过程理解了各种可能性的多样性

他们的发现

研究人员在两个著名的社交媒体帖子数据集(Twitter-2015 和 Twitter-2017)上测试了他们的新模型,这些数据集充满了简短、嘈杂的文本以及随附的图像。他们将 DiffImaginE 与他们自己版本的旧有“单点想象”模型进行了对比,确保 AI 的大脑和训练方法完全相同,从而使唯一的变量就是验证方法。

结果显示,DiffImagnE 表现得更加出色。在 Twitter-2015 数据集上,它将准确率分数(F1)提高了 1.73 个点,达到了 77.17%。在 Twitter-2017 上,它提高了 0.72 个点,达到了 88.44%。论文指出,这些改进具有统计学意义,这意味着它们极不可能是偶然发生的。

该模型在识别“人物”(PER)和“组织”(ORG)方面表现尤为出色。例如,当视觉线索比较模糊时,它能更好地区分人名和品牌名。作者发现,当视觉证据具有多样性或存在噪声时,旧方法会表现挣扎,但新的扩散方法在这些条件下却能蓬勃发展,因为它并不依赖于单一、僵化的图像。

为什么这很重要

这篇论文并不声称已经解决了所有的 AI 问题,但它展示了 AI 如何处理视觉歧义的一个清晰路径。通过用一个灵活的、基于概率的“去噪”过程取代僵硬的、单点的猜测,AI 变得更加鲁棒(稳健)。这就像是一个不仅能识别特定装扮下的嫌疑人,还能在嫌疑人无论穿着什么或站在哪里都能认出他的侦探。

作者还展示了他们可以通过一种称为“无分类器指导”(classifier-free guidance)的技术来让过程变得更聪明,这种技术可以增强 AI 的信心;以及通过“对立采样”(antithetic sampling)来减少数学中的随机性,使结果更加稳定。这些微调帮助模型榨取出了更高的准确率。

简而言之,DiffImaginE 证明了在面对混乱的现实世界时,想象整个可能性的光谱,比固守于一个完美的幻想要好得多。该模型表明,通过拥抱“噪声”和现实图像的多样性,AI 可以成为一个更出色的侦探。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →