← 最新论文
💻 computer science

Multimodal Cultural Heritage Knowledge Graph Extension with Language and Vision Models

本文介绍了 WJoconde——一个多模态法国文化遗产知识图谱,并提出了一种新颖框架,该框架利用大语言模型和视觉语言模型,通过专门的验证流程以高可靠性自动扩展此类图谱。

原作者: Yang Zhang, Nada Mimouni, Jean-Claude Moissinac, Fayçal Hamdi

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Zhang, Nada Mimouni, Jean-Claude Moissinac, Fayçal Hamdi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一座规模宏大、细节极其丰富的法国艺术与历史图书馆。目前,这座图书馆的编排方式如同一张巨大的电子表格:它列出了绘画、雕塑和文物,并告知你它们的创作者、创作时间以及存放地点。这就是作者所称的知识图谱。它是一个结构化的事实地图。

然而,这张电子表格存在两个大问题:

  1. 它不完整:由于现实世界混乱且复杂,它缺失了海量的信息块。
  2. 它很枯燥:它只有文本。尽管图片就在那里,但它无法“看见”这些艺术作品。

这篇论文的作者希望解决这一问题。他们构建了一个名为WJoconde的全新、超级增强版的图书馆,并发明了一个巧妙的机器人团队来帮助填补缺失的空白。

以下是他们如何做到的简单解释:

1. 新图书馆:WJoconde

将原始的法国博物馆数据库(Joconde)想象成一个布满灰尘的档案馆。作者提取了该档案馆的精华部分,并将其与Wikidata(一个巨大的免费在线事实百科全书)连接起来。

他们创建了一个名为WJoconde的新版本。它的特别之处何在?

  • 它是多模态的:想象一张图书馆卡片,它不仅包含对一幅画的描述,还向你展示这幅画。WJoconde 将文本描述直接链接到艺术品的实际图像。
  • 它是一个基准:他们清洗了这些数据,并制作了三个不同的版本(一个原始版、一个清洗版、一个包含文本和图像的版),以便其他科学家可以用它来测试他们自己的 AI 工具。这就像给每个人提供一份标准化的“考试”,以查看谁能构建出最好的知识图谱。

2. 问题:“封闭世界”与“开放世界”

大多数试图填补缺失事实的 AI 系统,运作起来就像多项选择题。它们查看现有的答案列表,并猜测哪一个是缺失的。

  • 问题:如果答案不在列表中,AI 就会说:“我不知道。”
  • 现实:在艺术史中,“正确答案”可能是从未有人记录过的东西。AI 必须能够发明新的事实,而不仅仅是从菜单中选择。这被称为开放世界假设

3. 解决方案:机器人侦探团队

为了解决这个问题,作者构建了一个使用两种超智能 AI 机器人的流程(工作流):

  • 阅读者(LLM):大型语言模型(像超级智能的文本阅读器),用于阅读艺术描述。
  • 观看者(VLM):视觉语言模型(一个能“看见”并理解图像的机器人),用于观察绘画。

团队如何协作:

  1. 任务分配:系统获取一幅画,并问道:“这张图片里发生了什么?”
  2. 猜测:阅读者查看文本,观看者查看图像。它们都大声喊出各自的猜测(例如:“它展示了一匹马!”或“它展示了一场战斗!”)。
  3. 双重检查(关键步骤):这是最重要的一步。由于 AI 机器人有时会“产生幻觉”(编造内容),作者构建了一个验证流程
    • 他们检查阅读者的猜测是否与观看者的猜测相符。
    • 他们检查该猜测是否真的是一个事实,还是仅仅是已知事物的同义词(例如,确保如果数据库中已有“窗帘”,就不会再添加“窗帘”的复数形式)。
    • 他们甚至要求观看者再次查看图像以确认:“是的,我在这张图片中确实看到了马。”

4. 结果:更大、更好的地图

结果令人印象深刻。通过使用这个机器人团队:

  • 他们成功向数据库中增加了**61%**的更多事实。
  • 他们添加了数千个新细节,例如之前缺失的具体动作(马上长矛比武)、物体(剑)和场景(城市景观)。
  • 质量控制:当人类检查工作时,发现机器人**92%**的情况下是正确的。

核心结论

作者不仅构建了一个更大的数据库,还构建了一个系统,该系统能够观察一幅画及其描述,理解其中的故事,并将新的、准确的事实添加到数字地图中,而无需人类手动输入所有内容。

他们证明,通过结合文本阅读 AI 和图像识别 AI,并让它们互相检查工作,我们可以以一种既快速又可靠的方式自动扩展我们对文化遗产的认知。此外,他们还将所有代码和数据免费开放供任何人使用,以便其他研究人员可以尝试做得更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →