想象一下,你拥有一座规模宏大、细节极其丰富的法国艺术与历史图书馆。目前,这座图书馆的编排方式如同一张巨大的电子表格:它列出了绘画、雕塑和文物,并告知你它们的创作者、创作时间以及存放地点。这就是作者所称的知识图谱。它是一个结构化的事实地图。
然而,这张电子表格存在两个大问题:
- 它不完整:由于现实世界混乱且复杂,它缺失了海量的信息块。
- 它很枯燥:它只有文本。尽管图片就在那里,但它无法“看见”这些艺术作品。
这篇论文的作者希望解决这一问题。他们构建了一个名为WJoconde的全新、超级增强版的图书馆,并发明了一个巧妙的机器人团队来帮助填补缺失的空白。
以下是他们如何做到的简单解释:
1. 新图书馆:WJoconde
将原始的法国博物馆数据库(Joconde)想象成一个布满灰尘的档案馆。作者提取了该档案馆的精华部分,并将其与Wikidata(一个巨大的免费在线事实百科全书)连接起来。
他们创建了一个名为WJoconde的新版本。它的特别之处何在?
- 它是多模态的:想象一张图书馆卡片,它不仅包含对一幅画的描述,还向你展示这幅画。WJoconde 将文本描述直接链接到艺术品的实际图像。
- 它是一个基准:他们清洗了这些数据,并制作了三个不同的版本(一个原始版、一个清洗版、一个包含文本和图像的版),以便其他科学家可以用它来测试他们自己的 AI 工具。这就像给每个人提供一份标准化的“考试”,以查看谁能构建出最好的知识图谱。
2. 问题:“封闭世界”与“开放世界”
大多数试图填补缺失事实的 AI 系统,运作起来就像多项选择题。它们查看现有的答案列表,并猜测哪一个是缺失的。
- 问题:如果答案不在列表中,AI 就会说:“我不知道。”
- 现实:在艺术史中,“正确答案”可能是从未有人记录过的东西。AI 必须能够发明新的事实,而不仅仅是从菜单中选择。这被称为开放世界假设。
3. 解决方案:机器人侦探团队
为了解决这个问题,作者构建了一个使用两种超智能 AI 机器人的流程(工作流):
- 阅读者(LLM):大型语言模型(像超级智能的文本阅读器),用于阅读艺术描述。
- 观看者(VLM):视觉语言模型(一个能“看见”并理解图像的机器人),用于观察绘画。
团队如何协作:
- 任务分配:系统获取一幅画,并问道:“这张图片里发生了什么?”
- 猜测:阅读者查看文本,观看者查看图像。它们都大声喊出各自的猜测(例如:“它展示了一匹马!”或“它展示了一场战斗!”)。
- 双重检查(关键步骤):这是最重要的一步。由于 AI 机器人有时会“产生幻觉”(编造内容),作者构建了一个验证流程。
- 他们检查阅读者的猜测是否与观看者的猜测相符。
- 他们检查该猜测是否真的是一个新事实,还是仅仅是已知事物的同义词(例如,确保如果数据库中已有“窗帘”,就不会再添加“窗帘”的复数形式)。
- 他们甚至要求观看者再次查看图像以确认:“是的,我在这张图片中确实看到了马。”
4. 结果:更大、更好的地图
结果令人印象深刻。通过使用这个机器人团队:
- 他们成功向数据库中增加了**61%**的更多事实。
- 他们添加了数千个新细节,例如之前缺失的具体动作(马上长矛比武)、物体(剑)和场景(城市景观)。
- 质量控制:当人类检查工作时,发现机器人**92%**的情况下是正确的。
核心结论
作者不仅构建了一个更大的数据库,还构建了一个系统,该系统能够观察一幅画及其描述,理解其中的故事,并将新的、准确的事实添加到数字地图中,而无需人类手动输入所有内容。
他们证明,通过结合文本阅读 AI 和图像识别 AI,并让它们互相检查工作,我们可以以一种既快速又可靠的方式自动扩展我们对文化遗产的认知。此外,他们还将所有代码和数据免费开放供任何人使用,以便其他研究人员可以尝试做得更好。
技术摘要:基于语言与视觉模型的多模态文化遗产知识图谱扩展
问题陈述
文化遗产的保存与阐释日益依赖知识图谱(KGs)来结构化海量数据。然而,由于文化遗产信息具有多样性、复杂性且往往是非结构化的(例如博物馆档案或维基百科中的文本描述和图像),这些知识图谱的构建与扩展面临重大挑战。
现有的知识图谱,即使是像 DBpedia 或 Freebase 这样的大规模图谱,本质上也是不完整的。在文化遗产领域,这种不完整性尤为严重,因为历史数据往往隐藏在非结构化资源之后。传统的知识图谱补全(KGC)方法主要基于嵌入(例如 TransE、RESCAL),并在**封闭世界假设(CWA)*下运行。该假设将预测限制在预定义的实体集合内,使得这些方法不足以引入图中尚未存在的新*知识或实体。此外,现有的基准测试往往缺乏现实世界文化遗产收藏所特有的操作复杂性、歧义性以及多模态丰富性(文本和图像)。
方法论
作者提出了一种综合方法,包括创建一个新数据集,以及一个在**开放世界假设(OWA)**下扩展知识图谱的新框架。
1. WJoconde 数据集
作者引入了WJoconde,这是一个专注于法国文化遗产的新多模态知识图谱,源自Joconde 数据库(法国博物馆收藏的参考数据库)和Wikidata。
- 构建:该流程涉及从 Wikidata 中提取上下文图谱,使用与 Joconde ID(P347)关联的实体,清理冗余,并利用来自开放遗产资源、Wikimedia Commons 和 Wikipedia 的外部文本和图像丰富实体。
- 变体:创建了三个变体以促进研究:
- WJoconde (Raw):包含 28,524 个实体和 483,938 个三元组。
- WJoconde_cleaned:经过过滤的版本,移除了反向、冗余和稀疏关系,以防止在 KGC 任务中人为地膨胀性能。
- WJocondeMM:一个完整的多模态子集,其中实体同时拥有文本描述和视觉图像。
- 基准测试:该数据集作为 KGC 的新基准,针对各种嵌入模型(TransE、ComplEx、TuckER 等)进行了评估。结果表明,基于翻译的模型难以应对该数据集的复杂性,而像 TuckER 这样的深度神经网络模型表现最佳。
2. 开放世界假设下的多模态 KGC 框架
为了用新实体扩展知识图谱,作者提出了一种利用**大语言模型(LLMs)和视觉 - 语言模型(VLMs)**以零样本方式进行的流程。该过程包含三个阶段:
- 信息收集:对于给定缺失实体的三元组,系统检索与已知实体或关系相关的非结构化文本描述和视觉图像。
- 实体提取:
- LLM(例如 LLaMA 2):使用提示模板处理文本输入,旨在定义 KG 任务、分配角色并强制 JSON 输出格式。
- VLM(例如 BLIP):类似地处理图像输入以提取视觉概念。
- 两个模型均在未针对特定数据集进行预先训练的情况下生成候选实体列表。
- 联合验证与落地:为确保可靠性和新颖性,应用了严格的验证流程:
- 实体匹配:Word2Vec 模型计算生成候选项与现有 KG 实体之间的相似度。使用阈值(τ=0.4)过滤掉高相似度(同义词)的候选项或已存在的实体。
- 交叉验证:利用 VLM 验证 LLM 生成的实体是否在图像中视觉存在(反之亦然),以减少幻觉。
- 模型验证:测试模型识别所提供上下文中现有实体的能力,以建立可信度基线。
主要贡献
该论文概述了三项主要贡献:
- WJoconde 数据集:一个新颖、高质量、多模态的法国文化遗产知识图谱,包含超过 48.3 万个三元组。它整合了文本和图像,作为多模态研究的资源以及 KGC 的新基准。
- OWA 扩展流程:一个在开放世界假设下扩展知识图谱的新框架。通过将 LLMs 和 VLMs 与专门的落地和验证流程相结合,该方法成功地向图谱引入了新的、可靠的实体,而无需对模型进行微调。
- 基准测试与评估:在 WJoconde 及其变体上对现有 KGC 模型进行了广泛评估,同时提出了一种针对 OWA 场景的新评估方法,该方法依赖人工评估和跨模型验证,而非传统的排名指标。
结果
所提出的流程应用于WJocondeMM_en数据集:
- 实体扩展:该方法成功向数据集引入了**61.36%**的更多实体。具体而言,新增了 4,394 个最终实体,实体数量从 7,749 个扩展至 12,143 个。
- 可靠性:
- 模型可信度:组合的 LLM 和 VLM 流程在恢复真实实体(现有实体)方面实现了90.2% 的召回率和94.8% 的 F1 分数,证明了实体识别的高可靠性。
- 人工评估:两名标注员审查了“描绘(depicts)”关系生成的实体。组合方法实现了92.0% 的精确率,表明大多数新增实体是正确且有意义的。
- 语义质量:对新增实体的分析显示,类别从“未知”(原始数据中占 55.4%)转变为语义丰富且视觉落地的类别,如“物体(Object)”(22.5%)、“自然(Nature)”(17.5%)和“人物(Person)”(15.6%)。新增实体捕捉到了可解释的概念(例如“马上长矛比武”、“拱门”、“盔甲”),这些与艺术史学家相关。
意义
该论文声称,这项工作代表了在法国文化遗产领域首次创建结合文本和视觉信息的综合多模态基准测试数据集。其意义在于:
- 推进文化遗产领域的 OWA:证明多模态 AI 模型可以有效地用新知识扩展知识图谱,克服了限制传统 KGC 方法的封闭世界假设的局限性。
- 领域特定效用:提供了一个结构化的多模态资源,促进了文化遗产领域的复杂查询、分析和研究,解决了管理大量博物馆收藏的复杂性。
- 方法稳健性:建立了一个验证流程,确保 AI 生成知识的可靠性,使得以高置信度自动化丰富文化遗产数据成为可能。
作者指出,虽然该流程是有效的,但未来的工作可以探索高级模型、少样本学习以及更复杂的微调场景。所有代码、数据集和交互式访问点均已开源,以促进进一步研究。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。