Beyond Visual Similarity: Entity-Aligned Retrieval for Knowledge-Based Visual Question Answering
本文介绍了 KBMR,一种基于多模态大语言模型(MLLM)的新型知识驱动视觉问答检索框架,该框架通过将图像映射到语义空间并利用连续实体一致性权重来改进难负样本采样,克服了表层视觉相似性的局限性,从而显著提升了检索准确率和端到端视觉问答性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字世界中,我们经常要求计算机观察一张图片并讲述其中的故事。这个被称为“视觉问答”的领域在描述直观可见的内容方面已经变得非常出色:一只在海滩上奔跑的狗、一辆停在街道上的红车,或者一个拿着杯子的人。然而,当问题的答案取决于图像本身无法体现的事实时,一个更深层的挑战便出现了。如果一张照片显示的是一种特定的、罕见的鸟类,计算机可能会识别出它是一只鸟,但除非它能够访问庞大的外部知识库,否则它无法知道这只鸟的名字、栖息地或历史。这就是“基于知识的视觉问答”领域,在这里,机器不仅要“看”图像,还必须从海量数据库中找到正确的信息片段,才能准确回答问题。
难点在于计算机如何搜索这些信息。传统上,这些系统依赖于一种优先考虑两张图像看起来有多相似的方法。如果用户询问关于某家特定酒店的问题,系统会扫描其数据库,寻找与问题中的图片在视觉上相似的照片。当照片中的建筑与数据库中的建筑看起来完全一致时,这种方法效果很好。但现实世界是混乱的。一个著名的地标在20世纪50年代的黑白照片中与现代彩色快照中的样子可能完全不同,或者两座完全不同的建筑可能恰好拥有相似的建筑风格。当系统仅依赖视觉相似性时,它经常会产生混淆,因为它抓取了错误的建筑(因为它们表面看起来相似),却错过了正确的建筑(因为它们看起来不同)。这种局限性长期以来阻碍了计算机回答有关世界复杂问题的能力。
清华大学和亚利桑那大学的研究团队开发了一种新方法来解决这个问题,他们超越了简单的视觉匹配,转向对身份(identity)的深度理解。他们创建了一个名为 KBMR 的系统,它就像是这些视觉问题的“聪明图书管理员”。该系统不再要求计算机寻找看起来相同的图片,而是要求计算机寻找代表“同一个事物”的图片,即使它们看起来大相径庭。为了实现这一点,他们利用了一种被称为“多模态大语言模型”的高级人工智能。与仅仅比较像素的旧系统不同,这些模型可以在观察图像的同时阅读并理解语言,从而使它们能够领悟物体的“概念”,而不仅仅是其“外观”。
研究人员构建了一个训练过程,教导这个新系统去区分哪些事物仅仅是“相似”的,而哪些实际上是“同一个实体”。他们引入了一个特殊的组件,充当“裁判”,通过检查图像对和问题来判断它们是否指向同一个现实世界的物体。这个裁判不仅会回答“是”或“否”,还会给出一个反映其匹配置信度的分数。这个分数有助于系统通过关注那些最容易引起混淆的案例来学习——即那些看起来相似但实际上不同的图像,或者看起来不同但实际上是同一个物体的图像。通过利用这些具有细微差别反馈的困难案例进行训练,系统学会了基于主体的真实身份而非仅仅基于其视觉特征来组织其知识。
这一新方法的成果非常显著。在旨在衡量计算机利用外部知识回答图像问题的标准基准测试中,该新系统的表现大幅超越了以往的最佳方法。在一项重大测试中,与旧标准相比,该系统将正确答案出现在首位(top result)的能力提升了近百分之十五。更重要的是,这种寻找正确信息能力的提升直接转化为了更好的答案。当该系统被用于回答百科全书式话题的问题时,其准确率提升了近百分之十。在另一项涉及“未见实体”(unseen entities)的问题测试中,这种进步更为显著,表明该系统特别擅长处理那些旧方法难以处理的稀有或困难主题。
研究人员还证明了这种新方法在不同类型的问题和数据集上都能有效运作。无论是关于特定植物物种、历史建筑还是罕见鸟类的提问,该系统都能比以前更频繁地找到正确信息。在一次视觉对比中,旧系统可能会检索出五张看起来与问题中的鸟类有些相似的不同鸟类照片,而新系统则能正确识别出特定的鸟类品种,并将正确的答案放在列表的最顶端。这种从“表面相似性”到“深度语义对齐”的转变,意味着当计算机能够获取正确事实时,它们在解释我们周围的世界方面正变得更加可靠。
这项工作表明,视觉智能的未来在于将“观察能力”与“理解能力”相结合。通过教导机器穿透图像的表面外观,专注于主体的内在身份,研究人员消除了计算机检索知识的一个主要瓶颈。研究结果表明,对于机器要真正回答有关世界的问题,它们必须能够将其内部对物体的理解与人类知识中那些庞大、多样且往往在视觉上不一致的记录相对齐。这种新方法提供了一条清晰的前行路径,证明了当计算机理解的是“某物是什么”,而不仅仅是“某物看起来像什么”时,它所提供的答案不仅在视觉上是正确的,在事实上也是真实的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。