← 最新论文
🤖 AI

Salient Knowledge Pathways: Sparse Cross-Modal Routing for Efficient Knowledge-Intensive Multimodal Question Answering

本文介绍了 SKIP,一种统一的推理架构,该架构采用稀疏跨模态路由和自适应计算预算,在保持或超过密集型基准模型准确性的同时,显著降低了知识密集型多模态问答中的计算成本和延迟。

原作者: Noor Islam S. Mohammad, Uluğ Bayazıt

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Noor Islam S. Mohammad, Uluğ Bayazıt

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图破解一个谜团。你有一本巨大的相册(图像)、一份来自庞大图书馆的嫌疑人名单和线索(外部知识),以及一个需要回答的特定问题。在人工智能的世界里,这被称为“知识密集型多模态问答”(Knowledge-Intensive Multimodal Question Answering)。这是一个很高级的说法,意思其实是:“计算机能否观察一张图片,阅读一个问题,然后去翻遍巨大的图书馆来找到正确的答案?”

目前,尝试解决这个问题的最聪明的计算机程序就像是那些拒绝跳过任何一页的过度热情的侦探。无论问题多么简单,它们都会阅读图书馆里的每一个字,盯着照片里的每一个像素。即使答案仅取决于一个微小的细节(比如一只小船旗帜的颜色),它们也会这样做。这种方法虽然有效,但速度极慢,且会消耗大量的计算资源,导致很难在手机或笔记本电脑等普通设备上运行。科学家们正在提出的核心问题是:我们能否教会这些 AI 侦探变得更聪明一点,让它们知道该看“什么”,从而在不丢失正确答案的前提下更快地解决谜团?

于是,诞生了 SKIP——由研究人员 Noor Islam S. Mohammad 和 Uluğ Bayazıt 开发的一个新系统,它试图通过教 AI 如何“聪明地偷懒”来解决这个问题。SKIP 不再把每个问题都当作需要全面调查的生死攸关的紧急情况,而是像一位经验丰富的侦探一样,知道何时可以走捷径。

以下是 SKIP 的工作原理,我们使用了一些日常生活的比喻:

1. “智能过滤器”(问题引导的视觉显著性)
想象一下,你正在看一张繁忙街道的照片,要回答这个问题:“自动贩卖机里是什么品牌的苏打水?”普通的 AI 会盯着每一个人、每一辆车和每一棵树。然而,SKIP 会先看问题,然后说:“我只关心自动贩卖机。”它会瞬间忽略掉 90% 的照片,只关注自动贩卖机所在的那个微小区域。这被称为“剪枝”(pruning)。研究人员发现,通过在开始搜索之前就切掉图像中无关的部分,我们可以在不损失任何准确性的情况下节省大量时间。

2. “定向图书管理员”(区域条件化稀疏检索)
一旦 AI 知道了图像中哪部分重要,它就需要前往图书馆。通常,AI 会向整个图书馆同时大声喊出它的问题。SKIP 则不同。如果照片中有几个明显的有趣事物(比如衬衫上的标志或建筑上的招牌),SKIP 会为每一个事物发送单独的、微小的查询。这就像是派三个不同的实习生去寻找三个不同的事实,而不是让一个实习生在整栋楼里跑来跑去大声喊一个模糊的问题。这确保了 AI 能找到那些“一刀切”式搜索经常会错过的特定微小细节。

  1. “选择性混合器”(二分图稀疏交叉注意力)
    现在 AI 拥有了图片细节和图书馆事实。它需要将两者混合在一起以形成答案。通常,计算机尝试将每一块图片数据与每一块图书馆数据进行连接。这就像是试图同时与体育场里的每一个人握手。SKIP 则更聪明;它只与那些真正有意义的配对进行“握手”。如果图片的一部分是关于“狗”的,而图书馆的一部分文本是关于“烘焙”的,SKIP 会完全忽略这种联系。这节省了大量的能量。

4. “难度评判员”(自适应预算控制器)
SKIP 有一个小经理,它会观察问题并询问:“这是难还是易?”如果问题很简单,比如“汽车有几个轮子?”,经理会说:“不需要去图书馆!”然后 AI 直接回答。如果问题很复杂,比如“这款特定汽车型号的发动机是谁发明的?”,经理会说:“好吧,动用全员并检查整个图书馆。”这意味着计算机不会在简单问题上浪费能量。

5. “速通者”(投机性知识验证)
最后,SKIP 有一个快速的小助手,试图瞬间猜出答案。如果小助手非常有信心,SKIP 就直接接受猜测,并跳过漫长缓慢的过程。如果小助手不确定,那么完整的、缓慢的团队就会介入。这就像学生快速检查数学作业一样;如果他们确定自己做对了,就不需要从头开始重新计算。

他们的发现是什么?
研究人员在五个涉及图片和知识的困难测试中测试了 SKIP。他们发现,SKIP 可以像那些庞大、缓慢的系统一样准确地回答问题,但它使用的计算资源(以 FLOPs 衡量)减少了 3.4 到 6.8 倍,且速度快了 2.7 倍

事实上,在那些答案依赖于寻找图片中微小细节的最难测试中,SKIP 甚至比那些庞大的系统做得更好。这表明,通过忽略噪音并只关注重要的部分,AI 实际上表现得更出色。论文还包含了一个数学证明,表明回答问题所需的信息量增长速度远慢于图片的大小,这解释了为什么切掉 90% 的图像会如此奏效。

它做不到什么
值得注意的是,SKIP 并非万能。研究人员承认,它在处理需要非常复杂的、多步骤推理(例如将三个不同的事实联系起来)或关于图书馆中极少出现的事物的问题时仍然存在困难。此外,如果一个问题根本不需要任何图书馆研究,SKIP 不会获得太多的速度提升,因为主要的节省来自于跳过图书馆搜索和繁重的数据混合过程。

底线
SKIP 向我们展示了,我们并不需要通过蛮力来解决所有问题。通过教会 AI 具备选择性——忽略照片中无聊的部分、向图书馆提出具体问题、以及知道何时采取捷径——我们可以构建出更快、更便宜且与当今巨头一样聪明的系统。它提醒我们,有时,知道“不该看什么”才是最重要的技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →