Beyond Self-Attention: Sub-Quadratic Vision Transformers for Fast Image Captioning
本文提出了一种用于图像描述的亚二次方级视觉 Transformer,该模型通过使用基于高斯混合模型的聚类机制取代标准自注意力机制,将计算复杂度从 O(n²) 降低至 O(nK),同时在 Flickr 30K 数据集上实现了具有竞争力的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你有一个巨大的相册,你的工作是为每一张照片写一段简短且有趣的故事。这就是**图像描述(Image Captioning)**所做的事情:它观察一张照片并写出一句描述它的句子。
长期以来,计算机在这一领域已经做得非常出色了,但它们面临一个重大问题:它们运行缓慢且极其耗能。
以下是这篇论文提出的旨在解决该问题的简单拆解。
问题所在:“每个人都要和每个人交谈”的派对
传统的 AI 模型(被称为 Transformer)的工作方式有点像一场盛大的派对,每一位宾客在对话开始前,都必须向其他每一位宾客介绍自己。
- 如果你有一张照片,计算机将其分解成许多微小的方块(patches)。
- 如果照片有 1,000 个方块,计算机就会尝试弄清楚方块 #1 与方块 #2 的关系,然后是方块 #1 与方块 #3 的关系,一直到方块 #1 与方块 #1,000 的关系。
- 数学原理: 这会产生“二次方(quadratic)”爆炸。如果你将方块数量增加一倍,工作量不仅仅是增加一倍,而是会变为原来的四倍。这就像是在组织一场派对,要求 1,000 个人都要与所有人握手。这既费时又耗电。
解决方案:“抱团取暖”策略
这篇论文的作者说:“为什么要让每个人都去和每个人交谈呢?让我们把看起来相似的人归为一类吧。”
他们用**高斯混合模型(Gaussian Mixture Model, GMM)**取代了“每个人都和每个人交谈”的方法。你可以把它想象成派对上的一位聪明的保安,他能根据宾客的长相或穿着,瞬间将他们分入一个个小型且友好的小组。
- 聚类(Clustering): 与其让 1,000 个个体互相交谈,计算机现在只需将相似的图像方块分为(例如)10 个“簇(clusters)”。
- 捷径: 计算机现在只需要弄清楚这 10 个小组之间是如何关联的,而不是弄清楚 1,000 个个体之间的关系。
- 结果: 这将数学运算从缓慢、沉重的“二次方”速度转变为快速的“线性(linear)”速度。这就像是从组织 1,000 人的握手礼,变成了只需组织 10 位队长之间的交流。它更快,也更省电。
计算机如何编写故事
一旦计算机对图像部分进行了分组,它就需要编写描述。
- 编码器(观察者): 这个部分负责观察照片,利用“抱团取暖”法对相似的部分进行分组,并生成一份它所见内容的摘要。
- 解码器(讲述者): 这个部分就像一位非常聪明的作家(基于 GPT 模型)。它接收来自观察者的摘要,逐字逐句地撰写句子,确保语法正确且逻辑通顺。
研究发现
研究人员在名为 Flickr30k 的数据集(包含 30,000 张带有描述的照片)上测试了这个新系统。
- 速度: 新模型效率更高。它不会被传统模型的繁重数学运算所拖累。
- 质量: 它所写的描述在描述复杂场景和关系方面,实际上比许多现有的顶尖模型表现得更好。
- 例子: 如果照片显示一名戴着安全帽的男子拿着旗帜,该模型能正确识别出安全装备和动作,而不仅仅是说“一个男人”。
- 权衡(Trade-off): 虽然在某些基础的“词汇匹配”评分上,它比某一个特定的竞争对手稍逊一筹,但在理解句子的含义和结构方面,它明显做得更好(而这正是写好一个故事最重要的部分)。
核心结论
这篇论文介绍了一种让计算机观察图片的新型聪明方式。与其试图分析每一个微小细节与其它所有细节之间的关系(这既慢又贵),不如先将相似的细节组合在一起。这使得计算机变得更快、运行成本更低,并且在讲述它所见之物的故事方面表现得惊人地出色。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。