← 最新论文
💻 computer science

Fibottention: Inceptive Visual Representation Learning with Diverse Attention Across Heads

本文提出了一种名为 Fibottention 的新型稀疏自注意力机制,它利用源自 Wythoff 数组的结构化稀疏模式,在将计算复杂度降低至 O(NlogN)\mathcal{O}(N \log N) 并仅使用极少交互对数的同时,通过跨头多样性实现了类似 Inception 的功能多样性,从而在图像分类、视频理解和机器人学习等任务中显著优于或媲美密集自注意力模型。

原作者: Ali K. Rahimian, Manish K. Govind, Subhajit Maity, Dominick Reilly, Christian Kümmerle, Srijan Das, Aritra Dutta

发布于 2026-02-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Ali K. Rahimian, Manish K. Govind, Subhajit Maity, Dominick Reilly, Christian Kümmerle, Srijan Das, Aritra Dutta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 Fibottention 的新方法,旨在解决目前人工智能视觉模型(特别是 Vision Transformers)面临的一个核心痛点:“太聪明,但也太费脑子”

为了让你轻松理解,我们可以把训练一个 AI 模型想象成组织一场大型的公司会议

1. 现状:一场混乱且昂贵的“全员大会”

目前的顶级视觉模型(ViT)在分析图片时,会把图片切成很多小块(就像把一张大拼图切成很多小碎片),每个碎片就是一个“参会者”(Token)。

  • 传统做法(密集注意力): 为了让 AI 理解图片,传统的做法是让每一个参会者都要和其他所有参会者进行一对一的交谈。
    • 比喻: 想象一个有 1000 人的会议室。如果每个人都要和另外 999 个人握手、聊天,那总共要进行近 100 万次对话!
    • 问题: 这不仅极其耗时(计算量呈平方级增长,O(N2)O(N^2)),而且很多对话其实是废话。比如,图片左上角的一朵云,和右下角的一只猫,它们之间其实没啥关系,非要让它们“深度交流”纯属浪费资源。
    • 后果: 这种“全员大会”模式太烧钱,导致只有大公司拥有大量数据和算力才能训练出好模型,普通设备(如手机、机器人)根本跑不动。

2. 解决方案:Fibottention —— 聪明的“分组讨论”

为了解决这个问题,作者提出了 Fibottention。它的核心思想是:别让大家乱聊,我们按规则分组,只聊该聊的。

核心创意一:斐波那契数列的“魔法节奏”

作者没有随机地让大家闭嘴,而是设计了一套非常精妙的**“对话规则”,这套规则基于数学界著名的斐波那契数列**(0, 1, 1, 2, 3, 5, 8, 13...)。

  • 比喻: 想象会议桌被分成了不同的区域。
    • 近距离交流: 离你最近的邻居(比如距离 1 或 2 个座位),你们必须频繁交流(因为图片里相邻的像素通常有关联,比如都是天空的一部分)。
    • 远距离交流: 随着距离变远,交流的频率按照斐波那契数列的节奏逐渐减少。比如,你可以和距离 5 个座位的人聊一下,和距离 8 个座位的人聊一下,但距离 13 个座位的人可能就不聊了,或者聊得很少。
    • 好处: 这种节奏既保证了大家能听到“近处的声音”(局部细节),又能偶尔听到“远处的声音”(全局信息),同时砍掉了 98% 以上无意义的“废话”。

核心创意二:头部的“差异化分工”

现在的 AI 模型通常有多个“大脑”(Attention Heads,注意力头)。传统的稀疏方法往往让所有“大脑”都使用同一套对话规则。

  • Fibottention 的做法: 它让每个“大脑”使用不同的斐波那契节奏。
    • 比喻: 想象会议里有 12 个小组。
      • 第 1 组:只聊距离 1、2、3 的邻居(专注细节)。
      • 第 2 组:聊距离 1、3、5、8 的邻居(关注中等范围)。
      • 第 3 组:聊距离 2、4、6、10 的邻居(关注更广的范围)。
    • 灵感来源: 这就像**“维特夫数组”(Wythoff Array),一个数学上的神奇表格,能保证每个小组聊的话题互不重复**,但又覆盖了所有重要的信息。
    • 效果: 就像一支特种部队,有的负责侦查近处,有的负责瞭望远方,大家分工明确,信息互补,而不是所有人都在做同样的事。

3. 结果:用 2% 的力气,干 100% 的活

论文通过大量实验证明,Fibottention 非常厉害:

  • 省资源: 它只需要计算原本**2%**的对话量(也就是只让 2% 的人互相交谈),就能达到甚至超过原本全员大会的效果。
  • 速度快: 计算复杂度从 O(N2)O(N^2) 降到了 O(NlogN)O(N \log N)
    • 比喻: 以前 1000 人的会议要开 100 万分钟;现在用 Fibottention,可能只需要 1 万分钟,而且大家聊得更透彻。
  • 适应性强: 不仅在识别图片(如 CIFAR, ImageNet)上表现优异,在视频理解(看动作)和机器人学习(教机器人干活)上也表现出色。
    • 机器人案例: 在教机器人“推箱子”或“拿杯子”的任务中,使用 Fibottention 的机器人学得更快,成功率更高。

4. 总结:为什么这很重要?

这就好比以前我们想造一辆能跑长途的跑车(大模型),必须得用巨大的油箱(海量数据)和超级引擎(昂贵算力)。

Fibottention 就像是给跑车装上了一个“智能节油系统”

  1. 它知道什么时候该加速(关注重要信息)。
  2. 它知道什么时候该滑行(忽略无关信息)。
  3. 它让每个引擎(注意力头)各司其职,互不干扰。

最终效果: 我们可以在普通的手机、甚至小型的机器人上运行以前只能在超级计算机上跑的顶级 AI 模型。这让 AI 能真正走进千家万户,而不是只停留在实验室里。

一句话总结: Fibottention 用数学的优雅(斐波那契数列),把 AI 的“瞎聊”变成了“高效沟通”,让模型变得更聪明、更省钱、更普及。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →