← 最新论文
🧬 biology

FOVI: A biologically-inspired foveated interface for deep vision models

本文介绍了 FOVI,一种受生物启发、基于中央凹视觉的界面,它将变分辨率的视网膜数据重新格式化为统一流形,以实现高效的 k-最近邻卷积,使深度视觉模型能够在显著降低计算成本和像素使用的同时,达到具有竞争力的性能。

原作者: Nicholas M. Blauch, George A. Alvarez, Talia Konkle

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Nicholas M. Blauch, George A. Alvarez, Talia Konkle

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正站在一片美丽、高分辨率的森林中。如果你试图同时以同样的清晰度观察每一片叶子、每一根树枝和每一簇草叶,你的大脑会陷入过载。这就像试图同时阅读一整个图书馆的书籍一样。

相反,你的眼睛有一个聪明的技巧:你的视野中心有一个“超清晰”的点(被称为中央凹陷/fovea),而远离这个中心的地方,一切都会变得模糊。你会快速移动眼睛,将森林的不同部分带入这个清晰点,同时让森林的其他部分保持在背景中。这节省了大脑大量的能量。

大多数计算机视觉系统(机器人和自动驾驶汽车的“大脑”)并不这样做。它们试图以同样的高清晰度同时观察整个图像。对于高分辨率图像来说,这极其昂贵且缓慢。

这篇论文介绍了一个名为 FOVI(注视视觉接口/Foveated Vision Interface)的新工具,它教会计算机像人类一样观察世界。

核心理念:“地图”类比

将标准的计算机图像想象成一个平坦的、矩形的像素网格,就像一个每个方格大小都相同的棋盘。

FOVI 改变了规则。它将那个平坦的网格拉伸成一个弯曲的、3D 的地图

  • 中心: 这个地图的中间被拉伸了,使得那里的“像素”变得巨大且精细(就像放大一样)。
  • 边缘: 地图的边缘被挤压在一起,使得那里的“像素”变得微小且模糊(就像看地平线一样)。

这不仅仅是一个视觉上的技巧;它是一种模仿人类眼睛和大脑(特别是初级视觉皮层,或称 V1)组织方式的数学变换。

它是如何工作的:“邻居”技巧

计算机通常通过在一个网格上滑动一个小窗口(“卷积核/kernel”)来处理图像,观察其周围的邻居。但在这种新的弯曲地图上,邻居并不是排列成整齐的正方形。

作者发明了一种处理这种问题的新方法,称为 k-最近邻 (kNN) 卷积

  • 隐喻: 想象你是在这张弯曲地图上的导游。你不是在看周围完美正方形排列的 8 个人,而是看向物理位置离你最近的 8 个人,无论他们是如何站立的。
  • 魔力: 论文展示了如何将一个标准的“规则手册”(在普通正方形网格上学习到的滤波器)进行转换,使其能够完美地运行在这样的弯曲、注视的地图上。这使得计算机可以像处理普通图像一样学习特征(如边缘或形状),但使用的计算数据点要少得多。

他们构建并测试了什么

团队利用这种新接口构建了两种类型的“眼睛”:

  1. FOVI-CNNs: 一种适配了这种弯曲地图的传统深度学习网络。他们发现,如果将“模糊度”设置得恰到好处(既不过于锐利,也不过于模糊),即使观察的像素远少于以往,计算机识别物体的能力实际上比尝试以均匀清晰度观察整个图像时还要好。
  2. FOVI-ViTs: 他们将一个大规模、最先进的 AI 模型(DINOv3)赋予了这双注视之眼。
    • 结果: 这个新模型仅使用原模型 1/16 的像素1/3 的计算能力,就能识别图像,且仍能达到几乎相同的准确率。

为什么这很重要(根据论文观点)

论文指出,随着我们试图构建需要观察巨大、高分辨率世界的机器人和汽车,目前的“平等看待一切”的方法正在撞墙。这太昂贵,也太慢了。

FOVI 提供了一个解决方案:主动感知 (Active Sensing)。系统不再处理整个世界,而是将它的“超清晰”注意力集中在重要的事物(中心)上,并将其余部分保持在低分辨率状态。这模仿了人类的效率,允许计算机处理高分辨率任务,而无需超级计算机级别的资源。

简而言之,FOVI 教会了计算机不再试图做一个巨大的、模糊的照相机,而是开始成为一个聪明的、专注的观察者,就像我们一样。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →