想象一下,你正试图打开一扇秘密之门,但迎接你的不是钥匙,而是需要证明你的身份。这就是生物识别的世界——利用你身体独特的特征(如指纹或面部)来识别你的科学。虽然我们通常会想到指纹,但在你的皮肤之下,还隐藏着一层身份信息:你的静脉。这些细小、蜿蜒的血流在你的掌心中形成了独特的地图,除非使用特殊的近红外光照射,否则肉眼无法看见。因为这些地图深藏于你的体内,它们极难被伪造或窃取,这使得它们成为证明“你是你”的一种超级安全的方式。然而,读取这些地图并非易事。静脉纤细、模糊且曲折,就像迷雾森林中脆弱的丝线。为了识别它们,计算机需要足够聪明,既能看到单根丝线的微观纹理,也能理解整个森林连接的宏观全貌。
正是在这里,一项新的研究登场了,它致力于解决如何教计算机以超人的精度读取掌静脉的挑战。研究人员在使用两个公开的掌静脉数据集进行工作时注意到,虽然有些计算机模型擅长观察“宏观全貌”,而另一些则擅长观察“微观细节”,但它们往往会忽略静脉本身的特定形状。为了解决这个问题,他们构建了一种新型的数字大脑,称为拓扑感知全局-局部 Mamba 网络(Topology-Aware Global-Local Mamba Network)。你可以把这个网络想象成一个由三名专业侦探组成的协作团队。第一位侦探使用放大镜来研究皮肤和静脉的粗糙纹理。第二位侦探携带一把特殊的“边缘检测手电筒”(基于一种被称为索贝尔算子 [Sobel operator] 的固定数学规则),专门用来突出静脉精确的线条和方向,同时忽略模糊的背景。第三位侦探则是一位航海大师,他使用“四向扫描”法,从各个角度追踪静脉的完整路径,理解它们在长距离上的连接方式。
奇迹发生于这三位侦探分享笔记的时刻。团队设计了一个系统,让纹理和方向的线索首先结合在一起,创建一个“结构感知”的地图,然后再将其与长距离导航地图进行合并。这种阶段性的团队协作确保了计算机既不会迷失在细节中,也不会错过宏观的连接。当他们测试这个新系统时,结果令人印象深刻。在一个数据集上,它实现了 99.13% 的身份识别准确率,以及极低的 0.08% 错误率。在另一个数据集上,它达到了 92.42% 的准确率和 0.61% 的错误率。虽然另一种名为 GLVM 的模型速度稍快且在纯识别方面表现更好,但这种新方法在“验证”(证明特定匹配)方面最为准确,并且使用的计算资源最少(仅为 720 万个参数)。研究人员指出,通过明确教导计算机去尊重静脉具有线条感和方向性的特性,他们创造出了一个极其出色的系统,即使在图像存在噪声或不完美的情况下,也能精准捕捉到掌纹独特的“签名”。
技术摘要:面向掌静脉生物识别的拓扑感知全局-局部 Mamba 网络
问题陈述
掌静脉识别是一项细粒度的生物识别任务,其特征是具有细微、低对比度的血管结构,这些结构仅在近红外(NIR)照明下可见。虽然这些特征提供了对抗欺骗和表面污染的鲁棒性,但由于公开数据集有限、类内差异(姿态、噪声、光照)以及需要同时建模局部血管纹理与血管树全局连通性的需求,有效的识别仍具挑战性。现有的深度学习方法面临特定的局限性:卷积神经网络(CNN)需要激进的下采样来捕获长程拓扑,这会抑制细微的血管结构;Transformer 和自注意力机制对于高分辨率图像而言计算成本昂贵,并可能稀释稀疏的血管模式;而现有的状态空间模型(SSM),如 Vision Mamba (Vim) 和 Global-Local Vision Mamba (GLVM),缺乏对掌静脉固有的线状、方向敏感几何结构的显式编码。
方法论
作者提出了一种拓扑感知全局-局部 Mamba 网络(Topology-Aware Global-Local Mamba Network),这是一种旨在联合建模局部纹理与全局血管拓扑的骨干架构。该网络通过一个 Stem 层、由六个相同的**拓扑感知模块(Topology-Aware Blocks, TAB)**组成的本体以及一个分类头来处理单通道 NIR 图像(128×128)。
- Stem 层: 通过两个步长为 3 的 3×3 卷积-归一化-SiLU 层将分辨率从 128×128 降低至 32×32,并将通道数扩展至 D=256。
- 拓扑感知模块 (TAB): 每个模块保持空间分辨率,由三个并行分支和两个阶段的门控融合组成:
- 多尺度局部流 (Multi-Scale Local Stream): 使用带有 3×3 和 5×5 方形核的深度卷积来提取各向同性的血管纹理。
- 结构感知方向流 (Structure-Aware Directional Stream): 采用轴向对齐的条形卷积(1×5 和 5×1)来捕获方向响应。至关重要的是,该流通过一个固定的 Sobel 幅度边缘先验进行增强。该先验在特征空间(基于 Stem 输出的第一通道)中通过固定的 Sobel 核(Gx,Gy)计算以生成边缘图 E(u)。该图通过一个可学习的 3×3 卷积进行投影,并以逐元素方式添加到方向流中。这提供了一种无需学习参数的结构归纳偏置。
- 全局状态空间流 (Global State-Space Stream): 实现了一种源自 VMamba 的四向状态空间扫描(左-右,右-左,上-下,下-上)。它使用紧凑的可学习逐通道标量进行离散化,以适应较小的数据集,在提供线性复杂度的同时,沿着与血管路径对齐的扫描方向传播信息。
- 分阶段门控融合 (Staged Gated Fusion):
- 阶段 1: 多尺度流与经结构增强的方向流通过一个可学习的门控机制进行融合,以产生具有结构感知能力的局部表示。
- 阶段 2: 该局部表示与全局状态空间输出进行融合。这种顺序确保了全局扫描是在已经富含结构线索的特征基础上进行的。
- 残差更新: 融合后的输出通过带有随机深度(DropPath)的两个残差连接,随后是一个逐点前馈网络(MLP 比例 r=2)。
核心贡献
论文确定了三个主要贡献:
- 显式结构先验: 注入了一个在特征空间中计算的、无参数且可微的 Sobel 幅度边缘图。不同于以往模型将结构几何隐含处理,该先验显式地标记了血管边界,引导方向分支和全局分支。
- 方向敏感的局部编码: 一种新型局部模块,将多尺度各向同性卷积与轴向对齐的条形卷积相结合,专门用于匹配掌静脉的线状、稀疏几何特性。
- 分阶段融合策略: 一种特定的组合方式,即在全局扫描之前先合并局部结构特征。这确保了四向状态空间扫描处理的是已经携带结构线索的表示,而非无结构的局部特征。
实验结果
该方法在两个公开基准测试集 HKPU-NIR 和 VERA Palm Vein 上进行了评估,并采用了统一的训练协议。它与 ResNet50、Vim-S、ViT-S 和 GLVM 进行了对比。
- HKPU-NIR: 以 7.2M 参数实现了 99.13% 的 Top-1 准确率和 0.08% 的等错误率 (EER)。
- VERA Palm Vein: 实现了 92.42% 的 Top-1 准确率和 0.61% 的 EER。
- 对比性能: 该方法在两个数据集上均实现了所有对比模型中的最低 EER,同时保持了最小的参数量(7.2M)。
- 权衡: 虽然 GLVM 在 HKPU-NIR 上取得了略高的 Top-1 准确率(99.40%)且计算成本显著更低(0.59 G FLOPs 对比所提方法的 7.28 G FLOPs),但所提架构优先考虑了验证可靠性(最低 EER)。较高的 FLOPs 归因于在全 32×32 分辨率下运行的密集多分支模块,未进行下采样。
意义与主张
论文声称,所提出的架构成功解决了掌静脉生物识别中同时建模局部纹理与全局拓扑的挑战。通过将固定结构先验与状态空间建模相结合,该网络在实现卓越验证性能(最低 EER)的同时,比现有的基于 CNN 或 Transformer 的基准模型使用了更少的参数。
作者承认了局限性:结构先验是一个固定的一阶边缘算子(不可学习);对比依赖于使用略有不同的流水线训练的基准模型(尽管数据划分是相同的);且高计算成本限制了其设计仅适用于验证可靠性高于推理预算的场景。未来的工作拟探索可学习的连通性感知先验和更精简的全局算子。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。