想象一下,你走进一个房间,空气中不断回荡着无形的无线电波,这些电波在墙壁、家具和身处其中的人身上来回反弹。这些波正是传输你的 Wi-Fi 信号、将手机连接到互联网的那些波。多年来,科学家们已经知道,当一个人在这一无形的场域中移动时,其身体会微妙地扭曲这些波,从而在信号中创造出一个独特的指纹。这个想法引发了一场构建识别系统的竞赛,这种系统无需摄像头或佩戴式设备,仅通过人们与周围空气交互的方式就能实现识别。然而,将这些转瞬即逝、充满噪声的扭曲转化为可靠的身份信息,一直是一个棘手的挑战。这些信号非常杂乱,会根据房间形状的变化而改变,并且通常需要人在以特定的方式运动时才能被检测到。
一组研究人员现在推出了一种名为 Argus 的新系统,它通过改变计算机“观察”数据的方式来解决这些问题。Argus 并不是试图处理发生的每一次无线电信息爆发,而是首先将原始信号压缩成一张紧凑的统计图谱。可以将这张图谱想象成一张摘要表,它捕捉了几秒钟内信号行为的核心形态,剥离了噪声和冗余。随后,该系统使用一种专门设计的特殊人工智能,像读取一系列小型图像块一样读取这些图谱,从而识别出房间里的人。研究人员在一个包含 154 个不同人的数据集上测试了这种方法,要求系统在这些人静止站立或进行简单的静态活动时识别他们。结果令人瞩目:通过结合多个短时间窗口的证据,该系统在近 85% 的情况下正确识别出了正确的人,并且能够在 99% 以上的情况下将可能性缩小到前五名候选人。
这种方法之所以特别重要,不仅在于其准确性,还在于其效率。以往试图分析未经处理的原始无线电波的方法需要巨大的计算能力,并且随着观察时间的增长往往会失效。相比之下,Argus 在实现高准确度的同时,使用的计算能力仅为最强竞争系统的约二十七分之一。这种效率源于创建统计图谱的初始步骤,这使得计算机能够忽略大量的无关数据。研究人员发现,系统不需要看到信号的完整历史记录即可做出决策;它只需要专注于摘要图谱中包含最有价值信息的几个关键部分。事实上,他们发现即使移除图谱中超过一半的数据点,也不会显著损害系统识别人的能力,这证明了最重要的细节都集中在特定的区域。
该研究还测试了当环境发生变化(例如从一个房间移动到另一个房间,或在不同的 Wi-Fi 频率之间切换)时,该系统的表现如何。在此,系统揭示了其目前的局限性。虽然在同一房间内识别经过训练的人时表现出色,但当被要求在没有任何新空间预先训练的情况下,在完全不同的房间里识别同样的人时,它却表现得非常吃力。这表明,无线电波在特定房间内反射的独特方式是一个主导因素,往往掩盖了由人本身产生的微妙信号。研究人员还指出,该系统在区分已知人员与陌生人方面尚不完美;它更擅长创建一个可能的候选名单,而不是独立做出最终的确定性识别。
尽管存在这些局限性,这项工作仍展示了被动识别技术的一条清晰路径。通过证明信号的紧凑摘要比原始数据更强大,研究人员为构建既准确又适用于实际应用的系统提供了蓝图。该系统不需要人们佩戴特殊设备或进行特定的动作,使其成为对隐私和便利性要求极高的应用场景中的有力竞争者。然而,研究人员也谨慎地指出,在该技术广泛部署之前,必须将其与更强的保障措施相结合,以确保它不会被未知个体欺骗,并尊重用户同意。这项技术的未来不在于让系统变得更复杂,而在于精炼如何解读我们周围空气中那静谧、无形的语言。
技术摘要:ARGUS —— 用于可扩展人员识别的注意力引导型 Transformer 技术(基于 Wi-Fi 遥测)
问题陈述
准确且高效的人员识别对于访问控制和个性化服务至关重要,然而现有的生物识别方法面临着显著的局限性。基于摄像头的系统会引入隐私担忧,并且对欺骗、遮挡和环境条件较为敏感;而基于可穿戴设备的方法则需要用户配合。使用商用 Wi-Fi 信道状态信息(CSI)的无线替代方案提供了一种极具前景的、低成本且被动的解决方案。然而,目前的基于 CSI 的识别系统仍面临以下挑战:
- 数据复杂性: 原始 CSI 流具有高噪声、高维度特性,并受到同步引起的相位偏移影响,需要进行校准。
- 领域偏移(Domain Shift): CSI 信号高度依赖于房间几何结构、硬件和设备布局,这使得跨领域泛化变得困难。
- 运动依赖性: 许多现有系统依赖于步态或刻意的动作,这限制了它们在识别静止主体方面的应用。
- 可扩展性与效率: 针对静止主体的 Transformer 方法主要在小规模群体上进行了评估,且仅靠闭集准确率无法解决大规模部署中的开集拒绝或计算效率问题。
方法论
作者提出了 Argus,这是一个被动式 Wi-Fi 感知系统,旨在通过无需佩戴设备或规定动作的商用 CSI 来识别个体。该系统架构由三个主要部分组成:
Statgram(统计图谱)表示:
Argus 并非直接对原始数据包流进行建模,而是将短时间的 CSI 窗口转换为紧凑的统计图谱(statgrams)。
- 预处理: 对原始复数 CSI (H) 进行鲁棒归一化(使用中位数和四分位距),并进行线性去趋势处理以进行相位解包裹,从而消除同步偏移。
- 特征提取: 系统生成信号的多种“视图”:幅度 (A)、校准相位 (P) 和相位差 (D)。
- 统计聚合: 对于每种视图,计算其在时间维度和分组子载波上的统计量(均值、标准差、百分位数、能量以及通过实数快速傅里叶变换 real-FFT 获取的频域特征)。这些统计量被堆叠成一个张量 S∈RC×R×W,其中 C 是视图数量,R 是统计行数,W 是由采集几何结构决定的宽度。
Patch Transformer 架构:
- Statgram 被划分为粗略的矩形补丁(patches),随后将其展平并线性投影为 Token(令牌)。
- 系统附加了一个可学习的 CLS token。
- 一个轻量级的仅解码器(decoder-only)Transformer 处理这些 Token。位于末端的 CLS token 通过因果注意力机制(causal attention)对所有先前的补丁进行关注。
- 推理: 对于物理录制过程,通过聚合重叠窗口的 Logits(取平均值)来产生最终的段级预测。对于单人识别,使用 Softmax 层;对于多用户场景,则采用独立的二元 Logits。
注意力引导压缩:
Argus 利用训练好的模型对 statgram 补丁的重要性进行排序。通过遮蔽具有训练集均值的补丁并测量预测置信度的下降程度,系统可以识别出哪些区域包含身份相关的关键信息。这使得系统可以在不显著损失准确率的情况下实现输入压缩(仅保留排名靠前的补丁)。
核心贡献
- 系统设计与评估: 本文详细介绍了 Argus 流程,并在两个数据集上进行了评估:EHealth 数据集(154 名参与者,处于静止或有限运动状态)和 WiMANS 数据集(多用户、多房间、2.4/5 GHz 频段)。
- 紧凑表示 vs. 原始上下文: 作者证明,紧凑的 statgram 表示比单纯扩展原始时间上下文更有效。在 EHealth 数据集上,在 60 秒证据时长下,Argus 比原始 CSI Transformer 基准模型的 Top-1 准确率提高了 7.75 个百分点,同时每个窗口使用的 FLOPs 减少了 4.4 倍。
- 注意力-遮蔽排序: 引入了一种仅用于验证的排序方法来对 statgram 补丁进行排序。在 EHealth 上,仅保留 8 个补丁中的前 4 个即可保持完整的单窗口准确率;而在 WiMANS 上,保留 15 个补丁中的 10 个仅会导致 0.7 个百分点的准确率下降。
- 现实部署限制: 研究明确评估了开集拒绝和跨环境迁移能力,结果显示虽然 Argus 在闭集场景中表现良好,但其零样本(zero-shot)跨房间迁移能力较弱,且开集拒绝能力尚处于中等水平。
结果
EHealth 数据集(154 名受试者):
- 准确率: Argus 在 6 秒窗口下的 Top-1 准确率达到 78.88% ± 1.62%。当聚合 19 个重叠窗口(共 60 秒)时,Top-1 准确率上升至 84.85% ± 1.31%,Top-5 准确率达到 99.26%。
- 效率: 该模型每个窗口需要 33.6 MFLOPs,而竞争对手 THAT 基准模型需要 149 MFLOPs。
- 消融实验: 在单无线电设置中,幅度通道携带了大部分判别性信号;未经校准的纯相位模型表现较差。
WiMANS 数据集(多用户、多房间):
- 准确率: Argus 实现了 95.07% 的平均精确匹配准确率,平均而言,与最强的特定配置基准相比,差距仅在 1.23 个百分点以内。
- 效率: Argus 每次录制的计算量为 0.061 GFLOPs,这比 THAT 基准模型的推理 FLOPs 少 27 倍。通过补丁剪枝,这一加速比提升至 48 倍。
- 迁移学习: 跨房间的零样本迁移失败(准确率为 14–28%)。然而,少样本混合训练(结合源数据 + 少量的目标数据)显著提升了性能,使用 25% 的目标数据即可达到 82–93% 的准确率。
重要性与声明
本文声称,紧凑的 CSI 统计量可以实现可扩展的被动识别,为摄像头和可穿戴生物识别提供了一种可行的替代方案。Argus 的意义在于其能够:
- 规模化: 在无需步态或运动的情况下,成功识别大规模群体(154 名受试者)及多用户环境中的个体。
- 高效性: 通过 statgram 压缩和轻量级 Transformer 大幅降低计算需求,使在边缘设备上的部署成为可能。
- 可解释性: 利用注意力机制识别并剪除非必要的信号区域,从而为哪些 CSI 信号驱动决策提供了见解。
然而,作者对部署成熟度持谨慎态度。他们强调,开集拒绝目前尚不足以支持作为独立的生物识别门禁(未知用户可能会被自信地误识别),且由于房间特有的多径效应,跨环境泛化仍然是一个重大障碍。因此,Argus 的定位是作为高召回率的候选名单生成器,或作为更大验证系统中的一个组件,而非适用于所有识别场景的独立解决方案。论文还强调了在进行被动式生物识别感知时,包括知情同意和本地化处理在内的治理必要性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。