想象一下,你正在尝试猜测某人的视线方向。传统做法就像是用高清 4K 相机拍摄他们的眼睛,将庞大的文件发送到超级计算机,然后让计算机分析每一个像素,以确定其视线方向。这种方法虽然准确,但速度慢、耗电量大,且需要传输大量数据。
本文提出了一种截然不同的“捷径”方法。他们不是拍摄完整图像,而是构建了一种特殊的光学滤波器,它就像一个智能筛子。
以下是该系统的运作原理,分解为简单概念:
1. “智能筛子”(光学编码器)
想象你有一桶水(来自眼睛的光),你想知道雨下得是大还是小。与其用一张大网接住每一滴水并逐一计数(即拍摄完整照片),不如将水通过一个具有特定、定制孔洞图案的筛子。
- 硬件:研究人员制造了一种设备,包含一个微透镜阵列(一张由微小放大镜组成的片)和一个二值掩膜(一张带有特定黑白方块图案的片)。
- 原理:当来自眼睛的光穿过这个“筛子”时,会被扰乱成特定的图案。系统并不关心眼睛“看起来”是什么样子(无关虹膜颜色、肤色或详细特征),它只关心透过的光强模式。
- 结果:系统不再捕获 256x256 像素的图像(65,000 多个数据点),而仅捕获16 个数字。这就像将整部小说压缩成一句话,却依然能告诉你主要情节。
2. “轻量级翻译器”(AI 解码器)
一旦系统获得这 16 个数字,它不会尝试重建眼睛图像,那将是浪费时间。相反,它将这 16 个数字输入到一个微小、超快的计算机大脑(轻量级神经网络)中。
- 训练技巧:为了训练这个微小的大脑,研究人员使用了一个懂得如何将眼睛图像转化为抽象代码的“教师”AI。他们教导新系统仅利用这 16 个数字来模仿“教师”的“思维过程”。
- 隐私优势:由于系统从未真正看到或存储眼睛的真实照片,因此天然更具隐私性。你无法从这 16 个数字中识别出个人身份,但系统仍能准确告诉你他们看向哪里。
3. 速度纪录(延迟)
这里最大的优势在于速度。
- 传统相机:必须等待整张图像拍摄完成,然后读取所有像素,再进行处理。这通常需要 10 到 20 毫秒(或更久)。
- 本系统:由于跳过了“拍照”步骤,仅读取 16 个微小传感器,整个流程——从光线照射到传感器到计算机输出“他们正看向左侧”——耗时不到3.4 毫秒。
类比:
传统的相机系统就像一位摄影师,他拍下一张照片,打印出来,走到一位艺术评论家面前,问道:“这个人正看向哪里?”
而新系统则像一名保安,他根本不看这个人的脸。相反,他只看这个人在特定墙壁上投下的影子。这个影子是扭曲的,无法辨认出人脸,但保安可以根据影子的形状准确判断这个人正朝哪个方向。这种方法即时、无需照片,且能耗极低。
他们实际取得的成果
- 准确性:在测试中,该系统对视线方向的猜测误差约为 6 度(大约相当于手臂伸直时大拇指的宽度)。这对于许多实际应用来说已经足够好。
- 现实测试:他们利用真实透镜、掩膜和传感器构建了物理原型。当在真人身上进行测试时,只需向该人展示屏幕上 12 到 15 个不同的位置,即可为该特定人员“校准”系统,且效果良好。
- 效率:该系统所需的计算能力仅为标准相机的极小部分。其效率之高,足以在非常小的电池供电设备上运行,例如未来的 AR 眼镜。
总结:
本文证明,跟踪眼球运动并不需要高清相机。通过使用巧妙的光学滤波器将光扰乱为一组微小的数字,并利用简单的 AI 读取这些数字,你可以在4 毫秒以内跟踪某人的视线方向。这一速度足以跟上人类大脑的反应,使其成为下一代虚拟现实和增强现实眼镜的理想选择,因为延迟会导致晕动症。
以下是论文《通过潜在光学传感实现低延迟 gaze 追踪》的详细技术总结。
问题陈述
传统的 gaze 追踪系统依赖高分辨率相机捕捉完整的眼部图像,随后进行深度神经网络推理。虽然这种方法准确,但由于需要读取和处理数百万像素,引入了显著的传感、带宽和计算开销。这种延迟通常超过下一代可穿戴 AR/VR 显示器支持实时交互和注视点渲染所需的 5 毫秒阈值,从而干扰用户的沉浸感。现有的轻量化或基于事件(event-based)的解决方案往往仍需要时间聚合或类图像重建,未能消除全帧图像获取和处理这一根本瓶颈。
方法论
作者提出了一种完全被动的光学系统,完全绕过了显式的图像形成过程。该系统不捕捉密集图像,而是执行面向任务的光学编码,直接获取眼部的紧凑、低维潜在表示。
1. 光学编码器与硬件架构
系统的核心是一个“潜在光学编码器”,由三个主要组件组成:
- 微透镜阵列(MLA): 一个菲涅尔透镜阵列,用于缩小眼部图像。
- 二元铬掩模: 一个协同设计的二元掩模,放置在 MLA 的焦平面上。
- 光电晶体管阵列: 一个 4×4 阵列(16 个元件),用于捕捉空间复用的光学测量值。
来自眼睛的光线穿过 MLA 并被二元掩模调制。由此产生的编码强度直接被光电晶体管捕获,生成一个 16 维的测量向量。该硬件与 FPGA 集成,以实现快速的信号采集。
2. 端到端训练框架
该系统采用从仿真到实物的流水线进行训练,联合优化光学编码掩模和数字推理网络:
- 数字仿真: 一个可微分的数字编码器 E~ 使用 16 个可学习的二元掩模(256×256 分辨率)应用于输入眼部图像,从而模拟光学过程。
- 潜在蒸馏: 为了确保 16 个测量值包含足够的信息,系统采用“教师 - 学生”蒸馏方法。一个教师网络(PT)反转预训练的 StyleGAN2 生成器,将眼部图像映射到 256 维潜在空间(hT)并预测 gaze。学生解码器(P)被训练为将压缩后的 16 测量向量直接映射到同一潜在空间(h),同时预测 gaze 方向(g^)和有效性标志(v^)。
- 损失函数: 训练目标结合了监督 gaze 回归、有效性分类、gaze 蒸馏(匹配教师的 gaze 预测)以及特征蒸馏(匹配教师的潜在表示)。
- 数据增强: 为解决身份偏差和数据集多样性有限的问题,作者使用生成式修复技术(结合 SAM3 和 ControlNet 的 Flux 扩散模型)来改变眼周外观(肤色、光照),同时保留真实的 gaze 标签。
3. Gaze 操控
该框架包含一个控制网络,可在潜在空间中操控 gaze。通过基于源 gaze 向量和目标 gaze 向量预测残差位移(Δh 或 Δw+),系统可以编辑潜在表示以改变 gaze 方向,同时保持主体身份不变,这证明了所学特征有效地将 gaze 与外观解耦。
主要贡献
- 端到端潜在空间框架: 一种新颖的框架,联合优化被动光学编码和神经解码,无需重建完整眼部图像即可直接从 16 个标量测量值中推断 gaze。
- 紧凑硬件原型: 一个单次拍摄的光学传感系统,利用 MLA、优化的二元掩模和带有 FPGA 采集功能的 4×4 光电晶体管阵列。该设计实现了 3.4 毫秒 的端到端延迟(包括传感和计算)。
- 从仿真到实物的流水线: 一种两阶段评估策略,实现了 6.47° 的跨主体仿真误差,以及在使用仅 12–15 个校准点的情况下,校准后的单主体真实世界误差低于 6°。
结果
- 精度与效率: 在 ETH-XGaze 数据集上,所提出的方法仅使用 16 个测量值和一个轻量级 MLP(0.244M 参数,0.49M FLOPs)即实现了 6.47° 的角度误差。
- 与 16×16 ResNet18 基线相比,它将传感维度降低了 16 倍,参数减少了约 48 倍,计算量减少了约 573 倍。
- 与 256×256 ResNet18 基线相比,它将传感维度降低了 4096 倍,计算量减少了约 9300 倍。
- 在保持具有竞争力的精度的同时,它在参数和 FLOP 效率方面优于 MobileNetV3 和 EfficientNet-B0 等紧凑骨干网络。
- 延迟: 该系统在 CPU 上展示了 3.4 毫秒 的总端到端延迟(光学传感/采集耗时 3.19 毫秒 + 推理耗时 0.22 毫秒)。这显著优于传统的基于图像的移动边缘系统(通常为几十毫秒),并接近专用高速商业追踪器(如 EyeLink 1000 Plus)的性能。
- 真实世界性能: 使用 12 个校准点进行特定于主体的微调后,系统实现了 5.96° 的平均角度误差,部分受试者达到了 4.5°。
- 隐私保护: 该系统通过仅捕捉与任务相关的潜在特征而非生物识别眼部图像来保护隐私,正如无法从测量值中重建受试者身份所证明的那样。
意义与主张
该论文主张,通过任务驱动设计将特征提取转移到光学领域,为超低延迟、高能效的 gaze 追踪提供了一条可行路径。通过消除对高带宽图像读取和繁重计算处理的需求,该系统满足了沉浸式 XR 应用严格的 <5 毫秒延迟要求。作者强调,虽然当前的原型是一个概念验证,但数据量的大幅减少(从兆像素到 16 个标量)表明,未来在电池供电的可穿戴设备中实现高能效方案有着清晰的路径。这项工作突显了“传感即推理”(sensing-as-inference)在特定计算机视觉任务中取代传统图像形成的潜力。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。