← 最新论文
💻 computer science

Low Latency Gaze Tracking via Latent Optical Sensing

本文提出了一种实时超低延迟的视线跟踪系统,该系统通过采用带有微透镜阵列和二值掩模的无源光学编码器直接捕获任务相关的潜在特征,从而绕过传统图像处理,实现了3.4毫秒的端到端延迟,并相较于基于相机的传统方法提升了能效。

原作者: Yidan Zheng, Matheus Souza, Kaizhang Kang, Qiang Fu, Hadi Amata, Wolfgang Heidrich

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yidan Zheng, Matheus Souza, Kaizhang Kang, Qiang Fu, Hadi Amata, Wolfgang Heidrich

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试猜测某人的视线方向。传统做法就像是用高清 4K 相机拍摄他们的眼睛,将庞大的文件发送到超级计算机,然后让计算机分析每一个像素,以确定其视线方向。这种方法虽然准确,但速度慢、耗电量大,且需要传输大量数据。

本文提出了一种截然不同的“捷径”方法。他们不是拍摄完整图像,而是构建了一种特殊的光学滤波器,它就像一个智能筛子

以下是该系统的运作原理,分解为简单概念:

1. “智能筛子”(光学编码器)

想象你有一桶水(来自眼睛的光),你想知道雨下得是大还是小。与其用一张大网接住每一滴水并逐一计数(即拍摄完整照片),不如将水通过一个具有特定、定制孔洞图案的筛子。

  • 硬件:研究人员制造了一种设备,包含一个微透镜阵列(一张由微小放大镜组成的片)和一个二值掩膜(一张带有特定黑白方块图案的片)。
  • 原理:当来自眼睛的光穿过这个“筛子”时,会被扰乱成特定的图案。系统并不关心眼睛“看起来”是什么样子(无关虹膜颜色、肤色或详细特征),它只关心透过的光强模式
  • 结果:系统不再捕获 256x256 像素的图像(65,000 多个数据点),而仅捕获16 个数字。这就像将整部小说压缩成一句话,却依然能告诉你主要情节。

2. “轻量级翻译器”(AI 解码器)

一旦系统获得这 16 个数字,它不会尝试重建眼睛图像,那将是浪费时间。相反,它将这 16 个数字输入到一个微小、超快的计算机大脑(轻量级神经网络)中。

  • 训练技巧:为了训练这个微小的大脑,研究人员使用了一个懂得如何将眼睛图像转化为抽象代码的“教师”AI。他们教导新系统仅利用这 16 个数字来模仿“教师”的“思维过程”。
  • 隐私优势:由于系统从未真正看到或存储眼睛的真实照片,因此天然更具隐私性。你无法从这 16 个数字中识别出个人身份,但系统仍能准确告诉你他们看向哪里。

3. 速度纪录(延迟)

这里最大的优势在于速度。

  • 传统相机:必须等待整张图像拍摄完成,然后读取所有像素,再进行处理。这通常需要 10 到 20 毫秒(或更久)。
  • 本系统:由于跳过了“拍照”步骤,仅读取 16 个微小传感器,整个流程——从光线照射到传感器到计算机输出“他们正看向左侧”——耗时不到3.4 毫秒

类比
传统的相机系统就像一位摄影师,他拍下一张照片,打印出来,走到一位艺术评论家面前,问道:“这个人正看向哪里?”
而新系统则像一名保安,他根本不看这个人的脸。相反,他只看这个人在特定墙壁上投下的影子。这个影子是扭曲的,无法辨认出人脸,但保安可以根据影子的形状准确判断这个人正朝哪个方向。这种方法即时、无需照片,且能耗极低。

他们实际取得的成果

  • 准确性:在测试中,该系统对视线方向的猜测误差约为 6 度(大约相当于手臂伸直时大拇指的宽度)。这对于许多实际应用来说已经足够好。
  • 现实测试:他们利用真实透镜、掩膜和传感器构建了物理原型。当在真人身上进行测试时,只需向该人展示屏幕上 12 到 15 个不同的位置,即可为该特定人员“校准”系统,且效果良好。
  • 效率:该系统所需的计算能力仅为标准相机的极小部分。其效率之高,足以在非常小的电池供电设备上运行,例如未来的 AR 眼镜。

总结
本文证明,跟踪眼球运动并不需要高清相机。通过使用巧妙的光学滤波器将光扰乱为一组微小的数字,并利用简单的 AI 读取这些数字,你可以在4 毫秒以内跟踪某人的视线方向。这一速度足以跟上人类大脑的反应,使其成为下一代虚拟现实和增强现实眼镜的理想选择,因为延迟会导致晕动症。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →