← 最新论文
💻 computer science

GazePrior: Zero-Shot AR/VR Eye Tracking via Learned 3D Gaze Reconstruction

该论文介绍了 GazePrior,这是一种零样本眼动追踪方法,它利用学习到的三维先验知识,从现有设备合成真实、多样且标注准确的训练数据,从而无需进行耗资巨大的新数据采集即可在新型 AR/VR 硬件上实现高性能眼动追踪。

原作者: Corentin Dumery, David Colmenares, Alexander Fix, Pascal Fua, Ali Behrooz, Jogendra Kundu

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Corentin Dumery, David Colmenares, Alexander Fix, Pascal Fua, Ali Behrooz, Jogendra Kundu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何解读你的眼神。为了准确做到这一点,机器人需要看到数百万张人类眼睛的图片,涵盖所有可能的注视方向、所有可能的光线条件以及所有可能的角度。

通常,为了获取这些图片,公司必须搭建新的相机设备,寻找数千名志愿者,并花费数月时间拍摄照片。每当他们设计一副新的智能眼镜时,这都是一项昂贵、缓慢且充满后勤噩梦的任务。

问题:“新相机”困境
将眼动追踪相机比作不同的眼镜。如果你更换了眼镜(相机),眼睛看起来的样子会发生细微变化。在“眼镜 A"上训练的模型,当你将其用于“眼镜 B"时往往会失效。传统上,要解决这个问题,你必须外出用“眼镜 B"拍摄一整组全新的照片。

解决方案:GazePrior(“通用眼睛蓝图”)
GazePrior背后的研究人员想出了一个巧妙的捷径。他们不再拍摄新照片,而是构建了一个“通用眼睛蓝图”。

以下是其工作原理,使用一个简单的类比:

  1. 大师雕塑家(3D 先验): 想象一位大师雕塑家,他研究过成千上万人的真实眼睛。这位雕塑家不仅仅 memorize 一张脸;他学会了眼睛、眼睑和眉毛如何协同运动的规则。他理解当眼睛向左看时,眼睑不会静止不动,而是会轻微移动。这位“雕塑家”是一个名为3D 先验的计算机模型。它学习了眼睛在所有角度、对所有人、在所有光线下的隐藏模式。
  2. 稀疏线索(旧数据): 研究人员使用了用相机设备拍摄的现有眼睛照片(这些照片已经标注了正确的“注视方向”)。他们不需要新照片;只需要这些旧的、稀疏的线索。
  3. 魔法转换(重定向): 现在,想象一下你想看到同样的眼睛透过一个全新相机镜头(甚至尚未制造出来)会是什么样子。
    • “雕塑家”获取旧照片。
    • 它利用其“通用眼睛蓝图”重建那一刻完美的眼睛 3D 模型。
    • 然后,它“渲染”(绘制)出该眼睛的全新图像,仿佛它是透过相机的镜头被看到的一样。

为何这意义重大
以前的方法试图通过拍摄一张 2D 照片,然后仅仅“扭曲”或拉伸眼球使其看向新方向来实现这一点。这就像拿一张平面的眼睛贴纸,试图扭曲它;结果往往看起来很假,且眼睑不会自然移动。

GazePrior 的不同之处在于它构建了一个真实的 3D 模型。它理解眼睛是圆形物体,而眼睑是灵活皮肤。因此,当它为新的相机生成新图像时,眼睑会自然地眨动,睫毛会正确捕捉光线,眼睛上的反光看起来也很真实。

结果
研究人员通过仅使用这些计算机生成的图像来训练眼动追踪 AI,对此进行了测试。

  • 测试: 他们尝试让 AI 在一台新设备(Meta Aria 头显)上工作,而从未向该 AI 展示过任何由该特定设备拍摄的真实照片。
  • 结果: 该 AI 的表现几乎与使用由该设备拍摄的真实照片进行训练时一样好。它以前所未有的显著优势击败了所有之前的“零样本”方法(即尝试在没有新数据的情况下工作的方法)。

简而言之
GazePrior 就像一位主厨,只需利用少量食材和食谱就能完美复刻一道复杂的菜肴,而无需每次都去市场购买新鲜食材。它允许公司利用从旧数据生成的“虚拟”数据来设计和测试新的眼动追踪眼镜,从而节省了大规模实地拍摄所需的成本和时间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →