✨ 要点🔬 技术摘要
想象一下,你正在教一个机器人如何解读你的眼神。为了准确做到这一点,机器人需要看到数百万张人类眼睛的图片,涵盖所有可能的注视方向、所有可能的光线条件以及所有可能的角度。
通常,为了获取这些图片,公司必须搭建新的相机设备,寻找数千名志愿者,并花费数月时间拍摄照片。每当他们设计一副新的智能眼镜时,这都是一项昂贵、缓慢且充满后勤噩梦的任务。
问题:“新相机”困境 将眼动追踪相机比作不同的眼镜。如果你更换了眼镜(相机),眼睛看起来的样子会发生细微变化。在“眼镜 A"上训练的模型,当你将其用于“眼镜 B"时往往会失效。传统上,要解决这个问题,你必须外出用“眼镜 B"拍摄一整组全新的照片。
解决方案:GazePrior(“通用眼睛蓝图”) GazePrior 背后的研究人员想出了一个巧妙的捷径。他们不再拍摄新照片,而是构建了一个“通用眼睛蓝图”。
以下是其工作原理,使用一个简单的类比:
大师雕塑家(3D 先验): 想象一位大师雕塑家,他研究过成千上万人的真实眼睛。这位雕塑家不仅仅 memorize 一张脸;他学会了眼睛、眼睑和眉毛如何协同运动的规则 。他理解当眼睛向左看时,眼睑不会静止不动,而是会轻微移动。这位“雕塑家”是一个名为3D 先验 的计算机模型。它学习了眼睛在所有角度、对所有人、在所有光线下的隐藏模式。
稀疏线索(旧数据): 研究人员使用了用旧 相机设备拍摄的现有眼睛照片(这些照片已经标注了正确的“注视方向”)。他们不需要新照片;只需要这些旧的、稀疏的线索。
魔法转换(重定向): 现在,想象一下你想看到同样的眼睛透过一个全新 相机镜头(甚至尚未制造出来)会是什么样子。
“雕塑家”获取旧照片。
它利用其“通用眼睛蓝图”重建那一刻完美的眼睛 3D 模型。
然后,它“渲染”(绘制)出该眼睛的全新图像,仿佛它是透过新 相机的镜头被看到的一样。
为何这意义重大 以前的方法试图通过拍摄一张 2D 照片,然后仅仅“扭曲”或拉伸眼球使其看向新方向来实现这一点。这就像拿一张平面的眼睛贴纸,试图扭曲它;结果往往看起来很假,且眼睑不会自然移动。
GazePrior 的不同之处在于它构建了一个真实的 3D 模型 。它理解眼睛是圆形物体,而眼睑是灵活皮肤。因此,当它为新的相机生成新图像时,眼睑会自然地眨动,睫毛会正确捕捉光线,眼睛上的反光看起来也很真实。
结果 研究人员通过仅使用这些计算机生成的图像来训练眼动追踪 AI,对此进行了测试。
测试: 他们尝试让 AI 在一台新设备(Meta Aria 头显)上工作,而从未向该 AI 展示过任何由该特定设备拍摄的真实照片。
结果: 该 AI 的表现几乎与使用由该设备拍摄的真实照片进行训练时一样好。它以前所未有的显著优势击败了所有之前的“零样本”方法(即尝试在没有新数据的情况下工作的方法)。
简而言之 GazePrior 就像一位主厨,只需利用少量食材和食谱就能完美复刻一道复杂的菜肴,而无需每次都去市场购买新鲜食材。它允许公司利用从旧数据生成的“虚拟”数据来设计和测试新的眼动追踪眼镜,从而节省了大规模实地拍摄所需的成本和时间。
技术摘要:GazePrior
问题陈述
眼动追踪(ET)是高级增强现实(AR)和虚拟现实(VR)应用的基础技术,支持如注视点渲染和基于注视的交互等功能。然而,为每一代新设备收集具有高质量真值(ground truth)的真实世界数据成本高昂且耗时,这阻碍了用于 ET 的深度学习模型的训练。随着硬件配置(摄像头位置、分辨率)的演变,需要包含数百万帧的新训练集。现有的合成数据生成方法往往缺乏真实感,而众包的真实数据则缺乏准确性。此外,当前试图合成眼部图像的半合成方法通常依赖显式的眼球掩膜和刚性旋转,忽略了眼球、眼睑与周围面部特征之间复杂的耦合关系,从而降低了物理合理性和准确性。
方法论
作者提出了GazePrior ,这是一种零样本(zero-shot)方法,利用学习到的 3D 注视先验,仅使用来自现有设备的稀疏输入数据,即可为新的 ET 设备合成高保真训练数据。该方法包含两个主要阶段:
1. 学习解耦的 3D 注视先验(预训练)
受 3D 虚拟化身方法的启发,作者训练了一个条件神经辐射场(NeRF),用于建模人类眼睛在多样化身份、注视方向和光照条件下的分布。
条件辐射场 :网络 Ψ \Psi Ψ 接收 3D 点 x x x 、观察方向 v v v ,以及主体身份(s ^ \hat{s} s ^ )、注视方向(g ^ \hat{g} g ^ )和光照(l ^ \hat{l} l ^ )的潜在嵌入。它输出密度 σ \sigma σ 和颜色 c c c 。
解耦 :该架构显式地将这些因素解耦。密度网络依赖于身份和注视,但与光照(l ^ \hat{l} l ^ )无关;而颜色网络则依赖于所有三个因素。这确保了几何一致性不会因光照变化而受到混淆。
潜在表示 :
主体(s ^ \hat{s} s ^ ) :每个身份的可学习码本向量,鼓励共享的低频表示,作为对抗伪影(如漂浮物)的正则化器。
注视(g ^ \hat{g} g ^ ) :与刚性眼球旋转模型不同,注视通过真值注视向量的正弦编码进行编码。这使得网络能够学习与注视变化耦合的眼睑和眉毛的非刚性运动。
光照(l ^ \hat{l} l ^ ) :一个可学习的码本向量,仅影响颜色输出,确保重建的几何结构对光照保持不变。
训练 :该模型在一个包含 400 多名受试者、多视角图像、不同注视方向和光照的大型数据集(Lin 等人 [11])上进行预训练,使用的损失函数结合了 RGB 重建、感知损失和 KL 散度,以正则化潜在空间。
2. 稀疏输入重定向(微调)
为了将先验适配到新的目标设备(例如具有不同摄像头配置的耳机),该方法对来自现有耳机的稀疏源图像(例如 4 个视角)执行两步优化:
潜在优化 :在冻结预训练网络权重的情况下,系统针对新主体和光照优化特定的潜在代码(s ^ I , l ^ I \hat{s}_I, \hat{l}_I s ^ I , l ^ I ),以拟合稀疏源视角。真值注视嵌入 g ^ I \hat{g}_I g ^ I 根据已知注释计算并保持不变。
微调 :解冻网络权重,并与潜在代码联合优化,以捕捉特定于个人的细节并细化重建。
合成 :将生成的高保真辐射场从目标 设备的摄像头视角进行渲染。这会生成合成训练图像,这些图像保留了原始的真值注视注释,但匹配了新设备的光学特性。
主要贡献
首个学习到的注视先验 :本文引入了首个 3D 注视先验,它解耦了主体、注视和光照,具有生物学准确的眼睑运动,且不依赖显式的眼球掩膜或刚性旋转。
稀疏视图 3D 重建 :该方法能够从极稀疏的输入(少至 2-4 个视图)中实现高质量的 novel view synthesis(新视图合成),这是对之前需要密集多视图采集的方法的重大改进。
零样本数据合成 :它提供了一条流水线,用于为新的 AR/VR 设备生成训练数据,而无需收集任何新的真实世界数据,有效地弥合了旧硬件与新硬件之间的领域差距。
卓越的性能 :与在竞争合成基线数据上训练的模型相比,使用合成数据训练的 ET 模型实现了更高的准确性和鲁棒性。
实验结果
作者使用 Aria 耳机作为目标设备评估了 GazePrior,并将其与最先进的基线(ControllableGaze [10]、Lin 等人 [11])进行了比较。
新视图合成(NVS) :在定量评估(PSNR、SSIM、MSE)中,随着输入视图数量的减少,GazePrior 的表现显著优于基线。仅使用 2 个输入视图时,GazePrior 的表现比最佳基线高出近 10 dB。定性结果显示,与真实的 Aria 采集相比,GazePrior 生成了高保真的细节(睫毛、眼睑),领域差距极小,而基线则表现出漂浮物和伪影。
眼动追踪性能 :在 GazePrior 合成数据上训练的 ET 模型在真实的 Aria 测试数据上实现了**5.85°**的平均注视角度误差。这比基线(12.53°和 12.69°)有了显著改进,并接近在真实设备特定数据上训练的模型的性能(4.35°)。
消融研究 :研究证实,解耦的潜在空间以及将光照与密度分离至关重要。使用单个潜在向量或使密度依赖光照会导致性能显著下降。正弦注视编码被证明比用于注视的学习码本更有效。
意义与主张
本文声称,GazePrior 通过实现眼动追踪的零样本 方法,解决了新 AR/VR 设备数据收集的 prohibitive costs(高昂成本)。通过利用来自旧耳机的现有标注数据集,并通过学习到的 3D 先验对其进行重定向,该方法使开发人员能够:
在物理构建新设备之前,为其训练鲁棒的眼动追踪器。
评估摄像头位置对性能的影响,而无需物理原型制作。
无需昂贵的大规模数据收集活动即可实现高精度。
作者将这项工作定位为解锁 XR 中高级功能(如注视点渲染和注视捏合交互)的基础步骤,消除了目前阻碍该领域快速迭代的数据收集瓶颈。他们承认了局限性,例如使用辐射场模拟高频角膜反光(corneal glints)的难度,但强调了该方法在生成多样化、逼真的训练数据方面的成功,其表现优于现有的合成技术。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。