← 最新论文
💻 computer science

GazeOnce360: Fisheye-Based 360{\deg} Multi-Person Gaze Estimation with Global-Local Feature Fusion

本文提出了 GazeOnce360,这是一种基于向上鱼眼相机的端到端多人大范围 360 度视线估计模型,通过引入全球 - 局部特征融合架构和旋转卷积来应对鱼眼畸变,并发布了配套的合成数据集 MPSGaze360 以推动该领域研究。

原作者: Zhuojiang Cai, Zhenghui Sun, Feng Lu

发布于 2026-03-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhuojiang Cai, Zhenghui Sun, Feng Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一项名为 GazeOnce360 的新技术,它的核心目标是:让一个放在桌子上的摄像头,能同时看清围坐在桌子周围一圈人的眼神,知道他们到底在看哪里。

为了让你更容易理解,我们可以把这项技术想象成一场"圆桌会议的眼神大侦探"游戏。

1. 以前的做法 vs. 现在的做法

以前的做法(像是一个笨拙的翻译官):
想象一下,如果你想在一个圆桌旁知道每个人的眼神,以前的方法通常是这样:

  1. 先拍一张鱼眼照片(这种照片边缘是弯曲变形的,像哈哈镜)。
  2. 把这张照片“切”成好几块,把弯曲的脸“掰直”(就像把一张弯曲的地图强行铺平)。
  3. 把每个人脸单独剪下来,一个个去分析。
  4. 最后把结果拼回去。

缺点: 这个过程太慢了,而且“掰直”照片时容易把脸切坏(比如一个人的脸被切到了照片边缘,就看不到了),就像翻译官在翻译时容易把句子弄错,导致最后结果不准。

GazeOnce360 的做法(像是一个拥有透视眼的超级侦探):
这项新技术不需要“切”照片,也不需要“掰直”。它直接面对那张弯曲的鱼眼照片,一次性(End-to-End)就能认出所有人,并直接算出他们的眼神方向。就像侦探一眼扫过全场,直接看穿了所有人的心思。

2. 它是怎么做到的?(三大绝招)

为了在弯曲的照片里看清眼神,这个模型用了三个“独门秘籍”:

第一招:旋转卷积(Rotational Convolution)—— “会转圈的放大镜”

  • 问题: 鱼眼镜头拍出来的照片,边缘的人脸是歪的、变形的。普通的 AI 像是一个拿着直尺的测量员,遇到歪的东西就量不准了。
  • 解决: 这个模型里的“放大镜”(卷积核)是会旋转的。不管人脸在照片的哪个角落,是歪的还是斜的,这个放大镜都能自动旋转角度去贴合它。
  • 比喻: 就像你戴着一副特制的眼镜,无论别人怎么歪着头,你都能自动调整镜片角度,始终正对着他们的眼睛看。

第二招:双分辨率融合(Dual-Resolution)—— “既看森林,又看树叶”

  • 问题: 鱼眼镜头视野很广(360 度),但每个人在画面里其实很小。如果为了看清眼睛把整张图都放大,电脑会累死(计算太慢);如果只放大看脸,又不知道大家围坐的布局。
  • 解决: 模型分成了两条腿走路:
    • 低分辨率腿(看森林): 快速浏览整张图,知道“哦,这里有 5 个人,他们围成一圈”。
    • 高分辨率腿(看树叶): 专门把每个人的脸“抠”出来,放大看细节(瞳孔、眼皮)。
    • 融合: 最后把“大局观”和“细节”结合起来,既知道谁在哪,又知道他在看哪。
  • 比喻: 就像你既用广角镜头看整个舞台的布局,又用长焦镜头特写演员的眼神,最后把两个画面完美合成。

第三招:多任务监督(Multi-Task Supervision)—— “不仅看眼神,还要找眼珠”

  • 问题: 有时候人脸是侧着的,很难直接看出眼神。
  • 解决: 模型在训练时,不仅被要求猜眼神,还被要求同时画出眼睛的轮廓和瞳孔的位置
  • 比喻: 就像教一个学生做题,不仅让他算出答案(眼神方向),还让他把解题步骤(眼珠位置)写出来。通过这种“强制写步骤”的训练,模型对眼神的理解更深刻、更准确。

3. 没有真实数据怎么办?(MPSGaze360 数据集)

现实世界里,很难找到那么多围坐在桌子旁、眼神各异、且带有精确标注(知道他们到底在看哪)的真实鱼眼照片。

  • 解决方案: 作者用游戏引擎(Unreal Engine)造了一个虚拟世界
  • 比喻: 就像拍电影前先造了一个逼真的“虚拟片场”。他们在里面放了 69 个不同长相的虚拟人,让他们围坐在桌子旁,随意转头、眨眼、看不同方向。因为是在电脑里生成的,所以每一个眼神、每一个眼珠的位置都是 100% 准确的,不需要人工去猜。
  • 在这个“虚拟片场”里训练好的模型,竟然也能很好地适应现实世界的真实照片(就像在模拟器里练好的赛车手,上了真赛道也能跑得快)。

4. 这项技术有什么用?

想象一下这些场景:

  • 智能会议室: 桌子中间放个摄像头,就能知道参会的每个人是在看 PPT、看同事,还是在偷偷看手机。
  • 服务机器人/前台: 机器人抬头看一眼,就知道围在柜台前的顾客谁在等待、谁在焦急、谁在看价目表。
  • 协作空间: 自动分析团队讨论时的注意力分布,帮助优化沟通效率。

总结

GazeOnce360 就像给摄像头装上了一副智能的、会旋转的、能同时看远看近的眼镜。它不再需要笨拙地处理弯曲的鱼眼照片,而是直接、快速、准确地捕捉到围坐一圈的每个人的眼神。

这项研究不仅提出了一种更聪明的算法,还为大家提供了一个巨大的“虚拟训练场”(MPSGaze360 数据集),让未来的智能设备能更懂人类的“眼神交流”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →