← 最新论文
🤖 AI

See Through the Noise: Improving Domain Generalization in Gaze Estimation

本文首次系统探究了标签噪声对眼动估计域泛化性能的负面影响,并提出了名为 SeeTN 的框架,通过构建原型语义嵌入空间、度量特征 - 标签亲和一致性以及引入流形正则化,有效区分并校正噪声样本,从而在不牺牲源域精度的前提下显著提升了跨域泛化能力。

原作者: Yanming Peng, Shijing Wang, Yaping Huang, Yi Tian

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanming Peng, Shijing Wang, Yaping Huang, Yi Tian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于“教电脑看人眼神”的故事,但它解决了一个非常棘手的问题:当教电脑的数据本身就有错的时候,怎么让它还能在陌生的环境里表现得好?

我们可以把这项技术想象成**“在嘈杂的集市里教一个学生认路”**。

1. 背景:为什么“看眼神”这么难?

想象一下,你想教一个学生(AI 模型)通过看人的眼睛来判断他在看哪里(比如看左边还是看右边)。

  • 理想情况:你给他看一张图,告诉他:“这个人正看着正前方。”
  • 现实情况:在真实世界里,光线会变、头会歪、人也会乱动。更糟糕的是,用来教学生的“老师”(标注数据)有时候也会看走眼,或者因为太忙而标错了。
    • 比如,图里的人明明在看左边,但老师(标注者)却标成了“看右边”。
    • 这就好比老师给学生指路时说:“前面是南,其实是北。”如果学生太听老师的话,死记硬背这些错误的指令,一旦到了一个新的地方(比如从实验室到了大街上),他就会彻底迷路。

2. 核心问题:噪音的破坏力

以前的研究主要关注怎么让模型适应不同的环境(比如从室内到室外),但大家往往忽略了**“老师教错了”**这个问题。

  • 如果老师教的数据里有很多错误(噪音),模型就会把错误的特征当成真理。
  • 结果就是:模型在熟悉的教室里考满分,一出门(跨域测试)就考零分。

3. 解决方案:SeeTN(“穿透噪音”框架)

作者提出了一个叫 SeeTN (See Through Noise) 的新方法。我们可以把它想象成给这个学生装上了一副**“透视眼镜”和一套“互助学习小组”**。

第一步:建立“语义地图” (Semantic Manifold)

  • 比喻:想象把所有人的眼神方向画在一张巨大的地图上。
  • 做法:通常,电脑只看数字准不准(比如误差是 5 度还是 6 度)。但 SeeTN 告诉电脑:“别光看数字,要看关系。”
    • 如果两个人眼神方向差不多,他们在地图上的位置就应该靠得很近。
    • 如果一个人眼神向左,一个人向右,他们就应该离得远。
    • 这就建立了一个**“关系网”**,确保眼神方向连续、自然,而不是乱成一团。

第二步:找出“捣乱分子” (识别噪音)

  • 比喻:在互助小组里,大家互相核对答案。
  • 做法
    • 如果某个学生的答案(模型预测)和他周围同学的答案(基于关系的推断)很一致,但老师给的“标准答案”却格格不入,那大概率是老师标错了(这就是噪音)。
    • 如果大家的预测和老师的答案都一致,那就是好学生(干净样本)。
    • 通过这种“关系比对”,SeeTN 能精准地把那些被标错的数据挑出来。

第三步:因材施教 (鲁棒性正则化)

一旦分出了“好学生”和“被误导的学生”,SeeTN 就采取不同的策略:

  • 对好学生(干净样本):直接听老师的,认真学,把基础打牢。
  • 对被误导的学生(噪音样本)
    • 不要扔掉:虽然老师标错了,但这张图本身还是有价值的(比如头部的形状、光线的信息)。
    • 换个老师:不让它听那个错误的老师,而是让它向“好学生”学习。利用“好学生”建立的正确关系网,来修正这些“坏学生”的学习方向。
    • 比喻:就像在一个小组里,如果一个人被错误的信息带偏了,其他组员会拉着他,告诉他:“你看,大家其实都往这边走,你跟着我们走,别管那个乱指路的人了。”

4. 结果:为什么它很厉害?

  • 不丢分:以前的方法为了适应新环境,往往会牺牲在旧环境的表现。但 SeeTN 因为把“噪音”过滤掉了,所以在熟悉的领域(实验室)和陌生的领域(真实街道)都能考高分。
  • 更懂眼神:通过可视化实验发现,以前的模型看到头歪了就会以为眼神也歪了(被表面现象迷惑);而 SeeTN 学会了真正关注眼神的方向,即使头歪了,它也能认出眼神是直的。

总结

这篇论文的核心思想就是:在教 AI 看眼神时,不要盲目相信所有标注数据。要建立一个“关系网”来互相验证,找出那些标错的数据,然后利用干净数据去纠正那些被带偏的数据。

这就好比一个聪明的学生,不仅会听老师的话,还会通过观察周围同学的反应,自己判断老师是不是说错了,从而在任何环境下都能找到正确的方向。这就是 SeeTN 能够“穿透噪音”,让眼神识别技术变得更强大的秘密。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →