← 最新论文
💻 computer science

Densemarks: Learning Canonical Embeddings for Human Heads Images via Point Tracks

本文提出了 DenseMarks,一种基于点轨迹学习的人脸图像可查询规范嵌入表示,通过对比损失、多任务约束及空间连续性,实现了涵盖头发等全头区域、对姿态变化鲁棒的高精度密集对应、人脸跟踪及立体重建。

原作者: Dmitrii Pozdeev, Alexey Artemov, Ananta R. Bhattarai, Artem Sevastopolsky

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Dmitrii Pozdeev, Alexey Artemov, Ananta R. Bhattarai, Artem Sevastopolsky

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇关于DenseMarks的论文,简单来说,它发明了一种给“人头”做3D 身份证的新方法。

想象一下,如果你想在茫茫人海中,或者在一张照片里,精准地找到“左眉毛”、“右耳朵”或者“头发尖尖”的位置,传统的电脑视觉方法往往很笨拙。它们要么只能盯着眼睛、鼻子这些明显的特征点(就像只认得五官,认不出头发),要么在头发乱飞、戴着帽子或者侧脸的时候就会“迷路”。

DenseMarks 做了什么?

它给每个人头图像里的每一个像素(哪怕是一根发丝、一个耳环)都分配了一个独特的3D 坐标

为了让你更容易理解,我们可以用几个生动的比喻:

1. 核心概念:人头“乐高积木”宇宙

想象有一个标准的、透明的 3D 立方体盒子(论文里叫“规范空间”或 Canonical Space)。

  • 在这个盒子里,左耳永远固定在某个坐标点(比如 x=0.2, y=0.5, z=0.8)。
  • 鼻尖永远固定在另一个坐标点。
  • 头发虽然形状千变万化,但 DenseMarks 也能把每一缕头发映射到这个盒子里的特定位置。

DenseMarks 的作用,就是训练一个 AI 大脑,让它看到任何一张人脸照片(不管是谁、什么角度、有没有戴墨镜),都能瞬间把照片里的每一个像素,都“翻译”成这个标准 3D 盒子里的坐标。

  • 以前: 看到一张侧脸照片,电脑可能会困惑:“这是左耳还是右耳?头发挡住了怎么办?”
  • 现在(DenseMarks): 电脑直接查表:“哦,这个像素的坐标是 (0.2, 0.5, 0.8),根据我们的标准盒子,这肯定是左耳,不管它被头发遮住了多少。”

2. 它是如何学习的?(像“连连看”游戏)

研究人员没有给 AI 看成千上万张标注好坐标的 3D 人头模型(因为这种数据很难找),而是用了个聪明的办法:

  • 素材: 他们找了几万段“在野外”拍摄的说话视频(比如采访视频)。
  • 工具: 他们用一个现成的、很厉害的“点追踪器”(CoTracker),像玩“连连看”一样,自动追踪视频里同一个人的脸在每一帧里的变化。
  • 训练过程:
    • 把视频里同一张脸在不同时刻(比如正脸和侧脸)的两帧画面给 AI 看。
    • 告诉 AI:“虽然这两张图看起来不一样,但左眼在两张图里其实是同一个东西。”
    • AI 的任务就是:把这两张图里“左眼”的像素,都映射到那个标准 3D 盒子里的同一个坐标点上。
    • 如果映射错了,AI 就会受到惩罚(损失函数),直到它学会把“左眼”永远固定在盒子的同一个位置。

3. 为什么它很厉害?(三大绝招)

  • 绝招一:连头发和配饰都能认
    以前的方法只认五官(眼睛、嘴巴),一旦你戴了帽子或者头发乱了,它们就瞎了。DenseMarks 把整个头(包括头发、耳环、帽子)都纳入了那个 3D 盒子。就像给整个头贴了个完整的 3D 地图,不管怎么动,地图上的位置是固定的。

  • 绝招二:超级抗干扰
    即使脸被手挡住了一部分,或者光线很暗,只要 AI 能认出一点点特征,它就能根据那个“标准盒子”推断出被挡住的部分应该在哪里。这就像你即使只看到一个人的半张脸,也能凭记忆猜出他另一半脸长什么样。

  • 绝招三:小身材,大能量
    它生成的这个"3D 坐标”非常小(只有 3 个数字),但信息量巨大。相比之下,其他大模型可能需要几百个数字才能描述一个点。这让它在手机或普通电脑上运行起来非常快。

4. 它能用来做什么?

  • 超级稳定的视频追踪: 拍视频时,不管人怎么转头、怎么甩头发,电脑都能死死咬住脸上的每一个点,不会跟丢。这对于做虚拟换脸、AR 特效(比如给头发加特效)非常重要。
  • 3D 重建: 给你两张不同角度的照片,它能瞬间算出这个人的 3D 模型,甚至能重建出头发丝的细节。
  • 找相似: 你可以在一张图上点一下“左耳”,然后让电脑在所有视频里瞬间找到所有人的“左耳”在哪里。

总结

DenseMarks 就像给每个人头都发了一本通用的 3D 字典。以前我们看人脸是看“平面图片”,现在通过这本字典,我们能把任何角度、任何发型的人脸,瞬间还原成一个标准的、立体的、结构清晰的 3D 模型。这让电脑“看懂”人脸的能力,从“认五官”进化到了“懂结构”,连头发丝都能理得清清楚楚。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →