Emergent Region-Level Facial Correspondence in Frozen Vision Foundation Models
本文表明,冻结的 DINOv3 视觉基础模型在结合面部部件标注界面时,能够在无需专门训练的情况下,实现强大的零样本区域级面部对应关系以及跨身份的临时追踪,其中中间特征层被证明对于密集解剖对齐最为有效。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:计算机可以观察一张猫的照片,并瞬间识别出哪里是耳朵、哪里是尾巴、哪里是鼻子,即使这只猫正在睡觉、奔跑或者戴着一顶帽子。长期以来,科学家们认为计算机需要被专门教授这些知识,就像学生背诵教科书一样。但最近,一种新型的计算机“超级大脑”出现了。这些被称为基础模型(foundation models)。把它们想象成那些读遍了图书馆几乎所有书籍,却从未参加过特定学科考试的学生。它们通过观察数百万张图像,学习了关于世界如何呈现的通用规则——即纹理、形状和模式是如何相互契合的。
科学家们正在提出的一个重大问题是:这些从未专门学习过“脸部”知识的超级大脑,是否真的理解人类脸部的地图?如果给它们看一个陌生人的照片,它们能否指向鼻子并说:“这就是鼻子,就像另一张照片里的鼻子一样”,即便这两个人看起来完全不同?这一点至关重要,因为如果计算机能在未经过专门训练的情况下做到这一点,就意味着它已经学会了一种关于形状和结构的通用语言。这表明计算机建立了一个内在的“坐标系”,一个适用于所有人的面部心理地图,无论他们是谁,或正在做什么。
论文的发现:没有老师的面部地图
本论文研究了一个特定的超级大脑——DINOv3——是否在从未被训练识别眼睛、鼻子或嘴巴的情况下,秘密地学习了人类脸部的映射。研究人员希望测试这个“冻结”(保持不变)的模型是否可以作为一个人类面部特征的通用翻译器。
为了测试这一点,他们把这个模型当作一名侦探。他们没有教模型什么是“鼻子”。相反,他们使用了一个名为 FaRL 的独立工具,仅仅是为了给模型贴上标签。FaRL 查看一张脸并说:“这一块像素是鼻子,那一块是眼睛。”然后,研究人员问 DINOv3:“如果我给你来自 A 人的鼻子的一块像素,你能找到 B 人脸上与之匹配的鼻子部分吗?即便你从未见过 B 人。”
结果非常出色。这个从未接受过面部训练的模型,成功实现了跨不同人物的面部区域匹配,准确率达到了 83.0%。为了让你有个直观的概念,如果你只是根据图片中皮肤或头发的多少进行随机猜测,你的正确率只会是 23.0%。该模型并非在瞎猜;它已经习得了一种隐藏的结构。
“中间层”之谜
论文中最有趣的发现之一是,这种魔力发生在模型的哪个“大脑”部位。DINOv3 就像一座拥有 24 层楼的多层建筑。研究人员发现,理解脸部的“最佳”楼层并不是模型做出最终决策的顶层。
可以将模型的各层想象成一组正在素描人脸的艺术家:
- 顶层(第 24 层): 这是艺术家退后一步观察全貌的地方。他们知道这是一张脸,但他们已经将所有细节混合在了一起。如果要求他们指出鼻子,他们可能会感到困惑,因为对他们来说,鼻子、嘴巴和皮肤都属于“脸部相关的东西”。在论文中,这一层将鼻子匹配到鼻子的表现仅比匹配到其他部位好 1.48 倍。
- 中间层(第 18 层): 这是艺术家仍在处理细节的地方。在这里,模型保持了特征的清晰与独立。它确切地知道鼻子与嘴巴是分离的。在这一层,模型匹配相同部位(如鼻子对鼻子)的能力比匹配不同部位(如鼻子对嘴巴)的能力高出 4.93 倍。如果你忽略掉左眼和右眼非常相似(对称性)这一事实,这个数字会跃升至 7.19 倍!
这告诉我们,模型的“中间大脑”持有一个非常精确、详细的面部零件地图,而“顶层大脑”则过于关注宏观全貌,以至于忽略了微小的细节。
追踪运动中的面部
研究人员还测试了这种地图在视频中是否有效。他们拍摄了一段人说话的视频,并要求模型追踪一个特定的部位(例如嘴巴),从第一帧到最后一帧,且无需教它如何运动。
结果如何?模型追踪面部部位的准确率达到了 95.5%。这就像是在观察一名舞者,即使舞者转身或改变表情,你也能完美地跟随其手部动作。模型不需要专门的“视频老师”;它直接使用了从静态图片中学到的那套面部地图。
这个模型“不是”什么
了解这个模型“不具备”什么能力同样重要。论文测试了另一个著名的模型 CLIP,以观察它是否也能做到同样的事情。CLIP 非常擅长理解脸部的宏观概念(例如“这是一个人的脸”),但在处理精细细节方面表现不佳。当要求它在不同人之间匹配特定的部位(如眼睛或眉毛)时,CLIP 显得很吃力。这证明了 DINOv3 不仅仅是更擅长寻找脸部,它还学习到了其他模型所缺乏的、具体的解剖学地图。
此外,模型本身并不“知道”什么是“鼻子”或“眼睛”。如果拿掉那个为它提供名称标签的工具(FaRL),模型的表现会骤降至 0.9%。这意味着模型提供了结构(地图),但它需要人类(或另一个工具)来提供名称。这就像拥有一张完美的城市地图,但每条街道都用代码标记着;你需要一份图例才能知道“代码 A”代表的是“主街”。
总结
这篇论文表明,那些在通用图像上进行训练的“冻结视觉模型”,无意中学习了一套强大且通用的、针对人类脸部的坐标系。它们可以在从未专门学习过面部知识的情况下,实现跨不同人物的眼睛、鼻子和嘴巴的匹配,甚至能在视频中进行追踪。其中的奥秘在于模型的中间层,这些层级保持了细节的锐利与清晰。这一发现表明,我们可能不需要为每一个任务都训练专门的 AI;有时,那些通用的“超级大脑”内部早已隐藏好了答案,正等待着被发掘。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。