← 最新论文
💻 computer science

Position: Age Estimation Models Do Not Process Biometric Data

本立场文件主张,年龄估计模型并未处理生物特征数据,因为实证证据表明其缺乏个体识别所需的身份区分能力,并敦促监管机构将此类临时处理与模板存储区分开来,以避免不必要的法律负担。

原作者: Nikita Marshalkin

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Nikita Marshalkin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言对这篇论文的解读,并借助类比使概念更加清晰。

核心问题:“猜测”等同于“指纹”吗?

想象你走进一家商店。摄像头拍下你的脸来猜测你的年龄。这篇论文提出的问题就是:这个摄像头仅仅是在“猜测”你的年龄,还是秘密地创建了一个能识别你身份的数字指纹?

如果答案是“它创建了指纹”,那么严格的隐私法律(如欧洲的 GDPR 或伊利诺伊州的 BIPA)就会生效。这些法律规定你必须给予明确许可,否则公司可能面临巨额罚款。如果答案是“它只是猜测”,那么这些严格的规定可能就不适用。

作者尼基塔·马沙尔金(Nikita Marshalkin)认为,年龄估计模型并不处理生物识别数据,因为它们根本无法识别个人。它们就像一位擅长预测降雨却完全无法辨认面孔的气象预报员。

法律困惑:“能”与“会”

论文指出了法律中一个令人困惑的缺口。

  • “目的”论点:一些监管机构表示,“如果公司意图是猜测你的年龄而非识别你,那就没问题。”
  • “能力”论点:其他监管机构则表示,“如果这项技术理论上能够识别你,即使他们不想这么做,这也属于生物识别数据。”

本文聚焦于能力论点。它问道:即使公司不想这么做,计算机内部的数学运算是否实际上允许他们识别你?

实验:“味觉测试”

为了回答这个问题,作者没有凭空猜测,而是进行了一项大规模实验。这就像一场味觉测试

  1. 设置:他们选取了 14 种不同的“年龄猜测器”模型(有些是商业的,有些是开源的)。
  2. 挑战:他们向这些模型提出了一个不同的问题:“看这两张照片,它们是同一个人吗?”
    • 他们在三个不同的“障碍赛道”(基准测试)上进行了测试:
      • 简单赛道:普通照片(LFW)。
      • 时间旅行赛道:同一人相隔 30 年的照片(AgeDB-30)。
      • 角度赛道:一张正面照,一张侧面照(CFP-FP)。
  3. 对比:他们将“年龄猜测器”与“人脸识别器”(一种专门用于识别人脸、类似手机解锁功能的模型)进行了对比。

结果:年龄猜测器惨败

结果清晰而戏剧化。

  • 人脸识别器:它就像一位侦探大师。它在近 100% 的情况下都给出了正确答案。
  • 年龄猜测器:它们就像一个醉汉试图辨认自己的倒影。它们惨败。

类比
想象一个需要密码才能进入的安全检查站。

  • 人脸识别器拥有正确的密码。
  • 年龄估计器试图通过观察天空的颜色来猜测密码。它们的表现比实际识别一个人所需的标准低了两个数量级(即差了 100 倍)。

即使作者尝试通过在顶部添加一个小训练层来“教导”年龄估计器如何识别人脸(就像给它们一张小抄),它们在更难的测试中仍然失败了。它们内部 simply 没有构建身份所需的“原料”(数据)。

“机器中的幽灵”迷思

有些人担心,即使模型不存储面部 ID,它也可能在计算机内部创建一个临时的“幽灵”(中间表示),未来可能被用来识别某人。

论文认为,这就像担心温度计里藏有你家房子的秘密地图。

  • 温度计测量温度。虽然它接触你的皮肤并产生临时读数,
  • 一旦读完温度,它就会丢弃该读数。
  • 即使你查看温度计的内部齿轮,你也无法从中重建出你家的地图。

同样,论文表明,年龄估计器内部的“幽灵”太模糊,无法识别任何人。它不是指纹;它是一个模糊的污迹,只知道“这看起来像个 25 岁的人”,而不是“这是约翰·多伊”。

行动呼吁

论文最后提出了两点请求:

  1. 致研究人员:“停止含糊其辞。”清楚地告诉世界:该系统是否保存了面部 ID?没有。它是否立即丢弃了数据?是的。 要透明地说明该系统能做什么、不能做什么。
  2. 致监管机构:“停止将所有面部摄像头一视同仁。”要区分存储面部 ID 以查找人员(如警方数据库)的系统,与临时处理面部以猜测年龄随后删除数据的系统。后者不应像前者那样受到最严厉规则的惩罚。

结论

论文得出结论:年龄估计模型无法识别人。 它们在这方面表现极差,远远低于构成“生物识别数据”的法律标准。因此,不应强迫它们遵守那些专为真正知道你是谁的系统而设计的最严格的隐私规则。

注:作者澄清,这不是法律建议,而是旨在帮助监管机构做出更好决策的科学证据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →