想象一下,你是一位电影导演,正试图评判一批新的数字演员。这些人并非真人,而是由人工智能生成的计算机“说话头像”。其中一些 AI 演员由真人移动的视频驱动,而另一些则由某人说话的声音录音驱动。
长期以来,电影界(研究人员)一直在试图弄清楚如何给这些数字表演打分。但他们使用的工具是错误的。这就像试图通过只测量鼓的音量来评判一场交响乐,而忽略了旋律、节奏以及乐手演奏时的神态。
以下是THEval的故事,这是一个旨在最终为这些数字演员提供公正评价的新框架。
问题:断裂的标尺
论文指出,当前评估 AI 说话头像的方法已经失效。
- 旧标尺:研究人员一直使用诸如FID和FVD(将其视为“模糊检测器”)或Syncnet(一种“唇形同步检查器”)等指标。
- 缺陷:论文发现,这些旧标尺经常给那些在人类眼中看起来糟糕透顶的视频打出高分。例如,根据计算机的判断,一段视频的唇形同步可能完美无缺,但人脸看起来却像融化的蜡像。相反,一段在人类看来惊艳的视频,可能会因为一个微小到难以察觉的时序故障而被计算机评为不及格。
- 结果:计算机的评分与人类的观点完全脱节。事实上,论文表明,旧的“唇形同步”指标(Syncnet)与人类的喜好实际上呈负相关。计算机越说视频好,人类反而越不喜欢!
解决方案:THEval(新评分系统)
作者创建了THEval,这是一个新的评估框架。他们不再使用一把断裂的标尺,而是建立了一个涵盖表演三个主要方面的8 点检查清单:质量、自然度和同步性。
这就像才艺表演评委的评分表:
1. 质量(画面清晰吗?)
- 整体美学:整个视频看起来好吗?光线是否优美?色彩和谐是否令人愉悦?
- 面部与嘴部质量:面部是清晰锐利,还是模糊不清?嘴部区域是否清晰,还是看起来像一团污渍?
- 类比:这相当于检查相机镜头是否干净,灯光是否专业。
2. 自然度(感觉有生命力吗?)
- 嘴唇动态:嘴唇的移动是否具有自然的多样性,还是像鱼一样只是机械地开合?
- 头部运动动态:人物点头、倾斜或转头是否自然,还是像僵硬的模特?
- 眉毛动态:眉毛是否会随情绪起伏而升降,还是凝固在永恒的凝视中?
- 静默嘴唇稳定性:当人物停止说话时,嘴唇是否保持静止,还是会不自然地抖动或抽搐?
- 类比:这检查演员是在“表演”,还是仅仅在动嘴。真正的人类会眨眼、坐立不安并移动头部;而糟糕的 AI 看起来则像机器人。
3. 同步性(嘴唇与声音匹配吗?)
- 唇形同步:当说话者大喊时,嘴巴是否张得很大?当说话者低语时,嘴巴是否保持闭合?这不仅仅是关于时机,更是关于匹配声音的强度。
- 类比:这相当于检查配音是否与演员的表演相匹配。
大考:85,000 段视频
为了证明新系统有效,作者并非凭空猜测。他们:
- 构建了新数据集:他们收集了超过 5,000 段真实视频,包含人们用不同语言(英语、西班牙语、中文等)说话的内容,以确保 AI 模型此前未曾见过这些特定的人。
- 生成了 85,000 段视频:他们在这个数据集上运行了 17 种不同的最先进 AI 模型(即“参赛者”)。
- 举行了人类投票:他们邀请真实人类观看成对的视频,并选出哪一段看起来更逼真。
- 结果:当他们把人类投票与THEval评分进行比较时,发现两者有**87%**的吻合度。这非常巨大!这意味着 THEval 是人类观点非常可靠的“代理”。
他们学到了什么?
论文利用这个新系统对 17 个 AI 模型进行了排名,并发现了一些有趣的现象:
- 视频驱动模型(AI 复制真人视频)通常在看起来更自然和头部运动方面做得更好,但有时在面部本身的质量上会遇到困难。
- 音频驱动模型(AI 聆听声音并生成面部)在唇形同步方面有所进步,但它们经常在表现力上遇到困难。有些模型生成的表情过于夸张(像卡通人物),或者存在“时间漂移”(即面部随时间推移逐渐看起来像另一个人,或逐渐变成橙色)。
- "Wav2Lip"的意外:一个非常流行的模型 Wav2Lip 在旧的 Syncnet 指标上获得了最高分,但在人类研究中排名靠后。这证明了旧指标具有误导性。
结论
论文总结道,我们不能再依赖旧的、简单的计算机指标来评判 AI 说话头像。它们就像一支坏掉的温度计,明明天气炎热,却显示正在结冰。
THEval是新的、可靠温度计。它将评估分解为具体的、类人的类别(质量、自然度、同步性),并将它们合并为一个人类可以信赖的单一分数。作者已将此系统、数据集和排行榜公开,以便其他研究人员利用它构建更好、更逼真的数字演员。
技术摘要:THEval – 说话头视频生成评估框架
1. 问题陈述
尽管生成模型在生成高分辨率、逼真的说话头(TH)视频方面取得了显著进展,但适当的评估指标的发展却滞后于这一进程。当前的评估方法严重依赖有限的一组通用视频质量指标(例如 FID、FVD、PSNR)和唇同步分数(例如 SyncNet 的 LSE-C 和 LSE-D)。本文认为,这些现有指标存在显著局限性:
- 与人类感知的关联性差:FID 和 FVD 等指标往往无法捕捉运动质量和时间连贯性,而基于 SyncNet 的指标(LSE-C/D)已被证明与人类偏好相关性较差,且在嘴唇裁剪、光照和音频编码等因素方面表现不稳定。
- 过度简化:现有方法通常将复杂的 TH 生成任务简化为单一参数,无法区分特定的失败模式,例如缺乏表现力、面部细节中的伪影,或不自然的头部动态。
- 与真实值比较中的偏差:直接将生成视频与真实值(Ground Truth)进行比较的指标(例如 LMD-F)会惩罚那些并非严格由音频输入决定的头部运动和表情的自然变化,从而导致评估结果产生误导。
2. 方法论
为了弥补这些差距,作者提出了THEval,这是一个旨在与人类偏好紧密对齐的综合评估框架。该方法论包含三个核心组成部分:
A. THEval 数据集
为了测试模型在未见数据上的泛化能力,精心策划了一个新的、具有挑战性的基准数据集。
- 规模:超过 5,000 个视频片段(由 17 个模型处理后生成 85,000 个视频)。
- 多样性:源自六个语言(英语、法语、中文、西班牙语、日语、意大利语)的 31 个公共 YouTube 频道。
- 特征:高保真 1080p 分辨率、单人、正面视角,平均时长为 13 秒。该数据集明确避免了与所评估模型的训练数据重叠。
B. 8 项指标框架
THEval 引入了八项细粒度指标,分为三个维度:质量、自然度和同步性。
1. 质量(感知吸引力)
- 全局美学:使用 TOPIQ 图像美学评估(IAA)组件评估整个画面的构图、光照和色彩和谐度。
- 面部质量:通过 TOPIQ 对整个面部区域应用图像质量评估(IQA)。
- 嘴唇质量:通过 MUSIQ 专门对嘴唇区域应用 IQA,以量化合成逼真唇部运动的难度。
2. 自然度(行为逼真度)
- 唇部动态:通过计算 40 个唇部关键点在帧间成对欧几里得距离的标准差,量化唇部运动的变异性。
- 头部运动动态:测量头部姿态(俯仰、偏航、翻滚)和位移随时间的方差,以评估头部运动是否过于细微或夸张。
- 眉毛动态:通过计算眉毛与眼睛之间归一化垂直距离的标准差,捕捉眉毛运动的变异性。
3. 同步性(音视频对齐)
- 静默唇部稳定性:使用语音活动检测(VAD)识别静默片段,并测量嘴部开合的中位数绝对偏差(MAD),以确保在无语音存在时嘴唇保持稳定。
- 唇同步:评估嘴部开合度与音频音量强度之间的对齐情况。它首先归一化嘴部开合度和均方根(RMS)音频能量,然后计算这些信号在语音片段期间的平均绝对差。
C. 最终分数计算
这八项指标相对于真实值(GT)参考分数进行归一化,公式为 s=1−GTScore∣ModelScore−GTScore∣。最终分数计算为这些归一化指标的未加权平均值。这种方法优先考虑透明度和鲁棒性,而非针对特定人类评估样本的过拟合。
3. 主要贡献
- THEval 框架:一个包含三个维度下 8 项指标的新评估框架,与人类评分的斯皮尔曼相关系数达到 ρ=0.870,显著优于现有指标。
- 新基准数据集:发布了一个包含超过 5,000 个视频的多样化多语言数据集,旨在测试在真正未见数据上的泛化能力。
- 综合基准测试:对 17 个最先进的(SOTA)音频驱动和视频驱动模型进行了广泛评估,详细分析了它们各自的优缺点。
- 局限性验证:一项用户研究表明,当前的标准指标(FID、FVD、LSE-C、LSE-D)与人类偏好显示出较差或负相关,而 THEval 则可作为昂贵用户研究的可信替代方案。
4. 实验结果
作者在 THEval 数据集上评估了 17 个模型(9 个音频驱动,8 个视频驱动)。
- 与人类的关联性:THEval 最终分数与人类偏好显示出强相关性(ρ=0.870)。相比之下,现有指标显示出弱相关或负相关(例如 LSE-C:-0.164,LSE-D:-0.269,FVD:0.289)。
- 模型性能概况:
- 视频驱动模型:通常实现了更平衡、高质量的成果,具有强大的表现力和同步性(例如 Liveportrait、X-Portrait)。然而,部分模型在大幅度头部运动时表现出伪影。
- 音频驱动模型:显示出更大的方差。虽然较新的模型(例如 Hallo2、EchoMimic)在同步性和质量方面有所改进,但许多模型在自然头部运动和表现力方面存在困难。某些模型(例如 OmniAvatar)表现出时间漂移和夸张的嘴部运动,导致其自然度和稳定性指标得分较低。
- 具体发现:
- 音频驱动方法通常缺乏自然的头部运动,并可能产生夸张的表情。
- 视频驱动方法通常提供更好的表现力,但在复杂运动期间的无伪影渲染方面面临挑战。
- 该框架成功指出,尽管许多算法在唇同步方面表现出色(高 LSE-C/D),但它们在生成表现力和无伪影细节方面往往失败。
5. 意义与主张
本文认为,现有的说话头视频评估指标具有高度局限性,且往往与人类感知不一致。THEval 的意义在于其能够:
- 提供可靠代理:提供一种高相关性的替代方案,以替代繁琐且昂贵的用户研究。
- 实现细粒度诊断:通过将性能分解为质量、自然度和同步性,THEval 允许研究人员识别特定的失败模式(例如眉毛动态差与唇同步差),而不是依赖单一的综合分数。
- 推动进步:作为一个必要的基准,指导未来生成方法的发展,特别强调在生成逼真、富有表现力且无伪影的说话头方面仍存在的挑战。
作者总结道,尽管 SOTA 模型已取得进展,但在平衡同步性、表现力和视觉保真度方面仍存在重大挑战,而 THEval 提供了衡量和推动这些领域改进所需的工具。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。