VTONQA: A Multi-Dimensional Quality Assessment Dataset for Virtual Try-on
本文介绍了 VTONQA,这是首个针对虚拟试穿的多维度质量评估数据集,包含 8,132 张图像和跨三个维度的 24,396 个人类评分,用于基准测试现有的 VTON 模型和图像质量指标,以揭示其局限性并指导未来的改进。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在繁忙的在线购物世界中,一个熟悉的挫折感始终存在:屏幕上的服装与它穿在真人身上的实际效果之间存在差距。为了弥补这一差距,技术开发出了虚拟试穿系统,它们充当了数字试衣间。这些工具获取一张人物照片和一张单独的服装图像,然后尝试将它们合并成一张单一且真实的图片,展示该人物穿着那件衣服的样子。虽然这些系统在电子商务和数字时尚领域已变得普遍,但它们并不完美。通常,结果看起来很奇怪;衣服可能会显得被拉伸或撕裂,体型可能会发生不自然的扭曲,或者面料可能无法正确垂坠。为了让这些工具真正发挥作用,开发者需要一种能够精确衡量结果好坏的方法,超越简单的像素对比,去理解人类视觉究竟如何感知一次成功的试穿。
上海交通大学的一个研究小组通过创建一种名为 VTONQA 的新资源解决了这一需求,这是首个专门用于评判虚拟试穿图像质量的大规模数据集。研究人员并没有依赖单一的总分,而是将评估分解为三个不同的维度:服装与身体的贴合程度、人体形状和姿态保持的一致性,以及最终图像的整体美学质量。为了构建这一资源,他们收集了由 11 种不同虚拟试穿模型生成的 8,132 张图像,这些模型涵盖了从经典的计算机视觉技术到现代人工智能系统的各种类型。这些图像是通过将 184 名不同的人物(代表了年龄、性别、种族和体型的多样化组合,包括儿童、老年人和孕妇)与 80 件不同款式的服装(涵盖从 T 恤、毛衣到连衣裙和裤子的八个类别)进行配对而生成的。
图像生成后,研究人员并未将评判工作交给机器。他们招募了 40 名志愿者担任质量的最终仲裁者。这些志愿者拥有本科及研究生学历背景,并接受过专门培训,能够观察每张图像并针对三个维度分别给出 1 到 5 分的评分。他们评估衬衫看起来是否真的像是被穿着着的,人的手臂和腿是否仍然看起来像人类的肢体,以及最终的照片是否让人感到悦目。这一过程产生了近 24,400 个独立的评分,从而绘制出一幅关于人类如何感知虚拟试穿成功与失败的丰富且详细的图谱。随后,研究人员利用这些人类数据来测试现有的计算机程序在多大程度上能自主预测这些分数。
研究结果揭示了计算机目前所衡量的指标与人类实际所见之间的显著差距。用于判断图像质量的传统方法(通常关注两张图像之间的像素匹配度或噪声程度)无法与人类意见保持一致。这些标准工具无法检测出那些让虚拟着装看起来虚假的细微扭曲,例如袖子不自然地扭转或腰线消失。即使是经过通用图像训练的更先进的人工智能模型,在面对虚拟试穿的特定挑战时也显得力不从心。研究表明,虽然某些现代系统表现得更好,但没有一个是完美的。测试的闭源商业系统通常优于开源研究模型,但即使是最好的开源模型也表现出不一致性,通常在处理上衣类服装(如衬衫)时表现良好,但在处理下身衣物(如裤子和裙子)时则面临显著困难。
这项研究中最具启发性的方面之一是不同类型的服装和不同体型如何影响结果。数据表明,目前的技术处理上半身轮廓和全身连衣裙比处理复杂的下半身形状更为可靠。同样,虽然这些系统在各种体型和种族之间表现尚可,但其性能的差异表明,目前还没有任何单一模型是通用的解决方案。研究人员发现,图像的整体质量往往更多地取决于身体看起来是否自然,而非服装是否完美贴合,这表明保持人体形态是实现逼真效果最关键的因素。通过提供这个详细的、经由人类验证的数据集,研究人员为该领域提供了一个新的衡量标准。这一资源使开发者能够准确看到他们的模型在哪里失效,从而推动这项技术从试错阶段迈向未来——届时数字试衣间将能为购物者提供真正真实可靠的体验。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。