Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
Oxygen-TryOn 是一个统一的、时尚原生基础模型,通过利用专门的数据引擎和涉及强化学习的三阶段训练流水线,实现了针对多样化单品及场景的最先进照片级逼真虚拟试穿效果,其性能超越了领先的专有及开源系统。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你可以瞬间试穿你在杂志上看到的任何服装、朋友的照片或街头随拍,而无需踏入试衣间一步。这就是“虚拟试穿”的梦想——它是人工智能的一个分支,致力于通过数字方式为人们换上新衣。长期以来,这些“数字裁缝”就像笨拙的学徒:它们一次只能处理一种类型的衬衫,经常忘记人原本的样子,并且在人移动时难以让织物看起来真实。它们将这项任务视为一种简单的“填色游戏”,只是在空白区域填充新的纹理。但如果 AI 真的能“理解”时尚呢?如果它知道帽子应该戴在头上,包包应该挂在肩上,而夹克需要披在毛衣外面,而不是仅仅叠放在上面呢?这正是研究人员正在解决的问题:如何构建一个不仅是把图像拼凑在一起,而是真正“理解”衣服、配饰与人如何在现实世界中相互作用的 AI。
于是,Oxygen-TryOn 应运而生。这是一个由京东(JD)旗下的 Oxygen AIGC 集团和 Joy Future Academy 开发的新型“时尚原生”基础模型。不要把这个模型仅仅看作一个需要通过模糊指令来诱导其完成时尚工作的通用图像编辑器,而要把它看作一位在时尚世界中出生并成长的专业裁缝。虽然其他 AI 系统试图通过给出模糊指令,强迫通用的图像编辑器去做虚拟试穿工作(这往往会导致“幻觉”,比如凭空创造出虚假的纽扣或丢失人的面部特征),但 Oxygen-TryOn 是从底层开始就专门为为人试穿而构建的。它不将试穿视为一个简单的“填空”谜题,而是一个复杂的推理任务,AI 必须弄清楚每一件单品是什么、它属于哪里以及穿着时应该呈现怎样的形态。
研究人员发现,通过向该模型喂入海量且经过精心策划的时尚数据库,并通过三步走的“训练配方”进行教学,他们可以实现比以往方法更真实、更连贯的效果。该模型可以根据一张人物照片为其换上一件单品,也可以应对极其复杂的参考组合——例如,从一张图片中提取衬衫,从另一张图中提取鞋子,从第三张图中提取包包,再从第四张图中提取帽子,并将它们组合成一套完整且连贯的穿搭。它既能处理干净的产品图,也能处理人们穿着这些单品的“实拍”抓拍图。至关重要的是,它能高度还原人物的身份特征(脸部、体型和姿态)以及服装的精细细节(纹理、Logo 和图案)。
在实验中,Oxygen-TryOn 不仅仅是表现良好,它更是超越了竞争对手。在标准测试中,它取得了领先水平(state-of-the-art)的分数,击败了包括强大的开源模型以及像 Nano Banana Pro、GPT-Image-2 和 Seedream5 Lite 这样的顶级商业系统。它在“多件单品”场景中表现尤为出色,能够成功地进行多层叠穿,而不会产生混乱或丢失细节。团队还展示了该模型的灵活性,它可以遵循额外的指令,例如在同一次生成过程中改变人物的姿势或背景。
其成功的秘诀不仅在于模型架构,更在于团队为其构建的“数据引擎”。他们并没有只是简单地抓取互联网内容,而是构建了一个流水线,用于大规模收集、过滤、标注并制造高质量的试穿数据。随后,他们通过三个阶段对模型进行训练:首先是学习时尚基础知识的“持续预训练”;第二是掌握特定试穿任务的“监督微调”;最后是“强化学习”阶段。最后一步就像是有一位严格的时尚评论家(一种混合奖励系统)在给模型的作品打分,教它去修正诸如褶皱尴尬或身份偏移等细微错误。结果显示,该系统可以处理各种场景,从全身穿搭到半身配饰,甚至可以在非人类主体(如动漫角色或雕塑)上运行,这证明它已经学会了穿着物品的一般规律,而非仅仅是死记硬背特定的照片。
简而言之,Oxygen-TryOn 代表了一种从“猜测”衣服应有的样子到“推理”衣服如何贴合的转变。它表明,通过构建专门针对特定领域的模型,并使用高质量、结构化的数据进行训练,我们可以创造出不仅更准确、而且对现实应用(如在线购物)更有用的 AI。虽然该模型目前仍存在局限性——例如由于底层架构的原因,目前无法同时处理超过四个参考单品——但该论文证明了通往真正通用虚拟试穿的道路已经开启,数字时尚的未来或许就在一次智能生成之间。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。