← 最新论文
💻 computer science

Controllable Clothing: Precise Labels and Generation for Virtual Try-On with Latent Diffusion Models

本文提出了一种利用潜在扩散模型(Latent Diffusion Models)和训练好的适配器(adapters)来结合精确服装标签的新型虚拟试穿方法,使零售商能够生成多样化、用户可控且准确的服装图像,从而防止误导消费者。

原作者: Max Rehman Linder

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Max Rehman Linder

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何穿衣服。你给它看一张人的照片和一张酷炫新夹克的照片,然后问它:“你能把这件夹克穿在这个人身上吗?”这就是虚拟试穿(VITON)的世界,这是计算机视觉的一个分支,机器试图解决衣服在不同身体上呈现效果的难题。为了实现这一点,机器人使用了一种特殊的“大脑”,叫做扩散模型(diffusion model)。把扩散模型想象成一位神奇的艺术家,他从一张布满噪点(就像电视雪花一样)的画布开始,一步步、循序渐进地清除噪声,从而显现出一幅画。如果你给这位艺术家一个像“一件红衬衫”这样的文本描述,它可以画出一件。但如果你想让它在那个特定的人身上画出那件特定的衬衫,且袖口恰好在肘部结束,领口位置也恰到好处,这位艺术家往往会感到困惑。它可能会把衬衫画得太长、太短,或者颜色不对。这对在线商店来说是一个大问题,因为如果顾客根据一张与现实不符的假图片购买了衬衫,他们会感到不满。

Max Rehman Linder 的这份报告解决了这种困惑。作者提出了一个问题:“如果我们不仅是给机器人一个模糊的描述,而是给它一把尺子和一套指令呢?”该论文提出了一种名为 ControlableClothing 的新方法。作者的团队并没有仅仅向机器人展示图片,而是用数学精度测量了衣服和人的身体——精确计算肩膀被覆盖了多少、领口有多深以及袖子有多长。他们将这些测量结果转化为一种秘密代码(标签),并将它们与图像一起输入给机器人。其结果是一个不再仅仅靠猜测衣服位置,而是遵循地图进行操作的系统。论文指出,通过使用这些精确的测量值和一个特殊的“适配器”(一个帮助机器人理解代码的工具),生成的图像变得更具可控性。然而,作者也谨慎地指出,虽然机器人现在可以遵循这些规则,但它仍需要更多练习才能让每一个微小的细节都达到完美,而且他们构建的一些新工具仍在接受测试,以观察其效果是否如预期般理想。

“清除噪声”艺术家的魔力

要理解这是如何运作的,让我们来看看机器人的大脑。这篇论文使用了一种被称为**潜在扩散模型(latent diffusion model)**的 AI 类型。想象一桶浑浊的水。如果你不停地搅拌它,它会变得越来越脏,直到变成一团棕色的淤泥。扩散模型学习的是相反的过程:它学习如何处理那团棕色淤泥,并小心翼翼地将污垢与水分离,直到你再次得到清澈的图像。在计算机世界中,“淤泥”是随机噪声,而“清晰的图像”则是穿着衣服的人的照片。

长期以来,这些机器人擅长从头开始创造的图像,但在遵循严格规则方面表现很差。如果你要求一件袖口恰好在肘部结束的衬衫,机器人可能只是在瞎猜。这就像要求一个孩子画一个门宽正好是 3 英寸的房子;他们可能会画一个门,但尺寸很少能达到你的精确要求。以往尝试修复此问题的办法涉及使用 GANs(另一种类型的 AI),但它们通常比较僵硬,无法创造真实的褶皱或光影。随后出现了扩散模型,它们在制作真实感方面表现更好,但在“精确放置”问题上仍然挣扎。

新方案:给机器人一把尺子

作者的核心想法很简单:停止猜测,开始测量。

过去,如果你想试穿一件衬衫,你只需向机器人展示衬衫和人。机器人会尝试将衬衫“变形”以适应人体。但作者意识到,要做到准确,机器人需要知道这件衬衫是如何贴合的。它是紧身的?还是宽松的?袖子是在手腕处还是肘部结束?

因此,团队构建了一个预处理流水线。在机器人看到图片之前,他们使用其他智能工具来进行以下操作:

  1. 裁剪衣服: 他们使用“掩模(mask)”来遮住人身上将被新衬衫覆盖的部分。
  2. 测量一切: 他们利用计算机视觉来测量从人的臀部到衬衫底部的距离、脖子的宽度以及肩膀被覆盖的程度。
  3. 创建“计分卡”: 他们将这些测量值转化为数字和标签。例如,与其仅仅说“长袖”,不如说“袖子结束于手臂长度的 0.8 处”。

“适配器”工具:翻译官

机器人的大脑(扩散模型)已经非常擅长绘画了,但它并不理解“测量值”这种语言。为了解决这个问题,作者构建了一个特殊的工具,称为适配器(adapter)。你可以把这个适配器想象成一个翻译官。

这个翻译官接收“计分卡”(测量值和标签)以及衬衫的图片,并将它们转换为机器人能理解的语言。然后,它在机器人绘画时,将这些指令低声传进机器人的耳中。

  • IP-Adapter: 这部分帮助机器人理解衬衫的“外观”(图案、颜色)。
  • T2I-Adapter: 这部分帮助机器人理解“细节”以及将细节放在哪里。

作者专门为“上采样(up-sampling)”阶段的绘画过程创建了一个新的自定义版本翻译器。在这个阶段,机器人会添加精细的细节,比如织物的纹理或光线照射在褶皱上的样子。通过在这个阶段注入测量数据,机器人可以根据尺子的指令来调整细节。

实验结果表明

作者在成千上万的人体和衣服图像上训练了这个新系统。以下是他们的发现:

  • 它有效,但仍处于开发阶段: 当他们转动“旋钮”(测量标签)时,机器人确实改变了衣服。例如,如果他们告诉机器人让领口变深(通过将数字从 1 改为 -2),机器人就会画出一个更深的领口。如果他们告诉它只覆盖一个肩膀,它也会照做。
  • 数字比文字更好: 作者发现,给机器人一个具体的数值(如浮点数)比给它一个类别(如“长袖”)效果更好。这就像告诉厨师“加 5 克盐”,而不是“加一点盐”。机器人能更精确地遵循数字指令。
  • “掩模”技巧: 团队还教会了机器人忽略被掩模遮挡的部分。他们发现,如果告诉机器人“掩模在这里结束,但你可以在其上方进行绘画”,机器人就会在掩模线之上生成新的织物。这意义重大,因为这意味着你可以拍一张穿着长衫的人的照片,然后告诉机器人把它变成露脐装,机器人就会知道如何绘制缺失的腹部区域。
  • 局限性: 论文承认机器人目前还不完美。当衣服具有非常复杂的图案或细节时,机器人有时会丢失这些细节。作者怀疑这是因为他们构建的新“上采样”工具训练时间还不够长。机器人仍在学习如何使用它的新尺子。

作者明确表示“不行”的情况

作者非常明确地说明了哪些做法无效或不是重点:

  • 仅使用文本提示是不够的: 他们尝试仅通过文字要求机器人“让袖子变长”,但机器人经常忽略这些指令或出错。测量值是必要的。
  • 独热编码(One-hot encoding)并非理想选择: 他们尝试使用简单的“开/关”开关来处理像袖长这样的属性(例如,“是长袖吗?是/否”),但发现连续的数字(如 0 到 1 之间的滑块)能提供更好的控制。
  • 它不是解决所有问题的万灵药: 作者指出,如果机器人在训练集上已经记住了答案,那么添加新的指令可能没有帮助。他们必须从头开始,才能让新系统发挥作用。

结论

这篇论文表明,通过将精确的测量与智能“适配器”工具相结合,我们可以为虚拟试穿系统提供更多的控制权。这并不是一个已解决的问题——机器人仍需更多训练才能让微小细节达到完美,且新工具仍需更多测试——但这个方向是充满前景的。作者证明了,如果你给 AI 一把尺子和一套指令,它就能停止猜测并开始听令行事,从而创造出与真实顾客收到的商品高度一致的图像。这是迈向未来的一步,在那个未来,你可以在线试穿衣服,并且你看到的图片正是包裹寄达时你收到的实物。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →