想象一下,你是一位大师级厨师,只要听到菜名,就能做出你曾品尝过的任何料理。你可以完美地做出“香辣塔可”或“彩虹蛋糕”。但现在,有人要求你用他们家传的特定食谱来做一份塔可,其中包含了一小撮秘密肉桂粉和一种独特的折叠饼皮的方式。你知道如何制作塔可,但你不知道他们的秘密。这正是计算机科学的一个分支——“受限对象图像生成”(subject-to-image generation)所面临的挑战。这些强大的 AI 程序可以根据文本描述创建图像,但当被要求绘制一个它们从未见过的特定人物、宠物或物体时,它们往往能抓到大致轮廓,却会遗漏那些让该主体变得特别的微小、独特的细节。这就像是在画一只看起来像狗的狗,但并不是“你的”那只狗。研究人员希望解决这个问题,以便让 AI 能够捕捉到那些细微的、细粒度的细节——比如脸上特定的伤疤或猫咪身上独特的毛发图案——而无需通过学习成千上万张新照片来耗费数日时间。
由此诞生了 CopyCat,一个聪明的“新招数”,它就像是为这些 AI 艺术家进行了一场“快速微调”课程。CopyCat 并不是强迫 AI 从头开始重新学习一切,而是给它一个仅需约 3 秒钟 的快速、一次性复习课。它的秘诀是什么?AI 被要求观察一张主体的照片,然后尝试再次画出那张与原图完全一致、像素对像素的图像。这听起来像是一个陷阱问题——为什么要让一个艺术家去复制一张他正在看的图片呢?但这种简单的“自我重构”游戏迫使 AI 停止猜测,并开始关注那些它通常会忽略的微小、精细的细节。通过为一个现有的 AI 附加一个微小的、轻量级的插件(称为“细粒度一致性 LoRA”),CopyCat 帮助模型意识到:“噢,我需要把这根胡须的形状保持得完全一样!”其结果是,该模型可以立即将这种对细节的关注应用到任何新的主体或提示词上,无论是穿着巫师袍的狗,还是围着彩虹围巾的猫,而无需为每个新角色进行重新训练。
研究人员还发现了一些关于这些 AI 模型构建方式的惊人发现。许多模型都有两条“思考流”:一条用于阅读文本(如“一只狗”),另一条用于观察图像。团队发现,在教 AI 识别特定主体时,实际上并不需要调整其阅读文本的流。这就像试图教某人识别一辆特定的汽车;你不需要重新训练他们识别“汽车”这个词的能力,你只需要锐化他们的眼睛,去观察特定的凹痕和颜色。通过移除文本流中的训练调整,并将重点放在仅图像流上,AI 实际上能更好地保持主体的一致性,并且由于减少了变动部件,效率也更高。
简而言之,CopyCat 表明我们不需要海量的新数据集或数小时的训练来获得完美的连贯性。通过使用单张图像既作为老师又作为学生,并专注于将学习集中在视觉侧,我们可以让这些 AI 模型在短短几秒钟内更好地捕捉到主体的独特灵魂。实验表明,这种方法能持续提高不同 AI 模型保持身份一致性的能力,使其在创作个性化艺术时更加可靠,尽管研究人员指出,这是对现有工具的一种优化,而非一种全新的图像生成方式。