← 最新论文
💻 computer science

SketchFlow: Zero-Shot Vector Sketch Generation via GMM Prior Flow in CLIP Latent Space

SketchFlow 是一个新颖的零样本矢量草图生成框架,它利用基于最优传输的条件流匹配技术在 CLIP 潜空间内进行建模,并结合高斯混合模型先验与混合扩散解码器,从而在无需文本-草图配对数据的情况下,生成高质量且具有类人特征的笔画轨迹。

原作者: Jin Zhou, Hongliang Yang, Pengfei Xu, Hui Huang

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Jin Zhou, Hongliang Yang, Pengfei Xu, Hui Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类一直以来都擅长用寥寥几笔捕捉世界。一张餐巾纸上的素描,就能比照片更快地传达出一座建筑的轮廓、一位朋友的姿态,或是风暴的气息。这些画作不仅仅是图像;它们是运动的记录,是手在实时创作过程中所做出的决策序列。几十年来,计算机科学家一直试图教会机器做到这一点——即从简单的文本描述中生成这些流畅且具有人类感的笔触。其目标是创造一种数字艺术家,能够根据“一只快乐的猫”这样的短语,创作出一幅看起来像是人刚刚随手勾勒出的画作,甚至保留了人类手部自然的颤动与简化。

挑战在于,计算机擅长模仿已见过的事物,却极不擅长想象从未见过的东西。大多数现有工具都依赖于庞大的示例库。如果计算机从未见过某个特定角色或独特物体的绘画,它往往要么无法画出,要么画出的东西看起来僵硬且机械。此外,用于训练这些系统的训练数据极其匮乏。虽然互联网上有数以百万计的图文配对照片,但将手绘素描与详细描述相结合的例子却非常少。这种数据的缺失导致了计算机能力与人类想象力之间的鸿沟。

深圳大学的研究团队开发了一种新方法来弥补这一差距,使计算机能够为那些从未被明确教授过的概念生成高质量的素描。他们称之为 SketchFlow 的方法并不依赖于记忆固定的物体列表。相反,它使用了一种巧妙的策略,以一种模拟人类直觉的方式来理解词汇与形状之间的关系。通过在大量仅带有宽泛类别标签的绘画集上进行训练,该系统学习了人类绘画的通用“语法”。随后,它利用这些知识来构建全新想法的绘画,例如特定的流行文化角色或抽象情感,而此前从未见过这些特定事物的任何示例。

这项成就的核心在于研究人员如何教会计算机在语言与图像的空间中进行导航。他们利用了一个强大的预存工具,该工具能够理解词汇与图片之间的联系,该系统已经学习了数百万个概念之间的关联。然而,仅仅要求这个系统画出一个新物体往往会导致一团乱麻,因为计算机不知道如何将一个词转化为一系列的手部动作。为了解决这个问题,研究人员搭建了一座桥梁。他们将计算机所知的孤立且离散的标签(如“猫”或“太阳”)平滑化为一个连续的景观。想象一张地图,每个已知物体都是一座城市;研究人员在这些城市之间的空白区域填补了平缓且连续的地形。这使得计算机可以在一个已知概念与另一个已知概念之间平滑移动,或者在受到地形形状而非僵化规则的引导下,涉足未知领域。

一旦计算机能够在这片景观中航行,它就学会了遵循特定路径来创作绘画。该系统并非一次性猜测最终图像,而是学习像人类的手在纸面上移动一样,逐笔生成绘画。它从空白画布开始,逐渐添加线条,并在过程中不断完善形状。研究人员设计了一个专门的解码器,充当“手”的角色,将计算机对概念的内部理解转化为一系列坐标。这个解码器经过训练,能够产生自然的笔触,具备适当的变化与流动感,从而避免了那些容易暴露机器身份的僵硬、完美的线条。

研究结果令人瞩目。在针对 345 个常见绘画类别的标准测试中,该系统生成的素描在视觉上优于以往的方法,在真实感和人类偏好度方面得分更高。但真正的考验在于,当研究人员要求它绘制它从未见过的东西时。他们向系统输入了如“カー比 (Kirby)”、“皮卡丘 (Pikachu)”、“丧尸 (a zombie)”以及“跳舞的人 (a dancing human)”等名称。这些都不在原始训练列表中。然而,系统生成了连贯且可辨识的素描,捕捉到了这些角色的神韵。它画出的“奔跑的猫”看起来与“睡觉的猫”截然不同,而“忧伤的面孔”则通过线条的弧度传达了情感。该系统不仅是在复制模板,它理解了词汇的语义,并将人类绘画的规则应用于创造新事物。

研究人员还展示了该系统可以处理复杂的指令,例如结合概念或添加动作。当被要求画“太阳和云朵”时,它在单幅统一的素型中同时画出了这两个元素。当被要求画“伸懒腰的猫”时,它改变了动物的姿态以匹配动作。这种灵活性表明,该系统已经学习到了深层的结构化理解,而非仅仅是记忆模式。它可以在不同的想法之间进行插值,实现从一个概念到另一个概念的平滑过渡,这表明它已经建立了一个关于视觉世界的连续心理模型。

虽然该系统并不完美,有时也会产生不完整或略有偏差的绘画,但它代表了向前迈出的重要一步。研究人员发现,当允许系统进行一定的随机探索时,其表现效果最好,就像人类艺术家在定稿前可能会进行几次试探性的笔触一样。他们还展示了该方法可以应用于图像,即将一张照片转化为素描,而无需针对该图像进行专门训练。这种多功能性为数字艺术、设计和交互媒体开辟了新的可能性。

这项工作证实了即使在从未见过特定主题的情况下,也可以教会机器带有人类触感的绘画。通过在词汇与形状之间建立一座连续的桥梁,研究人员让计算机能够将其技能泛化到训练数据之外。这种方法使该领域从僵化的、渴求数据的模型转向了能够适应与创造的系统。它预示着一个数字工具可以与人类创造力协作的未来,将简单的想法转化为具有表现力的手绘艺术,其速度与一致性是此前无法想象的。机器不再仅仅是一个复制者;它正开始理解线条的逻辑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →