← 最新论文
💻 computer science

ReART: Reference-Guided Retrieval and Refinement for Emotion-Aware Art Generation

reART 是一个参考引导的检索与精炼框架,它通过将描述词分解为用于定向参考检索的结构化视觉场,并利用基于 AAS 的循环来诊断和修复对齐失败,从而增强了情感感知艺术生成,并在 AffectiveArt 2026 大赛中取得了顶尖性能。

原作者: Qianqian Tang, Jiayi Gao, Ting Lei, Yang Liu

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Qianqian Tang, Jiayi Gao, Ting Lei, Yang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

艺术向来不仅仅是对事物的描绘,更是一种感受的方式。几个世纪以来,画家们利用笔触、色彩选择以及光线落在场景上的方式,来传达庄重、喜悦或忧郁等情感,而往往无需画出一张笑脸或一滴泪水。如今,计算机正在学习根据文字描述来创作这些图像,这一过程在生成写实场景方面已变得惊人地出色。然而,一个新的挑战出现了:如何教会机器理解“庄重”的气氛需要特定的、微妙的视觉决策,例如柔和的色彩或扁平的空间感,而不是仅仅在画面中添加一个悲伤的物体。困难之处在于,人类的语言往往过于笼统,无法描述这些精细的细节。当一个人写下要求“庄重的文艺复兴时期绘画”的提示词时,计算机并不知道应该使用哪种程度的灰色,也不清楚笔触应该有多厚,才能契合那种情感。这就像是要求某人去画一种情绪,却没有给他们一个具体的调色板或对纹理清晰的构想。

为了解决这个问题,北京大学和武汉大学的研究人员开发了一个名为 ReART 的系统,它充当了模糊的情感词汇与具体视觉证据之间的桥梁。该系统不再仅仅试图仅从文本中猜测出应有的外观,而是将描述分解为具体的视觉部分,例如主体、场景布局、油画纹理以及整体氛围。随后,它会在一个庞大的现有艺术品库中进行搜索,寻找与这些特定部分相匹配的真实范例。如果提示词要求某种类型的笔触,系统就会找到一幅具有该精确纹理的绘画,并将其作为引导。这使得计算机能够通过观察大师之手下的“庄重”或“戏剧性”究竟呈现出何种样貌,而不是仅仅基于文字进行猜测。

这个过程主要分为两个步骤。首先,系统利用文本描述和从库中收集到的视觉线索生成一张初始图像。接着,它扮演自己的评论家,根据原始请求对结果进行检查。如果图像的主体正确但色彩显得过于明亮,或者构图正确但纹理看起来过于平滑且具有数字感,系统就会精准地识别出出错之处。它并不会简单地丢弃图像并重新尝试,而是制定一个具体的计划,仅修复出错的部分,同时保护已经正确的部位。它会选择符合特定错误的新视觉范例,并仔细编辑图像以纠正缺陷,确保画面的其余部分不受影响。这种检查与修正的循环持续进行,直到图像与提示词中的情感和视觉目标完美契合。

这种方法的效果在一次情感艺术生成的大型竞赛中得到了测试,评判标准包括其捕捉内容、艺术风格以及细粒度情感属性的能力。研究人员发现,他们的方法生成的图像比以往的尝试更接近真实的真人艺术。在比赛中,该系统在情感对齐测试中获得了满分,这意味着它在所有给定的案例中都成功匹配了预期的情感。它还在整个挑战赛中排名第二,证明了将复杂的艺术请求分解为更小、更易处理的视觉片段,并利用真实范例来引导创作,是教会机器理解艺术微妙语言的一种强大方式。这项工作表明,当计算机获得正确的视觉参考并拥有检查自身工作的能力时,它们就能学会创作出能引起人类情感共鸣的艺术——不仅是通过遵循规则,更是通过理解情感的视觉纹理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →