艺术向来不仅仅是对事物的描绘,更是一种感受的方式。几个世纪以来,画家们利用笔触、色彩选择以及光线落在场景上的方式,来传达庄重、喜悦或忧郁等情感,而往往无需画出一张笑脸或一滴泪水。如今,计算机正在学习根据文字描述来创作这些图像,这一过程在生成写实场景方面已变得惊人地出色。然而,一个新的挑战出现了:如何教会机器理解“庄重”的气氛需要特定的、微妙的视觉决策,例如柔和的色彩或扁平的空间感,而不是仅仅在画面中添加一个悲伤的物体。困难之处在于,人类的语言往往过于笼统,无法描述这些精细的细节。当一个人写下要求“庄重的文艺复兴时期绘画”的提示词时,计算机并不知道应该使用哪种程度的灰色,也不清楚笔触应该有多厚,才能契合那种情感。这就像是要求某人去画一种情绪,却没有给他们一个具体的调色板或对纹理清晰的构想。
为了解决这个问题,北京大学和武汉大学的研究人员开发了一个名为 ReART 的系统,它充当了模糊的情感词汇与具体视觉证据之间的桥梁。该系统不再仅仅试图仅从文本中猜测出应有的外观,而是将描述分解为具体的视觉部分,例如主体、场景布局、油画纹理以及整体氛围。随后,它会在一个庞大的现有艺术品库中进行搜索,寻找与这些特定部分相匹配的真实范例。如果提示词要求某种类型的笔触,系统就会找到一幅具有该精确纹理的绘画,并将其作为引导。这使得计算机能够通过观察大师之手下的“庄重”或“戏剧性”究竟呈现出何种样貌,而不是仅仅基于文字进行猜测。
这个过程主要分为两个步骤。首先,系统利用文本描述和从库中收集到的视觉线索生成一张初始图像。接着,它扮演自己的评论家,根据原始请求对结果进行检查。如果图像的主体正确但色彩显得过于明亮,或者构图正确但纹理看起来过于平滑且具有数字感,系统就会精准地识别出出错之处。它并不会简单地丢弃图像并重新尝试,而是制定一个具体的计划,仅修复出错的部分,同时保护已经正确的部位。它会选择符合特定错误的新视觉范例,并仔细编辑图像以纠正缺陷,确保画面的其余部分不受影响。这种检查与修正的循环持续进行,直到图像与提示词中的情感和视觉目标完美契合。
这种方法的效果在一次情感艺术生成的大型竞赛中得到了测试,评判标准包括其捕捉内容、艺术风格以及细粒度情感属性的能力。研究人员发现,他们的方法生成的图像比以往的尝试更接近真实的真人艺术。在比赛中,该系统在情感对齐测试中获得了满分,这意味着它在所有给定的案例中都成功匹配了预期的情感。它还在整个挑战赛中排名第二,证明了将复杂的艺术请求分解为更小、更易处理的视觉片段,并利用真实范例来引导创作,是教会机器理解艺术微妙语言的一种强大方式。这项工作表明,当计算机获得正确的视觉参考并拥有检查自身工作的能力时,它们就能学会创作出能引起人类情感共鸣的艺术——不仅是通过遵循规则,更是通过理解情感的视觉纹理。
技术摘要:ReART
问题陈述
情感感知艺术图像生成要求模型必须同时满足三个不同的维度:语义内容、艺术风格和目标情感。主要的挑战在于艺术性描述的本质,这些描述往往将这些维度混淆在一起,形成表达不明确的自由文本。这使得模型难以将细粒度的视觉属性(如特定的笔触、构图、色调氛围和材质表面)具体化地落地。
具体存在两个难点:
- 执行层面的歧义性: 描述指定了情感目标(例如“庄重”),但未能定义实现该目标所需的视觉机制(例如受限的饱和度、扁平化的空间退缩)。生成模型往往只能近似实现一种模糊的情感印象,却无法达到艺术风格所要求的真实且细粒度的执行效果。
- 特定维度的失效: 即使使用结构化提示词,要在单次生成中同时实现内容、风格和属性的对齐也十分困难。失效通常是针对特定维度的(例如:内容正确,但渲染成了写实风格而非绘画纹理)。盲目的重采样缺乏诊断信息,而不受约束的全局编辑则存在破坏已正确实现区域的风险。
方法论:ReART 框架
作者提出了 ReART(参考引导检索与精炼),这是一个两阶段框架,旨在通过结构化的视觉证据将抽象的情感描述落地,并通过有针对性的精炼来纠正特定维度的失效。
第一阶段:检索引导的艺术生成
此阶段通过将提示词和参考资料分解为结构化的视觉场,解决文本表达不明确的问题。
- 结构化视觉记录构建: 利用 GPT-5.4,将测试描述和 EmoArt 数据库中的标注分解为统一的结构化记录,包含十一个可独立处理的视觉场:主体、空间关系、场景/环境、构图/布局、材质/表面、笔触/纹理、线条质量、色彩/色调、光影/阴影以及情绪/氛围。
- 风格特定领域的逐场检索: 为确保风格一致性,系统构建了风格特定的参考池(例如,通过增加中国画图像集来增强“水墨画”类别)。系统并非进行单一的整体查询,而是使用 BAAI/bge-m3 对每个视觉场进行独立编码并计算余弦相似度。通过加权融合评分对候选对象进行排序,优先考虑语义关键字段(如主体和构图)。
- 参考增强生成: 将检索到的前 10 张艺术品及其结构化字段描述提供给生成模型(gpt-image-2),并配合结构化提示词,指导模型针对每个参考资料最擅长的特定视觉维度进行选择性使用(例如,使用一个参考资料处理构图,使用另一个参考资料处理笔触纹理),而非将其作为整体风格模板。
第二阶段:智能约束精炼循环
此阶段利用基于属性对齐得分(AAS)的循环,解决残留的特定维度失效问题。
- AAS 评分与选择: 生成的图像根据内容、风格和属性对齐三个维度进行评估。若任何子项得分低于阈值(9/10),则进入精炼循环。
- 诊断: 多模态诊断模块识别主要的失效类型(例如纹理错误、色调错误),并确定哪些约束已得到满足且必须予以保留。
- 规划器: 构建一个包含四个组件的结构化修复计划:
- 保留 (Keep): 需保留的元素(主体身份、空间关系、构图骨架)。
- 修复 (Fix): 需纠正的具体字段级错误。
- 避免 (Avoid): 可能损坏正确内容的禁止操作。
- 优先级 (Priority): 从结构到美学的修复顺序。
- 参考路由与约束编辑: 根据失效的维度重新路由参考资料;仅选择与失效维度相关的顶级候选对象。编辑器在保持结构完整性的约束下进行针对性编辑,仅修改失败的视觉维度,同时锁定图像的其他部分。该循环重复进行,直到所有得分达到阈值或达到迭代上限。
核心贡献
本文提出了三个主要贡献:
- 结构化视觉场分解: 一种将纠缠在一起的艺术描述分解为可独立处理的视觉场的方法,实现了通过逐场检索将抽象的情感描述落地到直接的视觉证据中。
- AAS 驱动的智能精炼循环: 一种用于诊断特定维度失效并构建“保留/修复/避免/优先级”结构化计划的机制。这实现了针对性的纠错,无需干扰已正确实现的维度,并利用了目的性路由的参考选择。
- 实证验证: 通过其在 AffectiveArt 2026 大赛中的表现证明了框架的有效性,在所有子维度上均实现了 1.00 的完美 AAS 得分。
结果
系统在 Local200 基准测试和 AffectiveArt 2026 大赛 Track 1 上进行了评估。
- Local200 表现: ReART 实现了 147.43 的 FID 和 9.77(满分 10 分)的 AAS,超越了包括 FLUX.1-dev + IP-Adapter、Qwen-Image 和 HiDream-O1-Image 在内的基线模型。值得注意的是,相比仅使用描述词生成和基线模型,它显著提升了风格和属性的对齐得分。
- AffectiveArt 2026 大赛: 以“EmoForge”身份参赛,ReART 以 0.78 的得分获得总排名第 2。它在内容、风格和属性子维度上均取得了 1.00 的完美 AAS,是所有参赛系统中 AAS 得分最高的。第一名团队凭借更高的整体得分(0.80)夺冠,这主要是由于其更低的 FID(66.12 对比 77.47),而 ReART 的 AAS(1.00)则超过了对方(0.99)。
- 消融实验: 实验证实,仅靠结构化字段分解即可提升对齐度,但加入逐场检索带来了最大的单项增益。完整的精炼循环(第二阶段)进一步降低了 FID 并提高了 AAS,其中“风格”维度在精炼后提升最为显著。
意义
论文声称 ReART 有效弥合了艺术生成中抽象情感描述与具体视觉执行之间的鸿沟。通过从整体风格模板转向基于字段对齐的视觉证据,该方法允许生成模型针对特定维度(如笔触对比布局)有选择性地借鉴参考资料。此外,AAS 驱动的约束精炼循环提供了一种自动诊断并纠正隐性、特定维度失效的机制,无需人工干预,也避免了破坏正确元素的风险。实验结果验证了结构化检索和针对性精炼是实现细粒度情感感知艺术图像生成的有效策略,尤其是在最大化对人类定义的审美和情感标准对齐方面。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。