← 最新论文
💻 computer science

ProFocus: Interpreting Affective Experience in Artistic Images with Progressive Visual Focusing

ProFocus 是一个新颖的框架,它通过利用层次化艺术评论家生成结构化语言先验,并利用渐进式提示融合模块将这些线索顺序注入视觉特征,从而模拟人类的认知感知,以实现比现有方法更优越的情感识别与解释,进而增强对艺术图像中情感反应的解读。

原作者: Zhiyan Zhang, Zicheng Yan, Jianqi Chen, Peipei Song, Shanshan Wang, Xun Yang

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiyan Zhang, Zicheng Yan, Jianqi Chen, Peipei Song, Shanshan Wang, Xun Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图教会一台计算机去理解一幅画作,不仅是通过计算蓝色像素的数量或识别出一棵树,而是去感受艺术家所传达的“情绪”。这就是情感计算(affective computing)的世界——这是人工智能的一个分支,致力于帮助机器识别和解读人类的情感。虽然计算机在识别照片中的笑脸或视频中的皱眉脸方面已经做得相当出色,但面对视觉艺术时却常常失灵。为什么?因为艺术是复杂的。它不仅仅展示了“有什么”;它利用抽象的色彩、奇特的形状和隐藏的隐喻来引发你产生恐惧、敬畏或悲伤等感受。为了弥补这一差距,研究人员正在构建一些系统,这些系统不仅能“看到”图像,还能尝试像人类一样去“思考”它们,从整体氛围过渡到具体细节,从而理解其中的情感故事。

于是有了 ProFocus,这是由一组研究人员开发的一种新方法,它就像是计算机的“超级智能艺术评论家”。其核心理念在于,当人类观察一幅画时,我们并不会同时盯着它看。我们有一种自然的、循序渐进的处理方式:首先,我们对整体氛围产生一种直觉(是阴郁暴戾?还是明亮愉悦?);接着,我们观察主要人物或物体以及它们之间的互动关系;最后,我们会放大到微小的、具体的细节上,而这些细节可能正是解开情感之谜的关键。论文指出,大多数现有的 AI 模型试图一口气吞下整张图像,使用那些擅长识别日常物体(如“一只狗”或“一辆车”)但极不擅长拆解艺术中复杂、抽象情感的通用工具。

ProFocus 通过模仿这种人类的“缩放”过程解决了这个问题。它使用一个特殊的“艺术评论家”(大语言模型)将绘画分解为三个层级的描述:氛围风格(情绪)、叙事主体(故事)和具体细节(特定的线索)。然后,它通过一个“渐进式提示融合”(Progressive Hint Fusion)模块,将这些线索从宏观到微观逐一输入计算机的视觉系统。这就像是在解开一个谜团:你不是一次性把所有线索都扔在桌上,而是先布置场景,然后引入嫌疑人,最后指向那件关键证据。通过这种方式,模型学会了如何聚焦于画作的正确部分,从而推断出情感。

结果表明,这种方法行之有效。在对名为 ArtEmis v1.0 和 v2.0 的两个大规模艺术数据集进行测试时,ProFocus 的表现持续优于现有的最佳方法。在 v1.0 数据集上,它正确预测情感的准确率达到了 66.1%,以显著优势超越了之前的领先者。但它不仅能猜对标签,还能更好地解释“为什么”。在人类对解释进行评分的测试中,ProFocus 在“视觉相关性”和“细节丰富度”上得分更高,这意味着它不太容易凭空捏造(幻觉),并且更有可能指向画作中实际存在的、能够支撑某种情感的部分。例如,其他模型可能会看到一座黑色的塔,并因为其高大而猜测是“敬畏”,而 ProFocus 在“深色调”和“烟雾”的逐步引导下,能正确地将这种感觉识别为“恐惧”。论文总结道,通过让机器处理艺术的方式与人类欣赏艺术的自然方式保持一致,我们可以构建出真正理解绘画情感力量的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →