← 最新论文
💻 computer science

XPASS-Vis: A Dataset for Cross-Domain Personalized Image Aesthetic Assessment

本文介绍了 XPASS-Vis,这是首个旨在进行跨领域个性化图像美学评估的数据集,其特征是包含由 129 位标注者对艺术、时尚和风景领域共 6,526 个刺激源进行的评分,并建立了基准无监督领域自适应模型,这些模型展示了个性化美学偏好的部分可迁移性,同时也强调了进一步研究以弥合剩余性能差距的必要性。

原作者: Takato Hayashi, Hiroaki Takahara, Candy Olivia Mawalim, Hiromi Narimatsu, Akisato Kimura, Shiro Kumano, Shogo Okada

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Takato Hayashi, Hiroaki Takahara, Candy Olivia Mawalim, Hiromi Narimatsu, Akisato Kimura, Shiro Kumano, Shogo Okada

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常喜欢极简主义艺术的朋友。你可能会理所当然地认为,他们也会喜欢极简主义时尚或极简主义风景摄影。但事实真的如此吗?也许他们热爱艺术,却觉得时尚很乏味,或者反之亦然。

这正是 XPASS-VIS 这篇论文试图解决的核心谜题:我们能否教会计算机理解你在一个领域(如艺术)的特定品味,并利用这些知识去预测你在一个完全不同的领域(如时尚)中会喜欢什么,即使计算机从未见过你在时尚领域的反馈?

以下是这篇论文研究历程的拆解,使用了简单的类比。

1. 问题所在:“一刀切”的陷坑

目前的审美评估(Aesthetic Assessment)计算机就像通用的评论家。它们看一眼画作,然后说:“大多数人都认为这很美。”但你和你的好朋友可能有完全不同的意见。

为了解决这个问题,研究人员构建了“个性化”模型来学习你的特定品味。然而,这些模型通常只能在单一赛道内工作。如果你训练一台计算机了解你在艺术方面的品味,它并不知道如何将这种知识应用到时尚风景上。这就像教一位厨师制作完美的寿司,然后要求他在没有任何新指令的情况下去烤蛋糕。他可能会失败,因为他不知道如何迁移自己的技能。

2. 解决方案:一个新的“口味测试”数据集

为了研究这一点,作者创建了 XPASS-Vis,这是第一个专门设计用于测试这种“跨领域”迁移的数据集。

  • 参与者: 他们收集了 129 名参与者(标注者)。
  • 菜单: 他们向这些人展示了 6,526 张图像,涵盖了三个截然不同的“菜品”:
    1. 艺术: 绘画和雕塑。
    2. 时尚: 衣物和套装。
    3. 风景: 风景视图(最初是视频片段,后转为静态照片)。
  • 评分: 每位参与者不仅对每张图像进行“有多美?”(1 到 7 分)的评分,还针对特定的感受进行评分,例如“这是否让我感到怀旧?”或“它是否具有智力挑战性?”

核心特征: 与以往人们只对一种类型的图像进行评分的数据集不同,这里的 129 名参与者对所有三种类型的图像都进行了评分。这就是允许研究人员观察一个人的对简约线条的喜爱是否会转化为对简约线条时尚的喜爱的“罗塞塔石碑”。

3. 实验:一场“无监督”挑战

研究人员设置了一个棘手的游戏,以测试计算机是否能在没有帮助的情况下学习这些联系。

  • 设置: 他们给了计算机带有标签的数据(评分)——艺术(源域)。
  • 挑战: 他们要求计算机预测时尚(目标域)的评分,但给它关于时尚的学习评分。计算机必须自己找出其中的联系。
  • 方法: 他们尝试了各种“领域自适应”(Domain Adaptation)技术。把这些技术想象成在没有字典的情况下将一本书从一种语言翻译成另一种语言的不同策略。
    • 对抗性方法(Adversarial methods): 试图通过欺骗计算机,让它忘记自己正在看哪个领域。
    • 特征对齐(Feature Alignment): 尝试在数学上将艺术数据的“形状”与时尚数据的“形状”对齐。

4. 结果:一个有条件的“肯定”

结果令人鼓舞,尽管并不完美。

  • 基准线(Baseline): 如果计算机仅仅根据艺术数据进行猜测,并在没有特殊技巧的情况下将其应用于时尚,其表现会非常糟糕(就像一次拙劣的翻译)。
  • 提升: 最好的“翻译”方法(特别是那些专为回归任务设计的 RSDDARE-GRAM)成功恢复了约 60% 的潜在性能。
    • 类比: 想象满分是 100 分。如果没有帮助,计算机只能得 15 分。有了最好的新技巧,它可以跳升到 45 分。这并不完美,但这是一个巨大的飞跃,证明了你在艺术方面的品味确实与你在时尚方面的品味共享一些 DNA。

关键发现: 计算机学到了,如果一个人喜欢“简单、干净”的艺术,那么他很可能也倾向于“简单、干净”的时尚,即使没有被明确告知。

5. 谁从中受益?(谜团)

研究人员进行了深入研究,以观察哪些人能从这种迁移中获益最多。他们查看了年龄、性别、国籍和人格特质(如“对新体验的开放程度”)。

  • 惊喜之处: 他们发现没有任何模式
    • 并不是只有“艺术专家”受益。
    • 也不是只有“年轻人”或“男性”受益。
    • 这种收益在这些群体之间似乎是随机的。
  • 结论: 品味迁移的能力不在于你在纸面上的身份(你的人口统计学特征);而在于你个人偏好的特定且不可见的结构。计算机无法仅通过查看个人资料来预测会受益;它只是在某种程度上广泛地适用于所有人。

6. 局限性:论文未提及的内容

作者诚实地说明了他们没有做的事情:

  • 文化偏见: 几乎所有的参与者都来自东亚。我们不知道这是否适用于其他文化的人。
  • 范围: 他们只研究了艺术、时尚和风景。他们没有测试建筑或产品设计。
  • 视频 vs. 照片: 风景数据最初是视频,但他们使用的是单帧图像。他们承认他们可能错过了“运动”带来的感觉。
  • 未来工作: 他们没有测试“少样本学习”(即只给你 5 个关于你时尚品味的例子)或其他更先进的方法。他们将这些留给了后来的研究者。

总结

这篇论文介绍了一个新的数据集 (XPASS-Vis),证明了个人品味是可迁移的。虽然计算机不能仅通过了解你的艺术品味就完美预测你的时尚品味,但通过聪明的数学技巧,它可以在无需预先看到你的时尚评分的情况下,达到大约 60% 的准确度。这表明,我们的审美灵魂在不同类型的审美之间拥有一个一致的核心。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →