← 最新论文
💻 computer science

Whose Art Counts? Model- and Prompt-Dependent Associations in Vision-Language Judgments of Museum Art

本文引入了一种基于档案条件的审计协议,用于评估视觉语言模型与提示结构在评估艺术价值时如何与博物馆元数据进行交互,并通过大都会艺术博物馆的案例研究证明,“影响”类提示词能产生最一致的基于类别的差异,同时也凸显了跨模型和跨提示词泛化能力的局限性。

原作者: Manpreet Singh, Nandakishor Reddy Pulagam, Rhythm Bhatia, Rahul Joshi

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Manpreet Singh, Nandakishor Reddy Pulagam, Rhythm Bhatia, Rahul Joshi

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你刚刚打造了一个超级聪明的机器人图书管理员,它读过数百万本书,看过数十亿张图片。当你问它:“这些画作中哪一幅是杰作?”或者“哪一幅改变了历史?”时,你期望这个机器人能基于美感和技巧,通过观察艺术品给出一个公正的答案。但问题在于:这个机器人并不像人类那样去“看”艺术。它通过将图片与互联网上的文字进行匹配来学习模式。如果互联网上大多在说“伟大的艺术家”是男性,那么机器人可能会学到“伟大的艺术”看起来像是男性的作品,即便这是错误的。这就是**视觉-语言模型(Vision-Language Models, VLMs)**的世界:将图像与文字联系起来的计算机。核心问题不仅是“这个机器人是否聪明?”,而是“它学习的是一个什么样的世界?”以及“如果我们改变提问方式,机器人的答案会改变吗?”现在的博物馆里到处都是这些机器人,它们在帮助人们发现艺术,但如果机器人存在偏见,它可能会掩盖女性和其他代表性不足的创作者的故事,使他们在历史上显得没那么重要。

因此,一组研究人员决定对这些机器人图书管理员进行一项非常具体的测试。他们不仅仅是让机器人去猜测;他们建立了一个严格的游戏,以观察这些机器人是否在公平竞争。他们抓取了来自大都会艺术博物馆的 445 幅数字艺术图片。但这里有一个转折:他们知道博物馆的记录很混乱。许多古老的艺术品并没有明确的名字附着其上。所以,他们将这组对象分成了两部分:一小部分是 61 件创作者姓名已知(他们根据名字推测性别)的作品,另一大部分是 384 件创作者身份成谜的作品。他们想看看机器人是否会对推测为男性的艺术家给出比推测为女性的艺术家更高的“分数”。

但他们不仅仅问了一个问题。他们用四种不同的方式询问机器人:“这是一件杰作吗?”、“这是高质量的作品吗?”、“它是否有影响力?”以及一个用于检查机器人是否在认真听讲的控制变量问题。他们在个不同的机器人大脑(OpenAI CLIP, OpenCLIP B/32, OpenCLIP L/14, 和 SigLIP)上运行了这项测试。

以下是他们的发现,而且这是一个情节反转:机器人并不达成共识。

这并不是一个简单的“所有机器人都有性别歧视”的故事。相反,答案完全取决于你询问的是哪个机器人以及你如何提问。

  • 当他们询问关于**“影响力”**(一位艺术家在多大程度上改变了历史)时,两个机器人(OpenAI CLIP 和 OpenCLIP L/14)给出了明确的信号:它们给出的男性推测作品的分数高于女性推测作品。这就像机器人在说:“哦,历史书说男性改变了事物,所以我会给他们更高的分数。”
  • 然而,当他们询问**“质量”“杰作”**时,结果却一团糟。一个机器人可能说“男性更好”,另一个可能说“女性更好”,而第三个则说“我看不出区别”。
  • 一个名为 SigLIP 的机器人甚至给出了相反的结果,它给女性推测的作品打了更高的分数,尽管研究人员指出这些数据有些波动且难以捉摸。

论文强调的最重要的一点是,你不能仅仅将这些答案取平均值。 如果你把所有四个机器人的得分合并成一个大数字,你得到的是一个谎言。这些机器人差异太大。一个机器人的“高分”并不等同于另一个机器人的“高分”。研究人员认为,“偏见”并不是这项技术的固定缺陷,而是一个测量问题。结果取决于你使用的工具以及你输入的精确词汇。

研究还指出,博物馆自身的记录发挥了巨大作用。因为在 445 件艺术品中,有 384 件没有已知的创作者,机器人甚至无法对它们进行比较。那些“有名”的艺术家只是博物馆馆藏中一个极小的、特定的切片。研究人员警告说,我们不能说这些机器人讨厌女性艺术家,我们只能说,在这个特定的测试中,使用这些特定的词汇和这组特定的图片,某些机器人表现出了偏向男性姓名的模式。

最后,论文并不是在说“机器人坏掉了”或“机器人是完美的”。它是在说:“请保持警惕。”如果一家博物馆使用机器人来对艺术品进行排名,那么这种排名可能仅仅反映了机器人的训练方式和提问方式,而不是艺术本身的真实价值。研究人员建议,与其寻找一个“真相”,我们不如去倾听机器人之间的分歧。如果一个机器人说“这是一件杰作”,而另一个说“不”,这种分歧实际上才是我们能得到的、最诚实的答案:它告诉我们,这个问题比我们想象的要难,而机器人的观点仅仅是喧闹房间里一个嘈杂的声音。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →