The Cow of Rembrandt - Analyzing Artistic Prompt Interpretation in Text-to-Image Models
本文研究了基于 Transformer 的文本到图像扩散模型如何在无显式监督的情况下在艺术提示中内部表征并分离内容与风格概念,并通过交叉注意力分析揭示,这些模型往往表现出一种涌现能力,能够将物体相关区域归因于内容令牌,而将纹理或背景区域归因于风格令牌。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一台神奇的艺术家机器人,它能画出你描述的任何事物。如果你对它说:“以毕加索的风格画一只长颈鹿”,它不会只是猜测;它实际上能理解画什么(长颈鹿)与如何画(毕加索风格)之间的区别。
这篇题为《伦勃朗的牛》的论文,就像一部侦探故事,调查这台艺术家机器人的“大脑”是如何工作的。研究人员想知道:机器人是将“画什么”和“如何画”分别存放在不同的“思维盒子”里,还是将它们混为一谈?
侦探的工具:热力图
为了解开这个谜团,研究人员使用了一种名为“交叉注意力热力图”的特殊工具。你可以把它想象成机器人大脑的热成像仪。
- 当机器人听到"长颈鹿"这个词时,热力图会在长颈鹿的身体上发出明亮的红光。
- 当它听到"毕加索风格"时,热力图会在背景、色彩以及画作中那些奇特的形状上发光。
如果代表“长颈鹿”的红光和代表“毕加索”的红光停留在不同的位置,那就意味着机器人擅长将主体与风格区分开来。如果它们在同一位置到处发光,那就说明机器人感到困惑,将两者混淆了。
主要发现:通常表现良好,偶尔出现怪象
研究人员测试了数千种组合(例如“以莫奈风格画香蕉”或“以伦勃朗风格画牛”)。
1. 一般规律:
大多数时候,机器人表现得很出色。“长颈鹿”标记点亮了动物本身,而“风格”标记点亮了画布的其他部分。这就像一位厨师,确切地知道哪些食材该放进汤里(内容),哪些香料该放进酱汁里(风格),而不会将它们混淆。
2. “伦勃朗的牛”异常现象:
论文强调了一个有趣的例外。当他们要求机器人画“一只带有伦勃朗风格的牛”时,发生了一些奇怪的事情。
- 伦勃朗以画人物著称,尤其是在戏剧性的光影下。
- 机器人并没有仅仅以伦勃朗的风格画牛;它实际上给牛穿上了衣服。它给牛穿上了类似人类的服装,并将其画得像个人物。
- 在这种情况下,“风格”(伦勃朗)和“内容”(牛)纠缠在了一起。机器人心想:“哦,伦勃朗画人物,所以我要让这头牛看起来像个人。”
这告诉了我们什么
该论文得出结论:这些人工智能模型对艺术拥有一种“涌现式的理解”。它们并没有被明确教导“嘿,风格是独立于内容的”。相反,通过观察数十亿张图片,它们自己悟出了这一点。
- 它们通常能正确理解:它们知道将风格放在背景上,将物体放在中心。
- 它们有时会困惑:如果某位特定艺术家(如伦勃朗)以画特定类型的主体(人物)而闻名,机器人可能会无意中把你要求的主体变成那种类型的人物。
核心启示
研究人员开发了一个免费工具(就像放大镜一样),让任何人都能看到这些热力图。他们发现,虽然人工智能在理解“画什么”和“如何画”之间的区别方面已经非常擅长,但它仍保留了一些基于其所学习的特定艺术家和物体的古怪习惯。它不仅仅是一个随机生成器;它是一个复杂的系统,已经发展出了关于艺术如何运作的自身内部逻辑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。