Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation
本文引入了多轴 max@K,这是一种基于组的强化学习目标,通过仅在样本能唯一提升一批次内特定语义模式的覆盖率时才对其分配信用,从而在不损害图像质量或提示词对齐度的前提下,增强了文本生成图像的多样性和人口统计学公平性,进而实现了更高的公平性得分。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走进一个巨大的、充满魔力的艺术工作室,那里有一个机器人艺术家,能瞬间画出你描述的任何画面。你说:“画一个侦探,”砰的一声!一个侦探出现了。你再次要求,另一个侦探又出现了。但问题在于,每次你要求时,机器人画出的都是完全同一种类型的侦探——也许总是一个穿着风衣的高个子男人。这就像机器人有一个心仪的“固定套装”,并且拒绝尝试其他任何款式。这是现代“文本生成图像”AI的一个常见问题。虽然这些机器人非常擅长制作看起来真实且符合你描述的图片,但它们经常陷入一种窠臼,反复生成那几种极其相似的变化。这是一个大问题,因为如果你要求画一个“医生”或“领导者”,而机器人只展示一种特定类型的形象,它就会强化一种狭隘且不公平的世界观。科学家们称之为缺乏“多样性”。
为了解决这个问题,研究人员通常会试图告诉机器人:“让它看起来不一样!”但通常情况下,当我们强迫机器人变得多样化时,图片会变得奇怪、模糊或者纯粹是错误的。机器人会感到困惑,不再听从你的指令。这篇论文介绍了一种巧妙的新方法,教机器人如何在保持“冷静”(不失质量)的同时实现多样性。作者提出了一种名为“多轴最大化 K 值”(Multi-Axis Max@K)的方法。把它想象成一场选秀节目,你不仅仅选出一位最优秀的歌手,而是观察一整组选手,然后说:“好吧,这位是最好的歌手,这位是最好的舞者,而这位是最好的魔术师。”目标不是让一个人做到所有事情都完美,而是让整个团队能够覆盖所有的领域。研究人员测试了这个想法,发现它能帮助 AI 生成更广泛的人群和色彩,使结果更加公平且更有趣,同时还能保持图片的清晰度和对你描述的忠实度。
问题所在:机器人的“心仪”套装
想象一下你有一个热爱绘画的朋友。你请他画一只“猫”。他画了一只毛茸茸的橘猫。你再次要求,他又画了同一只橘猫。你第三次要求,还是那只橘猫。你的朋友并不是画得不好,他们只是陷入了一个循环。他们有一个画猫的“首选模式”,并一直重复这个模式。
在人工智能(AI),特别是“文本生成图像”模型的世界里,这种情况经常发生。这些模型的训练基于互联网上的数十亿张图像。如果互联网上有更多白人男性作为医生的照片,而不是女性或其他种族的人,那么 AI 就会学习到“医生”等于“白人男性”。当你要求画一个医生时,它会从那个狭隘的记忆库中提取信息。
通常的解决方法是告诉 AI:“要多样化!”但如果你只是大喊“要多样化!”,AI 可能会感到困惑。它可能会画出一个长得像土豆的医生,或者一只戴着听诊器的猫。AI 试图变得不同,但它忘记了如何“做好”遵循你的指令。研究人员想要一种方法,让 AI 展示一组不同的选项——有些是女性医生,有些是男性医生,有些是黑人,有些是亚洲人——而不会让图片看起来很糟糕。
解决方案:“全班最佳”选秀节目
论文的作者为 AI 的学习方式制定了一个新规则。他们称之为 Multi-Axis Max@K。这听起来很复杂,但让我们用一个简单的故事来拆解它。
想象你是一名正在给班级学生评分的老师。你有一份想要看到的“技能”清单:数学、艺术、音乐和体育。
- 旧方法(标量奖励): 你单独看每个学生。“学生 A 数学很好但其他方面很差。学生 B 艺术很好但其他方面很差。”如果你只是把他们的分数相加,你可能会选出一个在所有方面都“还可以”但没有一项特别突出的学生。或者,你可能会选出数学天才,却忽略了班级里其实没有音乐家这一事实。
- 新方法(Multi-Axis Max@K): 你将把“整个班级”作为一个整体来看待。你会问:“这个小组里谁是最好的数学学生?”你选出了学生 A。“谁是最好的音乐学生?”你选出了学生 B。“谁是最好的体育学生?”你选出了学生 C。
神奇之处在于:这个小组之所以获得高分,是因为它拥有数学天才、音乐天才和体育天才,即使没有任何一个学生能精通所有三项。AI 学习到,它不需要制作一张完美涵盖所有内容的图片,而是学习到,如果一组图片中的不同图片代表了不同的事物,那么这一“批次”(batch)的图片就是成功的。
“Max”部分意味着 AI 会在组内寻找每个类别的“最佳”范例。“K”部分意味着它观察一组 K 张图片(比如 7 张或 10 张一组)。“Multi-Axis”(多轴)部分意味着它会同时检查许多不同的类别(比如不同的肤色、性别或颜色)。
他们是如何测试的:从像素到人类
研究人员并没有仅仅靠猜测,他们通过三个不断递进、复杂度不断增加的方式进行了测试。
1. 颜色游戏(合成测试)
首先,他们玩了一个简单的计算机程序游戏。他们命令程序生成红色、绿色、蓝色或其它颜色的图像。他们设定了一个规则:如果一组图像覆盖了所有颜色,程序就能得分。
- 发生了什么: 当使用旧有的“单一评分”方法时,程序变得懒惰,因为它发现只要制造一堆红色图像就能轻松得分。但当使用新的“Multi-Axis Max@K”方法时,程序意识到它需要制造出一张红色图像、一张绿色图像和一张蓝色图像才能获胜。它开始分散投资,制造出色彩丰富的组合。
2. 像素谜题(基于规则的测试)
接下来,他们使用了一个真实的图像生成器 SD3.5-M(一种流行的 AI 艺术模型)。这一次,他们没有使用人类来评判图片,而是使用了一个通过观察像素并统计颜色的计算机程序。他们要求 AI 生成具有特定颜色主题的图片(如“暖色调”或“暗色调”)。
- 结果: AI 学会了生成这样一批图片:其中一张是明亮温暖的,另一张是冷色调蓝色的,还有一张是暗色的。它成功地覆盖了所有的“轴”(颜色维度),而无需人类告诉它什么是好的。
3. 公平性测试(感知外观)
最后,他们处理了那个重大的现实世界问题:公平性。他们要求 AI 生成不同职业的人(如“医生”、“艺术家”、“科学家”)的照片。他们想看看 AI 是否能展示出不同种族和性别的多样化组合。
- 设置: 他们使用了自动工具来“猜测”生成图像中人物的种族和性别。他们定义了诸如“黑人女性”、“亚洲男性”、“拉丁裔女性”等“目标模式”。
- 结果: 使用新方法后,AI 开始生成更加平衡的群体。
- 在修复之前,一组 16 张“医生”的图片可能包含 13 名白人男性和 3 名其他背景的人。
- 修复之后,一组 16 张图片可能包含 4 名白人男性、3 名黑人、4 名亚洲人、2 名印度人和 3 名拉丁裔。
- 研究人员使用“公平性得分”来衡量这一点。与基础模型相比,他们的新方法将得分提高了 0.23 到 0.36。这是一个巨大的飞跃!最棒的是,图片依然看起来很好。其“文本对齐度”(即图片与“医生”一词的匹配程度)保持在高水平,且图像质量并未下降。
这意味着什么(以及它不意味着什么)
论文表明,通过改变我们“奖励”AI 的方式,我们可以让它自然而然地产生多样性。与其强迫它变得不同(这会导致画面变得怪异),不如奖励这个“组”拥有不同的代表。
然而,作者也谨慎地说明了这“不意味着”什么。
- 它不会凭空创造出新的人。如果 AI 从未见过某种特定类型的人的图片,它就无法凭空发明他们。它只能扩散它“已经知道如何绘制”的那些人。
- 它依赖于 AI 获得的“分数”。如果用于评判图片的工具(“评估器”)存在偏见,AI 可能会学到错误的教训。研究人员使用了自动工具来评判图片,虽然他们通过不同的工具检查了工作以确保一致性,但他们承认,人类的眼睛才是最终的评判标准。
- 它在拥有明确的“多样性”清单(如特定种族或颜色的列表)时效果最好。它是一个帮助 AI 覆盖特定目标的工具,而不是解决世界上所有公平问题的魔杖。
总结
这篇论文就像是给了机器人艺术家一本新的规则手册。它不再说:“你必须制作一张完美的图片”,而是说:“制作一整组图片,如果这组图片包含了各种各样的元素,我会给你一颗金星。”
结果如何?AI 变得不再那么枯燥,也变得更加公平。它不再反复向我们展示同一个“默认”形象,而是开始展示现实世界中丰富多彩的多样性。而且,它做到了这一点,却没有让图片变成一团混乱的乱码。这虽然只是数学上的一个小改动,但它可能会为我们如何通过机器创作的艺术来看待自己带来巨大的改变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。