Evaluating Stochastic Collapse and Implicit Bias in Multimodal Large Language Models
本文介绍了 RandomBench,这是一个用于评估多模态大语言模型在逻辑中性场景下维持分布中性行为能力的基准测试和一组指标,揭示了一种被称为“随机崩溃”(Stochastic Collapse)的普遍现象,即模型表现出强烈的隐式偏见,并且即使在被明确指示这样做时,也无法生成均匀的随机性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于论文《评估多模态大语言模型的随机崩溃与隐性偏见》的解释,采用了通俗易懂的语言和创意类比。
核心理念:“不公平的硬币”问题
想象一下,你让一位朋友抛一枚硬币,并告诉你结果是正面还是反面。如果他们是真正的随机,他们应该 50% 选正面,50% 选反面。
现在,想象你要求一个超级聪明的 AI(一个多模态大语言模型或 MLLM)做同样的事情:“抛一枚硬币。告诉我正面还是反面。”你期望这个 AI 是完全公平的。
这篇论文令人震惊的发现是: 这个 AI 的“硬币”是不公平的,它是带有严重偏重的。即使 AI 被告知要保持随机,它内心其实也有一个“心头好”。它可能会 97% 的时间都选“正面”,而“反面”只占 3%,尽管它明知自己应该表现得随机。
作者将这种现象称为**“随机崩溃”(Stochastic Collapse)**。这就像是 AI 的大脑陷入了某种思维定式,无法真正放手去进行真正的随机选择。
工具:“RandomBench”(测试厨房)
为了证明这一点,研究人员构建了一个名为 RandomBench 的新测试。你可以把它看作是一个“逻辑真空区”或“中立游乐场”。
- 目标: 创造出没有正确答案的情境。
- 设置: 他们创建了 200 个不同的场景。有些仅涉及文本(例如,“请选一个字母:A、B、C 或 D”),有些则涉及图片(例如,“请从这四个外观完全相同的形状中选一个”)。
- 规则: 每个选项都是完全相等的。没有任何理由去选 A 而不是 B。如果 AI 表现得真正随机,它应该在每个选项上各占 25% 的比例。
他们要求 7 个顶尖的 AI 模型玩这个游戏,每个场景重复玩 50 次。也就是说,总共进行了 10,000 次“抛硬币”。
他们的发现:AI 的“秘密习惯”
结果显示,这些 AI 模型在测试中表现得一败涂地。它们并没有成为一枚公平的硬币,而是表现得像一台坏掉的老虎机,总是落在同一个符号上。
以下是他们发现的主要“坏习惯”,通过比喻进行解释:
1. “视觉劫持”(响亮的信号)
当 AI 被展示图片时,它的“随机性”崩溃得更快。
- 比喻: 想象你被要求随机选一扇门。但其中一扇门上有一个微小的、几乎看不见的污点,而其他的门都很干净。尽管你被告知要忽略这个污点,但你的大脑还是会被它吸引。
- 发现: AI 无法忽略视觉细节。如果某个选项稍微亮一点、位于特定角落或者有一点模糊,AI 几乎每次都会选那个选项。视觉线索“劫持”了它遵循随机指令的行为。
2. “位置偏见”(中间座位)
- 比喻: 想象一排四个空椅子。你被要求随机坐一个。人类可能会选中间的一个,因为感觉那里更“安全”或更“中心”。
- 发现: AI 对特定位置有强烈的偏好。它非常喜欢中心、顶部或右侧。即使选项只是四个空白方块,AI 也会有 90% 的概率选择右上角的那个。
3. “语言切换”(口音效应)
- 比喻: 想象你要求一个人用英语随机选一个数字,他选了“7”。然后你要求同一个人用法语随机选一个数字,他突然改选了“3”。
- 发现: AI 的“心头好”会根据使用的语言而改变。即使是同一个视觉图像,如果指令是用中文而非英文下达的,会导致完全不同的“随机”选择。这证明了这种偏见与 AI 训练时使用的语言深度绑定。
4. “越强反而越差”的悖论
- 比喻: 你可能会认为,一个更聪明、更听话的机器人应该更擅长遵循“保持随机”的规则。
- 发现: 出人意料的是,那些更聪明、更“对齐”(即遵循指令能力更强)的模型,在随机性方面表现得反而更差。它们太擅长寻找逻辑模式来为自己的选择辩护了,以至于它们锁定在某一个选项上并坚持下去,甚至还会编造出一个听起来很有逻辑的理由来解释为什么选它,尽管原本根本没有任何逻辑可言。
为什么会发生这种情况?(“系统 1”故障)
论文使用了心理学中的一个概念——双过程理论(Dual Process Theory):
- 系统 2: 缓慢、逻辑性的思考(比如解数学题)。
- 系统 1: 快速、直觉性的思考(比如本能反应)。
大多数 AI 基准测试测试的是系统 2(你能解开这个谜题吗?)。但本论文测试的是系统 1(当没有谜题时,你的直觉是什么?)。
研究人员发现,当 AI 被迫进入“逻辑真空”(即没有任何一个选项优于其他选项时),它的系统 1就会接管。它不再是抛硬币,而是退回到它的训练数据中。它会选择在训练书籍中出现频率最高的选项,或者在它的内部代码中感觉最“熟悉”的选项。它并不是在做选择,而是在沿着一条隐藏的、阻力最小的路径滑行。
总结
论文得出结论:目前的 AI 模型并非真正的随机。即使我们要求它们保持随机,它们也存在基于以下方面的深层、隐形偏见:
- 物体在屏幕上的位置。
- 物体的外观(甚至是微小的细节)。
- 用于提问的语言。
- 使用的具体符号(如希腊字母或形状)。
这是一个严重的问题,因为如果 AI 被要求做出公平决策(例如推荐产品或选择路线),而它内心其实有一个“心头好”,那么它看起来是在做选择,实际上却只是在遵循一个隐藏的剧本。AI 所抛出的那枚“硬币”,本质上是坏掉的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。