Mitigating Bias in Large Vision-Language Models via Counterfactual Ensemble Decoding
本文提出了反事实集成解码(Counterfactual Ensemble Decoding, CED),这是一个通过在视觉表示空间内构建并集成多组反事实视角,以在保持模型核心能力的同时促进公平生成的创新框架,旨在缓解大型视觉语言模型中的社会偏见。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,新一代系统已经涌现,它们能够以非凡的流利度进行视觉观察与语言交流。这些大型视觉语言模型充当了视觉世界与人类语言之间的桥梁,能够回答有关图像的问题或详细描述场景。它们是在来自互联网的海量照片和文本集合上进行训练的,通过学习预测哪些词语应该紧随图像之后。然而,由于它们向人类数据学习,它们也继承了人类的缺陷。正如人类可能持有无意识的偏见一样,这些机器也经常吸收社会刻板印象,学习将特定的职业、特质或情感与特定的性别或种族联系起来。当模型看到一位女性的照片时,它可能会自动猜测她是护士而非医生;或者当它看到一位男性时,它可能会假设他是首席执行官(CEO)。这不仅仅是一个技术故障,它是现实世界中不平等的反映,这些不平等会强化有害的偏见并削弱人们对技术的信任。
研究人员长期以来一直试图通过在更“干净”的数据上重新训练模型,或者通过添加特殊的指令来告诉机器要公平,来解决这个问题。然而,这些方法通常成本高昂、难以规模化,或者依赖于对“公平”的单一且僵化的定义。一项新研究提出了一种不同的方法,这种方法并不试图抹除模型的知识,而是邀请它同时考虑多种观点。由北航大学的肖一松及其同事领导的研究小组开发了一种名为“反事实集成解码”(Counterfactual Ensemble Decoding)的技术。他们并没有简单地要求模型停止产生偏见,而是要求它同时从不同社会群体的视角来想象同一个场景。通过在机器选择下一个词的瞬间融合这些多元视角,系统可以打破单一、刻板叙事的统治地位。
这种方法的核心在于一个简单而强大的理念:多样性促进公平。在现实世界中,如果一个房间里充满了来自不同背景的人,那么对话就不太容易被一种狭隘的观点所主导。研究人员将这一原则应用于人工智能的数字大脑。当模型观察一张图像(例如一张穿着商务西装的人的照片)时,它通常会基于其训练生成单一的思维流。新系统在这个关键时刻进行干预,通过创建图像内部表示的“反事实”版本。这些并不是新的照片,而是对计算机观察图像方式的一种数学调整,通过改变焦点,让机器去想象这个人属于不同的性别或种族,同时保持场景的其他部分完全相同。这使得模型能够生成一组平行的预测:一个是基于原始图像的预测,另一个是如果此人属于不同社会群体时,图像可能隐含的内容。
一旦生成了这些多元视角,系统面临着一个挑战:如何在不削弱模型准确性的情况下将它们结合起来。研究人员发现,这些不同观点之间的冲突在模型的处理过程中并不是均匀分布的。神经网络中的某些层(其作用类似于深层思考)表现出原始视图与反事实视图之间最强的分歧。系统会识别出这些冲突最高的特定层。在这些最大差异点上,该方法会仔细地融合预测。它并不只是简单地取平均值;相反,它会根据置信度进行加权。如果模型在某一个视角中对某个词非常确定,而在另一个视角中却不确定,系统会优先选择置信度高的选项。这确保了最终的输出不是一个模糊的折中方案,而是一个平衡的决策,尊重了它所考虑的所有不同视角的见解。
这种方法的成果在旨在衡量职业、描述和个人特质偏见的几项严格基准测试中得到了验证。在一项涉及职业头衔性别偏见的测试中,新方法将偏见平均降低了61.21%,较以往的技术有了显著提升。在衡量种族刻板印象的测试中,偏见降低了近48%。例如,在描述一位女性首席执行官时,旧的方法可能仍会倾向于使用像“迷人的”这类具有刻板印象的形容词,而这个新系统则成功地将描述转向了“称职的”等中性且专业的词汇。至关重要的是,研究人员发现这种公平性并未以牺牲智能为代价。模型保留了回答一般性问题和解决复杂问题的能力,其整体性能仅出现了微小且往往可以忽略不计的下降。事实上,在某些推理测试中,去偏见后的模型表现甚至比之前略好,这表明消除刻板印象带来的噪声实际上可能有助于模型更清晰地专注于事实。
这项工作证明,人工智能的公平性并不需要丢弃模型的知识或从零开始。通过引入一种迫使系统在脑海中同时持有多种视角的机制,研究人员展示了机器可以学会如何在不退回到其根深蒂固的习惯的情况下,去应对人类社会的复杂性。该方法通过寻找模型内部逻辑最矛盾的时刻,并利用多元视角的加权融合来解决这种冲突。虽然该技术目前需要访问模型的内部运作机制,这限制了其在研究人员和开发者而非最终用户中的应用,但它提供了一条充满希望的前行之路。它表明,未来伦理人工智能的发展方向可能不仅在于更严格的规则或更干净的数据,而在于教导这些系统以更广阔、更具包容性的视角进行思考。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。