GGSS: Geodesic-Gated Spherical Steering for Inference-Time Debiasing of Generative Vision-Language Models
本文介绍了 GGSS,一种保持范数的推理时干预方法,它通过在单位超球面上沿测地线弧引导视觉标记,从而在有效减少生成式视觉语言模型中人口统计学偏差的同时,保持其核心视觉语言能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
能够看懂并开口说话的人工智能系统正逐渐成为我们日常生活中常见的助手,帮助筛选简历、回答问题以及解读医学影像。这些被称为“视觉-语言模型”的系统,通过学习数百万张图片及其对应的文本描述来进行学习。然而,由于它们是从人类创造的数据中学习,因此往往会吸收我们关于种族、性别和职业的那些不公平的刻板印象。计算机可能会仅仅根据一个人的感知种族或性别,就对其给出与他人不同的薪水或职位预测,即便视觉细节完全一致也是如此。对于用于高风险决策的技术而言,这是一个严重的问题,但修复它却非常困难。传统上,为了消除这些偏见,开发者必须从头开始重新训练整个庞大的计算机模型,这一过程需要巨大的计算能力和时间。此外,许多旨在修复偏见的现有方法是为旧类型的 AI 设计的,那些 AI 将图像处理为单一的摘要,而不是像现代系统那样将图像分解为数千个微小的碎片来理解。
一组研究人员现在开发出了一种无需重新训练模型即可纠正这些偏见的新方法。他们将这种方法称为 GGSS,即“测地线门控球面转向”(Geodesic-Gated Spherical Steering)。他们并没有重建 AI,而是插入了一个轻量级的微调装置,在模型“思考”时发挥作用。可以将 AI 对图像的内部理解想象成一组指向不同概念的方向。当 AI 看到一张脸时,其中一些方向指向个人的身份,而另一些则指向其职业或背景。研究人员发现,AI 对种族或性别的偏见集中在这些特定的方向中,而其余信息则是中立的。他们的目标是轻轻地将这些带有偏见的方向从刻板印象中引导开,而不干扰关于此人实际外观或图像背景的有益信息。
研究人员在四种不同的现代视觉-语言模型上测试了他们的方法。首先,他们向模型展示了一系列经过精心控制的图像,其中仅改变了人的感知种近期或性别,而服装、姿势和背景等其他所有元素都保持完全相同。通过观察当仅种族或性别发生变化时模型的内部信号如何移动,他们绘制出了模型所走的特定“偏见路径”。随后,他们创建了一个在正常使用期间进行修复的两步走过程。第一步涉及识别图像的哪些特定部分触发了偏见。并非图像的所有部分都同样带有偏见;例如,一张脸可能带有强烈的种族信号,而背景或一个人的鞋子几乎不携带此类信号。这种新方法使用一种智能过滤器,将修正重点放在真正携带偏见的图像部分,从而让中立部分保持原样。
第二步是修正如何发生。旧的方法试图简单地减去偏见,就像擦掉画作上的一条线一样。研究人员发现,这种“硬性”减法往往会扭曲图像的含义,导致 AI 失去正确理解图片的能力。相反,他们使用了一种技术,让信息沿着一条曲线路径移动,类似于飞机为了沿着地球的曲线飞行而非穿过地面的直线,从而选择最短航线。这使得 AI 能够将其理解转向远离刻板印象的方向,同时保持其感知的整体形状和强度。通过将这种曲线运动与仅针对偏见部分的智能过滤器相结合,该系统可以在不破坏模型通用智能的情况下减少不公平性。
他们的测试结果清晰且显著。当他们将此方法应用于四种不同的 AI 模型时,该方法大幅降低了模型回答中的偏见。在某些情况下,模型在判断薪水或职业时的这种不公平差距下降了 90% 以上。至关重要的是,模型并没有失去执行其他任务的能力。研究人员使用一个包含 1,500 个涵盖科学、数学和逻辑问题的标准测试,检查了模型的通用知识和推理能力。接受了偏见修正的模型表现得与原始的、未经修正的模型一样出色,其准确率的变化不到 1%。这证明了在使这些系统变得更公平的同时,并不一定会让它们变得更笨。
这项研究还表明,这种方法比以往的尝试更可靠。当他们尝试使用不使用曲线路径或智能过滤器的旧有的、更简单的方法时,模型经常会变得混乱或无法正确回答问题。研究人员发现,对于规模最大、最复杂的模型来说,曲线路径尤其重要,因为简单的修正会导致系统彻底失效。他们还展示了该方法具有灵活性:通过调整修正应用的强度,用户可以选择在显著减少偏见的同时,仍然允许模型识别人口统计学细节(如果特定任务需要,例如在医疗文档记录中)。
这项工作为使人工智能更加公平提供了一个实用的工具。它表明,我们不需要废弃并重建我们最先进的 AI 系统来修复其偏见。相反,在系统运行时进行有针对性的、细致的调整,就可以在保留模型观察和理解世界能力的同时,消除不公平的刻板印象。研究人员已公开了他们的代码,以便他人测试和使用这种方法,为部署既强大又公平的 AI 系统提供了一条新路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。