White-Box Sensitivity Auditing with Steering Vectors
本文提出了一种针对大语言模型的白盒敏感性审计框架,该框架利用激活调控技术操纵内部概念,揭示了在高利害决策任务中对受保护属性的显著依赖,而此类依赖往往难以被标准的黑盒评估所察觉。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在招聘一名新员工,并且有一个计算机程序(大型语言模型,或称 LLM)协助你决定录用谁。你希望确保计算机不会基于性别或种族暗中歧视人们。
目前,大多数人使用“黑盒”方法来检查这种偏见。这就像向计算机发送一份署名为“约翰”的简历,看看它是否拒绝录用,然后再发送一份署名为“简”的简历,看看它是否录用她。如果结果相同,你就会认为计算机是公平的。
问题所在:
本文作者认为,这种“黑盒”方法就像试图仅通过观察速度表来了解汽车发动机的工作原理。你可以看到汽车是快是慢,但无法看到发动机是否点火不良,或某个特定齿轮是否损坏。计算机可能在文本中忽略了“约翰”或“简”这个名字,但它仍可能在其大脑(内部代码)中以一种隐蔽的方式“思考”性别或种族,而基于文本的测试无法察觉这一点。
解决方案:“白盒”敏感性审计
作者提出了一种检查计算机的新方法,称为“白盒”审计。他们不再仅仅发送不同的简历,而是深入计算机的“大脑”,轻轻拨动其内部思维。
以下是他们如何操作,使用了一个富有创意的类比:
类比:“思维旋钮”
想象计算机的大脑有一个巨大的控制面板,上面有数千个旋钮。每个旋钮控制一个特定概念,例如“性别”、“种族”或“信用风险”。
- 找到旋钮(导向向量): 首先,研究人员确定哪个旋钮确切地控制“性别”概念。他们称之为“导向向量”。这就像找到机器内部用来调高或调低“男性/女性”音量的确切旋钮。
- 转动旋钮(激活导向): 他们不改变简历上的文本(例如将“约翰”改为“简”),而是让文本保持完全不变。相反,他们在计算机内部物理转动“性别旋钮”。
- 他们将其略微转向“女性”一侧。
- 然后将其略微转向“男性”一侧。
- 他们在计算机查看完全相同的简历时进行这些操作。
- 测量反应(敏感性): 如果计算机真正公平,转动“性别旋钮”不应改变其对简历的决定。无论他们如何扭转那个特定旋钮,决定都应保持不变。
- 如果决定发生变化: 计算机对性别“敏感”。这意味着该决定暗中依赖于那个隐藏的旋钮,即使文本中没有提到“性别”。
- 如果决定保持不变: 计算机对性别“不变”(不受影响)。它实际上是公平的。
他们的发现
研究人员在四种严肃情境下测试了这种方法:司法审判(判断某人是否有罪)、信用评分(判断某人是否获得贷款)、大学录取和医疗诊断。
- 黑盒的谎言: 在许多情况下,旧方法(更改文本中的名字)表明计算机是公平的。它们显示群体之间几乎没有差异。
- 白盒的真相: 当研究人员转动内部旋钮时,他们发现计算机实际上对性别和种族非常敏感。
- 示例: 在信用评分测试中,旧方法表明计算机是公平的。但当他们转动内部的“性别旋钮”时,计算机突然开始比拒绝“男性”档案更频繁地拒绝“女性”档案,尽管文本从未改变。偏见隐藏在机器内部,而非文字之中。
为什么这很重要
本文声称,旧的测试方法就像只通过查看外墙来检查房屋是否漏水。你可能会错过管道内部发生的漏水。
他们的新方法就像打开墙壁,直接检查管道。他们发现:
- 隐藏偏见是真实的: 计算机通常存在基于文本的测试完全无法察觉的隐藏偏见。
- 更可靠: 他们的方法无论测试如何设置都能提供一致的结果,而旧方法则根据措辞方式给出令人困惑、相互矛盾的答案。
- 精确: 他们可以仅调整“性别”旋钮,而不会意外改变计算机对该人工作或教育的看法。
简而言之: 作者构建了一种工具,可以窥探计算机的“大脑”并拨动其内部旋钮,以查看其是否暗中存在偏见。他们发现,许多计算机以前无法察觉的方式存在偏见,这证明我们需要查看引擎盖下,而不仅仅是仪表盘,以确保人工智能的公平性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。