Bias in Large Language Models: Origin, Evaluation, and Mitigation
本文全面综述了大型语言模型中的偏见问题,系统分析了其成因,评估了数据、模型和输出层面的检测方法,并对缓解策略进行了分类,同时探讨了偏见人工智能在现实应用中的伦理与法律影响。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《大型语言模型中的偏见:起源、评估与缓解》的解读,将其拆解为简单概念并辅以日常类比。
宏观图景:带有盲点的“超级读者”
想象大型语言模型(LLM)是一位超级先进的学生,几乎阅读了人类写过的每一本书、每一个网站和每一条社交媒体帖子。这位学生极其聪明,在写文章、回答问题以及翻译语言方面,几乎胜过所有人。
然而,由于这位学生是从人类写下的所有内容中学习,他们也习得了我们所有的偏见、刻板印象和不公习惯。就像一个在“所有人都认为某类人数学不好”的社区长大的孩子,这位学生可能也会开始相信这一点,即使事实并非如此。
这篇论文是一本庞大的指南,提出了三个核心问题:
- 这些坏习惯从何而来?(起源)
- 我们如何发现学生在作弊?(评估)
- 我们如何教导他们变得公平?(缓解)
第一部分:坏习惯的由来(起源)
作者将“坏习惯”(偏见)分为两类:内在偏见和外在偏见。
1. 内在偏见:“内部记忆”
这可以看作是学生在学习过程中形成的内部词典和世界观。
- 训练数据(教科书): 学生阅读的书籍中,“医生”几乎总是男性,而“护士”几乎总是女性。因此,在他们的内部记忆中,“医生”与“男性”关联,“护士”与“女性”关联。这就是数据偏见。
- 收集方法(图书馆): 想象学生只去过某个特定国家的图书馆。他们会认为那个国家的节日是世界上唯一的节日。这就是时空偏见。
- 工具(笔和纸): 甚至学生将单词拆解成片段(分词)的方式也可能不公平。如果学生的“笔”将少数群体的名字拆解成微小且令人困惑的碎片,却将常见名字保持完整,那么他们就无法很好地理解少数群体的名字。这就是分词偏见。
2. 外在偏见:“糟糕的表现”
这是指学生在特定测试或任务中表现出坏习惯的时候。
- 理解任务(NLU): 如果你问“谁是医生?”,而文本说“医生来了”,即使文本没有说明性别,学生也可能猜“他”,因为他们的内部记忆存在偏见。
- 生成任务(NLG): 如果你让学生写一个关于领导者的故事,他们可能会自动将领导者设定为男性,将护士设定为女性,即使你没有这样要求。
- 结果: 学生可能会给男性而非女性提供工作推荐,或者以侮辱某种文化的方式翻译句子,仅仅是因为他们重复了训练数据中看到的模式。
第二部分:如何发现作弊(评估)
我们如何知道学生是否存在偏见?论文建议像老师批改作业一样,在三个不同层面进行检查。
- 数据层面检查(检查教科书):
- 在学生开始学习之前,我们先查看他们阅读的书籍。关于男性的书是否太多,而关于女性的书是否太少?关于美国的书是否太多,而关于非洲的书是否完全没有?我们利用数学来统计不同群体出现的频率。
- 模型层面检查(检查大脑):
- 我们试探学生的大脑,看他们如何连接概念。如果我们问“护士是男性吗?”,学生的大脑亮起“否”的信号;但如果我们问“医生是男性吗?”,大脑亮起“是”的信号,我们就知道他们的连接中存在隐藏偏见。我们使用反事实工具(将名字从“约翰”改为“简”,观察答案是否改变)来进行检测。
- 输出层面检查(批改作业):
- 我们查看学生给出的实际答案。他们是否对某些群体使用了恶毒的词汇?他们是否给不同的人提供了不同的建议?我们还使用人工审核员(真实的人)来阅读答案,并指出:“嘿,这听起来不公平。”
第三部分:如何纠正坏习惯(缓解)
论文提出了三种“去偏见”学生的方法,具体取决于你何时进行干预。
1. 模型前去偏见(清理教科书)
- 理念: 在学生开始学习之前,我们先清理图书馆。
- 方法: 我们增加关于代表性不足群体的书籍(过采样),或者移除那些充满仇恨的书籍。我们甚至可能重写句子以交换性别(例如,将“医生是他”改为“医生是她”),让学生学习两种选项。
- 优缺点: 这种方法起步便宜且容易,但仅靠清理书籍无法解决所有问题。有些坏习惯已经深深植根于学生的脑结构中。
2. 模型中去偏见(重新布线大脑)
- 理念: 在学生学习的過程中,我们强迫他们以不同的方式学习。
- 方法: 我们改变游戏规则。如果学生试图将“护士”与“女性”关联,我们就给他们一个“惩罚分数”(损失函数),让他们学会停止这样做。我们甚至可能“修剪”(切除)他们大脑中持有这些不良连接的具体部分。
- 优缺点: 这种方法在解决根本原因方面非常有效,但昂贵且困难。这就像试图在计算机运行时重新布线。
3. 模型后去偏见(编辑作业)
- 理念: 让学生写出答案,但在展示给世界之前,我们对其进行编辑。
- 方法: 如果学生写出了带有偏见的句子,我们就使用过滤器来修改词语。或者,我们使用“因果提示”技巧,要求学生以特定方式思考问题,迫使他们忽略刻板印象。
- 优缺点: 这种方法速度快,且不需要重新训练学生。然而,这就像给伤口贴创可贴;它治标不治本。
第四部分:为何这很重要(伦理与法律)
论文警告说,这些偏见不仅仅是令人烦恼的,它们更是危险的。
- 表征性伤害: 学生可能会说“穆斯林是暴力的”或“女性不是领导者”。这会伤害人们的感情,并强化社会中的负面刻板印象。
- 分配性伤害: 这是指人们失去现实机会的情况。如果带有偏见的学生协助公司招聘,他们可能会拒绝一位合格女性的简历。如果带有偏见的学生协助医院诊断患者,他们可能会漏诊少数群体的疾病。
论文指出,法律正在开始跟进。在纽约市和欧盟等地,公司现在被要求审计其人工智能工具,以确保它们不会基于种族、性别或年龄歧视人们。
核心结论
这篇论文是一张路线图。它告诉我们,人工智能就像一面镜子,反映了我们社会的缺陷。要构建公平的人工智能,我们不能仅依赖一种解决方案。我们需要清理数据,仔细训练模型,持续检查其工作,并在输出到达人们手中之前修正结果。这是一个持续的过程,而非一次性的任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。