What Is The Political Content in LLMs' Pre- and Post-Training Data?
该论文通过大规模数据分析发现,开源大语言模型的训练数据系统性地向左倾倾斜,且数据中的政治立场与模型行为高度相关,表明数据构成是塑造模型政治偏见的关键因素,从而凸显了提升数据透明度的必要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是一次对大型语言模型(LLM)的“基因测序”。
想象一下,你养了一只非常聪明的鹦鹉(这就是现在的 AI 聊天机器人)。这只鹦鹉能跟你聊天气、写代码,甚至讨论政治。大家发现,这只鹦鹉在谈论政治时,总是偏向“左派”(比如更支持环保、社会福利等观点)。
以前,人们一直在研究这只鹦鹉“怎么说话”(输出结果),试图通过给它打“镇静剂”或“纠正训练”来让它变中立。但这篇论文的作者们决定换个角度:他们不只看鹦鹉怎么说话,而是去检查鹦鹉的“食谱”(训练数据),看看它到底吃了什么,才变成了现在的样子。
以下是这篇论文的核心发现,用通俗的比喻来解释:
1. 鹦鹉的“食谱”严重偏科(数据不平衡)
作者们把鹦鹉吃过的所有“食物”(训练数据)都拿出来分析,结果发现了一个惊人的事实:
- 左派食物太多:在鹦鹉的食谱里,代表“左派”观点的文章数量,是“右派”文章的 2.3 倍到 12 倍!
- 比喻:这就好比你在教孩子认字,你给他看的书里,有 10 本都在讲“我们要多关爱他人、保护环境”,而只有 1 本在讲“我们要强调个人自由、减少政府干预”。孩子长大后,自然会觉得前者才是“真理”。
2. “主食”和“零食”的区别(预训练 vs. 后训练)
AI 的训练分两个阶段:
- 预训练(吃主食):这是 AI 刚出生时,疯狂阅读互联网上所有文章(像 DOLMA, The Pile 等数据集)的阶段。这个阶段它吃到了最多的政治内容,而且左派内容占绝对主导。
- 后训练(吃零食/调教):这是人类给 AI 做“微调”的阶段,教它怎么像人一样聊天、怎么遵守规则。作者发现,这个阶段的数据里,政治内容少得可怜,而且依然偏向左派。
- 结论:AI 的政治倾向主要是在“吃主食”(预训练)时形成的。后面的“调教”(后训练)只是让它说话更流畅,并没有改变它骨子里的“口味”。
3. 不同的厨师,做出同样的菜(数据清洗没用)
有人可能会想:“也许不同的公司(比如 OLMO, Falcon, Pythia)用的食谱不一样,所以有的 AI 偏左,有的偏右?”
- 研究发现:完全不是!不管是谁抓取的互联网数据,也不管他们怎么清洗(过滤掉代码、垃圾信息),最后剩下的“政治食材”分布惊人地相似。
- 比喻:就像三个不同的厨师,虽然用的面粉品牌不同,过滤杂质的筛子也不一样,但他们最后做出来的面包,味道和颜色几乎一模一样。这说明互联网本身(或者抓取数据的机制)就自带这种“左倾”的滤镜。
4. 来源不同,但味道一样(左派来自新闻,右派来自博客)
作者还查了查这些食物的“产地”:
- 左派观点:大多来自正规大新闻机构(如《卫报》、《赫芬顿邮报》、《纽约时报》)。
- 右派观点:大多来自个人博客、论坛或一些比较小众的网站。
- 比喻:左派的声音像是“电视台的播音员”,声音大、来源广;右派的声音像是“街角小报亭的老板”,虽然也有人在听,但声音比较分散。AI 吃多了“大播音员”的话,自然觉得那是主流。
5. 鹦鹉和食谱的“镜像关系”(数据决定行为)
这是论文最核心的发现:
- 高度相关:AI 在回答政治问题时的立场,和它食谱里政治文章的立场,相关性高达 0.87(满分 1)。
- 比喻:如果你给鹦鹉喂了 90% 的“苹果味”饲料,它学说话时,90% 的概率都会提到苹果。AI 现在的政治偏见,不是它自己“想”出来的,而是它照搬了训练数据里的偏见。
总结与启示
这篇论文告诉我们:AI 的偏见,根源在于数据。
- 以前我们以为:AI 变坏是因为算法太复杂,或者人类在微调时故意捣乱。
- 现在我们知道:AI 变“左”,是因为互联网上(或者说被 AI 抓取到的部分)左派的声音本来就比右派大,而且来源更权威。
这对我们意味着什么?
如果你想让 AI 变得更“中立”,光靠给 AI 打“补丁”(后训练)是没用的,就像你无法通过给一个吃素长大的孩子喂一块肉,就让他立刻变成肉食主义者一样。
真正的解决办法是:
- 透明化:AI 公司必须公开他们到底用了什么数据(就像食品配料表)。
- 重新配餐:在 AI 开始学习之前,就要有意识地平衡“食谱”,加入更多元、更平衡的观点,而不是让算法自动抓取那些本来就偏颇的数据。
简单来说,想要 AI 不偏激,先得让它的“老师”(训练数据)
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。