Small edits, large models: How Wikipedia advocacy shapes LLM values
本文表明,一小群协调一致的维基百科志愿者可以显著地塑造大型语言模型在特定话题(如动物福利)上的价值观和反应,因为与无关内容相比,他们的针对性编辑在模型训练和行为中具有不成比例的影响力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网是一个巨大的、无尽的图书馆,每一本曾经被写就的书籍都堆叠在书架上。现在,想象人工智能(AI)是一个想要学习世界万物的超级聪明的学生。为了实现这个目标,这位学生不仅仅是读一本书;他们阅读了图书馆里的每一本书。
然而,这位学生非常挑剔。他们并不平等地阅读所有的书。他们会格外关注“百科全书”板块(维基百科),因为那里是由专家编写的,非常可靠。事实上,这位学生阅读百科全书页面的频率比阅读散落在图书馆其他地方的随机新闻文章或博客文章要高出三到五倍。
这篇论文是关于一个被称为**亲动物维基百科志愿者(Pro-Animal Wikipedians,简称 PAW)**的小型志愿者团体。他们决定利用这位“超级学生”的学习习惯来为自己争取利益。以下是他们所做的工作以及他们的发现的简单拆解:
1. 策略:编辑百科全书
PAW 团队并没有试图黑入 AI 或构建一台新的计算机。相反,他们做了一件非常简单的事情:他们编辑了维基百科。
他们访问了 115 个不同的维基百科页面(主要是关于大型快餐连锁店、政治家和动物法案的页面),并添加了 125 段经过事实核查的关于动物福利的具体段落。
- 例子: 在一个关于快餐连锁店的页面上,他们添加了一个详细说明该公司如何对待其鸡只的部分。
- 目标: 他们想看看改变“百科全书”是否会改变“超级学生”(AI)对这些公司的认知。
2. 实验:学生注意到了吗?
研究人员想要知道:AI 真的从这些特定的编辑中学习到了知识,还是仅仅忽略了它们?
为了找出答案,他们使用了三种不同的“放大镜”(科学工具)来观察 AI(特别是像 Llama 这样的模型)是如何思考动物福利问题的。
- 放大镜 #1(“记忆测试”): 他们向 AI 提问,例如:“这家公司的动物福利政策是什么?”AI 会回溯其训练数据来寻找答案。研究人员发现,在 68% 的情况下,AI 的回答直接提取自 PAW 团队编写的特定段落。如果没有这些编辑,AI 就不会知道这些事实。
- 放大镜 #2(“如果……会怎样”测试): 他们运行了一个模拟实验,询问:“如果我们从 AI 的记忆中抹除 PAW 的编辑内容,AI 对动物福利问题的回答质量会变差吗?”答案是肯定的。事实上,在每一次测试运行中,AI 用来回答动物福利问题时最重要的前 10 个信息源,全部都是 PAW 团队所做的编辑。
- 放大镜 #3(“专家”测试): 他们从头开始训练了两个微型 AI 模型。一个只阅读 PAW 的编辑内容;另一个只阅读随机的维基百科文本。
- “PAW 模型”成为了动物福利方面的专家,但对一般的公司历史一无所知。
- “随机模型”成为了一般历史方面的专家,但对动物福利一无所知。
- 教训: AI 不仅仅是死记硬背单词;它从喂给它的文本中学习了概念和关联。
3. 关键发现:是针对性的,而非普遍性的
最重要的发现是,AI 并不会产生混淆。
- 当被问及动物福利时,AI 严重依赖 PAW 的编辑内容。
- 当被问及无关事物(例如“这家公司有多少家门店?”)时,AI 会忽略 PAW 的编辑,转而使用其通用知识。
类比: 想象你在教一个孩子关于一棵特定的树。你在绘本里给这棵树增加了一片鲜艳的红叶。
- 如果你问:“这片叶子是什么颜色的?”孩子会指向你添加的那片红叶。
- 如果你问:“这棵树有多高?”孩子会忽略那片叶子,转而观察树干。
这个孩子明白,红叶对于关于“叶子”的问题是重要的,但对于关于整棵“树”的问题则不然。AI 也做了同样的事情。
4. 为什么这很重要(根据论文所述)
论文得出结论,你不需要数百万美元或一个工程师团队来影响 AI。你只需要一个小型、协调一致的志愿者团体去编辑维基百科。
因为 AI 模型是在维基百科的基础上进行训练的,并且因为它们对维基百科给予了极高的权重,所以修改维基百科页面就像是在修改 AI 知识的源代码。
- 规模: 论文指出,尽管他们测试的 AI 模型比你今天可能正在使用的模型(如手机中的模型)要小,但这种效应在更大的模型中可能会更强。这是因为更大的模型拥有更多的“记忆”来保留这些特定事实,而且维基百科的事实也会被 AI 阅读的其他新闻来源所强化。
- 启示: 一小群人,通过仅仅编写事实准确、来源可靠的维基百科文章,就可以切实地改变 AI 系统谈论动物福利的方式。这是一种低成本、高影响力的塑造人工智能“良知”的方式。
简而言之: 论文证明了,如果你想让 AI 关注某个特定话题,你不需要去编写 AI 的程序。你只需要编写 AI 会阅读的那篇百科全书条目。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。