Position: The Alignment Community is Unintentionally Building a Censor's Toolkit
本立场文件认为,现代人工智能对齐方法虽然旨在防止有害输出,但其本质上是恶意行为者可以利用来进行审查和操纵的双重用途技术,因此敦促业界应对这些风险并制定缓解策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在建造一个超级聪明的机器人图书管理员。你的目标是确保这位图书管理员绝不会发放危险手册、传播谎言或说出刻薄的话。在人工智能的世界里,这被称为“对齐”(alignment)。这是一个教计算机模型遵循人类规则和价值观的过程,比如变得有用、诚实且无害。你可以把它想象成安装一个非常复杂的“良好行为”过滤器。但这里有一个转折:我们用来安装这些过滤器的工具就像一把万能钥匙。如果一个好人拿着这把钥匙,他们可以锁住危险信息以保护我们;但如果一个坏人夺走了这把钥匙,他们就可以锁住任何他们不喜欢的东西——历史书籍、政治观点或让他们难堪的事实。这篇论文提出了一个可怕但重要的疑问:我们是否在无意中构建了专为暴君和操纵者准备的终极审查工具包?
本文作者莎拉·鲍尔(Sarah Ball)和菲尔·哈克曼(Phil Hackemann)认为,研究人员用来让 AI 变得安全的那些方法本身就是“双重用途”(dual-use)技术。这意味着,旨在阻止机器人告诉你炸弹配方的相同技术,也可以轻易地被重新利用,用来阻止机器人告诉你政府丑闻。他们并不是说我们应该停止尝试让 AI 安全,事实上,他们说我们绝对需要继续这样做,以防止真正的伤害。相反,他们是在发出警报:我们今天正在完善的这些“安全”工具,正在变成明天控制人们认知与思想的强大武器。
过滤器的两面
为了理解这是如何运作的,请将 AI 想象成一只读过互联网几乎所有内容的巨大、话痨的鹦鹉。为了让它成为一个好的助手,我们必须教它什么不该说。论文将这种教学过程分解为三个层面,并说明了每个层面如何被歪曲用于不良目的。
1. 图书粉碎机(预训练阶段)
在鹦鹉开始学习说话之前,我们必须喂它书。第一步是“预训练数据过滤”。这就像图书管理员在鹦鹉阅读之前,先将书中的页面撕碎。如果图书管理员认为某些词汇或话题是“不安全的”,那些页面就会被撕掉。
- 正面作用: 我们粉碎包含制造武器或传播仇恨指令的页面。
- 负面作用: 一个恶意行为者可能会粉碎关于特定历史事件或政治团体的页面。如果鹦鹉从未读过这些页面,它就永远无法告诉你这些事情。论文指出,在某些国家,政府已经在通过创建自己的“安全”书库并屏蔽其他书库来实施这种做法,从而有效地训练其 AI 去遗忘某些真相。
2. 行为教练(后训练阶段)
一旦鹦鹉读完了书,我们就需要教它如何在对话中表现。这被称为“后训练对齐”。我们向鹦鹉展示好答案和坏答案的例子,并奖励它表现得“好”。这通常是通过人类对鹦ks的回答进行评分的系统来完成的。
- 正面作用: 我们教鹦鹉拒绝回答有关如何伤害他人的问题。
- 负面作用: 如果一个霸道的独裁者或强大的科技巨头决定了什么才算“好”答案,他们就可以训练鹦鹉拒绝回答有关他们自己的问题。论文指出,一些政府要求公司使用数千个特定问题来测试其 AI,以确保其拒绝讨论敏感政治话题。这就像是在训练鹦鹉无论真相如何,都只能同意老板的观点。
3. 门口的保镖(推理时控制)
最后,即使在鹦鹉训练完成后,我们仍然可以在聊天窗口的门口放一个保镖。这是“推理时控制”。在鹦鹉的回答显示给你之前,保镖会进行检查。如果回答中包含了“禁用”词汇,保ло会拦截它并说:“我不能谈论这个。”
- 正面作用: 保镖可以阻止鹦鹉无意中说出粗鲁或危险的话。
- 负面作用: 这是最容易被滥用的工具,因为它不需要重新训练鹦鹉;你只需要更改保镖的规则。论文提到,一些领导人已经改变了他们 AI 的“保镖”规则,使 AI 能够说出符合其个人政治观点的话,或者突然拒绝回答他们不喜欢的问题。这是一种快速、廉价的手段,无需改变鹦鹉的大脑就能实现信息的噤声。
为什么这在当下至关重要
作者认为这不仅仅是未来的理论问题;它正在发生,并且正在变得越来越严重,主要基于三个原因。
首先,我们对 AI 的信任度正在提高。 数以百万计的人正开始将聊天机器人作为他们获取新闻和信息的主要来源。如果 AI 正在被悄悄编辑以隐藏真相,那么数百万人会在不知不觉中相信谎言。这就像是你最喜欢的播音员开始对着剧本朗读,而剧本只讲述了一半的故事,但由于他们听起来如此有说服力,你甚至从未产生过怀疑。
其次,少数大公司掌握着所有的钥匙。 AI 世界由一小撮庞大的科技公司主导。如果其中一家公司决定改变规则,或者政府强迫他们改变规则,那么就没有其他人可以求助了。这就像是全世界所有的图书馆都归三个人所有,而他们达成一致,要烧掉同一套书。
第三,世界正变得更加受控。 论文指出,许多国家正朝着更严格、更威权主义的方向发展。这些政府热衷于控制信息。随着 AI 变得如此强大,他们有巨大的动力利用这些对齐工具来压制异见并控制叙事。论文暗示,我们正在构建的所谓“安全”工具,最终可能成为压迫的完美工具。
我们应该怎么做?
论文并不希望我们停止构建安全的 AI。他们知道,如果没有对齐,AI 可能会在其他方面带来危险,比如帮助犯罪分子或导致事故。相反,他们希望业界对风险保持诚实。
他们提出了三个主要的解决办法:
- 透明度: 我们需要确切知道这些“过滤器”是如何构建的。如果一家公司声称其 AI 是“安全”的,独立的审计机构应该能够检查那些书籍,看看哪些信息实际上被删除了。
- 竞争: 我们需要更多种类的 AI。如果我们拥有来自不同地方、不同类型的模型,那么由一个人来控制整个对话就会变得更加困难。这就像拥有许多不同的新闻频道,以便你可以对比不同的报道。
- 意识: 我们需要教导人们保持怀疑精神。就像我们教孩子们识别假新闻一样,我们也需要教导他们 AI 是可以被操纵的。我们也需要研究人员不再仅仅说“我们完成了伦理检查”,而是真正深入思考他们的工作可能如何被误用。
总结
作者总结道,我们正在构建的“安全”工具是威力巨大的双刃剑。它们可以保护我们免受伤害,但也可能被用来锁闭真相。论文警告说,如果我们不关注谁在握着这把剑以及他们如何使用它,我们可能会在无意中构建出一台完美的未来审查机器。这是一次对所有参与 AI 领域的人的行动号召:要意识到“对齐”不仅仅是关于让机器人变得友善,更是关于决定谁有权控制全世界的信息流。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。