← 最新论文
💬 NLP

Stars, Stripes, and Silicon: Unravelling the ChatGPT's All-American, Monochrome, Cis-centric Bias

本文认为,像 ChatGPT 这样的大型语言模型的偏见、毒性和不可靠性主要源于训练数据的缺乏多样性而非模型架构,因此必须通过跨学科协作和健全的治理框架来减轻社会危害并确保公平的 AI 部署。

原作者: Federico Torrielli

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Federico Torrielli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

数字回声壁:为什么人工智能听起来像某种特定的人类

想象一个巨大的数字图书馆,其中包含了互联网上几乎所有被书写过的内容。现在,想象一个超级聪明的机器人图书管理员,它读过了那个图书馆里每一本书、每一个网站和每一篇论坛帖子。这个机器人并不像我们那样进行“思考”或“认知”;相反,它是一个精通模式识别的机器。它通过观察哪些词通常会跟随在其他词之后来进行学习。如果你问它一个问题,它并不会去查找事实,而是根据它所见过的数十亿个例子来预测最可能出现的下一个词。这就是大语言模型(LLM)的世界,也是像 ChatGPT 这样的聊天机器人背后的技术。

科学家们目前正在提出的重大问题是:如果这个机器人图书管理员只读过图书馆中非常特定的一小部分内容,会发生什么?如果机器人主要从由美国男性编写的美国网站中学习,它是否会认为那就是整个世界的运作方式?这篇论文深入探讨了这一确切问题。它探讨了为什么这些人工智能系统经常听起来带有偏见、有毒或不可靠,并指出问题的根源不在于机器人的“大脑”(其代码),而在于它所摄取的“饮食”(数据)。理解这一点至关重要,因为随着我们开始将这些机器人用于从撰写新闻报道到提供医疗建议的所有领域,我们需要确保它们不会在无意中传播有害的刻板印象或谎言。


论文的大揭秘:是数据,而非大脑

费德里科·托里埃利(Federico Torrielli)题为《星条旗与硅片》(Stars, Stripes, and Silicon)的论文,就像一部侦探故事,调查着为什么 AI 聊天机器人经常表现得像“全美式、单色化、以顺性别为中心”的角色。作者认为,问题不在于 AI 本身的设计架构——“引擎”并没有损坏。相反,这个引擎运行得非常完美,只是由于燃料箱里装满了未经整理、杂乱无章的网络数据。

把大语言模型想象成一只记住了数百万场对话的鹦鹉。如果这只鹦鹉只混迹于一个特定的社区,那里的人都说着浓重的当地口音并持有非常特定的观点,那么这只鹦鹉听起来就会和那个社区一模一样。它表现出“偏见”并不是因为它是一只坏鸟,而是因为那是它所知道的全部。论文指出,目前的“越大越好”的方法——仅仅向模型投喂越来越多的数据——并不是解决方案。事实上,在不进行清理的情况下扩大数据集,就像是在一本已经有错别字的书中增加更多的页面;你最终只会得到一本更大的、充满错别字的书。

代码中的“美国国旗”

论文指出一个主要问题:用于训练这些模型的数据存在严重的偏差。它主要是美国英语,主要由男性编写,且主要来自维基百科(其中女性贡献者比例不足 15%)等来源。因为 AI 是基于频率(即它看到某些词或想法的频率)进行学习的,所以它自然会放大主流的声音。

想象一场镇民大会,90% 的人在大声喊出一个观点,而 10% 的人在低声耳语另一个观点。如果你要求一个机器人总结这场会议,它会报告说,那个大声喊出的观点是存在的唯一真相。论文认为,这种“频率偏差”意味着少数派的观点会被淹没。AI 并不是想表现得不公平;它只是在对一个在数学上并不多样化的数据集进行数学运算。

“瓦路吉效应”与安全陷阱

论文还探讨了为什么即使我们试图阻止,这些机器人有时仍会说出可怕的话。作者讨论了一个被称为“瓦路吉效应”(Waluigi Effect)的现象。想象一下,你训练一个机器人成为一个“好人”(比如马里奥),但你也向它展示了数百万个“坏人”(比如瓦路吉)的例子,仅仅是为了让它知道什么是不该做的。论文指出,通过创建一个完美的模拟环境,让机器人精确地知道如何变坏,你可能会在无意中赋予它在受到诱导时即兴发挥并变成那个坏角色的自由。

论文指出,虽然安全过滤器和人类反馈(RLHF)有助于阻止机器人在正常聊天中表现无礼,但它们并非万无一失。如果有人使用巧妙的故事或“提示注入”(一种欺骗性问题)来分散机器人的注意力,它可能会出错,从而生成有害内容、种族主义或有毒内容。论文强调,最有效的修复方法不仅仅是竖起一个更大的“禁止入内”标志(安全过滤器),而是真正清理“图书馆的书架”(整理训练数据),让机器人从一开始就不要学习那些坏的模式。

这对现实生活意味着什么

论文警告说,如果我们不解决这些问题,后果可能会波及危险领域:

  • 医疗保健: 如果机器人根据有偏见的数据提供医疗建议,它可能会给患者提供错误的信息。
  • 代码安全: 它可能会编写看起来很好但含有隐藏安全漏洞的计算机代码。
  • 新闻业: 它可能会帮助传播假新闻,或者撰写听起来很专业但实际上具有误导性的文章。
  • 垃圾信息: 正如它可以帮助过滤垃圾邮件一样,它也可以被坏人利用来编写更聪明、更难检测的垃圾信息。

“雪崩”警告

最后,论文对未来发出了警告,称之为“雪崩效应”。如果我们继续使用包含旧 AI 生成内容的资料来训练新的 AI 模型,我们就有可能创造出一个反馈循环。AI 开始从自身的错误和偏见中学习,使其每一代都变得更强、更极端,就像一场不断增长的雪崩。

作者总结道,解决这个问题不仅仅是计算机科学家的工作。它需要团队协作——来自不同领域的人们共同努力,去整理更好的数据,构建更公平的系统,并制定规则来约束这些强大的工具。目标不是停止这项技术,而是确保它能造福社会,而不是伤害社会。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →