✨ 要点🔬 技术摘要
想象一下,人工智能(AI)的世界就像一个巨大且繁忙的建筑工地。这里正在建造的机器功能极其强大,能够写故事、解决复杂的数学问题,甚至创作艺术。但由于这些机器还如此之新且发展极快,建造它们的人仍在摸索规则手册。在这个领域,存在着一场关于如何确保这些智能机器是“好”的辩论。有些人谈论“伦理”(ethics),这就像是一个道德指南针——一套关于对错、公平和正义的深刻问题。另一些人则谈论“安全”(safety),这更像是安全帽和安全带——防止机器失控或伤害他人的实际步骤。虽然大家都同意我们需要两者,但问题在于:究竟是谁在谈论什么,以及他们是否真的在遵循自己设定的规则?
这篇论文深入研究了 AI 世界中最大的建筑团队之一——一家名为 OpenAI 的公司。研究人员想要观察这家公司如何随着时间的推移来谈论这些宏大的概念。他们不仅仅是在听这家公司说了什么;他们扮演了数字侦探的角色,扫描了数以千计的文件、博客文章和研究论文,精确统计了该公司使用“伦理”、“安全”、“风险”和“对齐”等词汇的频率。他们将这家公司的公开声音视为一座巨大的图书馆,通过检查书架来查看哪些书被阅读得最多,而哪些书正落满灰尘。
数据讲述的故事有些令人惊讶。当研究人员查看 OpenAI 的公开网站——即他们与普通大众交流的地方时,他们发现“伦理”这个词几乎是隐形的。它出现在不到 4% 的文章中。这就像走进一间房子,主人一直在谈论“防火安全”和“紧急出口”,却从未提到过“火”这个词本身,尽管他们才是那个拿着火柴的人。事实上,“安全”一词在短短一年内出现了近 700 次,而“伦理”仅出现了 7 次。
OpenAI 的公开信息并没有使用深奥的哲学语言,而是由“安全”、“风险”和“对齐”等技术术语所主导。研究人员发现,当该公司确实使用“伦理”这个词时,它通常只是一个快速的提及,比如标题中的一个注脚或段落中的一句话,而不是一次严肃的讨论。这仿佛他们是在把这个词当作墙上的装饰,而不是建筑的工具。有趣的是,研究人员注意到该公司的标签和分类正在发生变化。有时一篇文章被标记为“伦理与安全”,但其中的文本几乎完全没有提到伦理。这表明,这些标签的变化可能是为了向公众传递不同的信号,而不是反映公司在思考道德问题时发生了深刻的变化。
然而,当研究人员查看该公司的学术论文——即那些为其他科学家编写的严肃技术文档时,情况略有不同。在这里,“伦理”出现的频率更高,出现在约 17% 的论文中。但即便是在这些严肃的文档中,这个词也经常出现在边缘位置、脚注中或简短的价值观列表中,而不是作为研究的核心焦点。研究人员认为,虽然该公司非常擅长谈论技术安全和管理风险,但它倾向于将关于“伦理”的沉重道德对话放在一旁,将其视为一种声誉勋章,而非构建机器的严格规则手册。
简而言之,这篇论文表明,OpenAI 为谈论“安全”和“风险”建立了一个非常响亮的扩音器,但在谈论“伦理”时却保持了非常安静的声音。他们并不是在忽视“行善”的概念,而是以一种侧重于技术修复和规避危险的方式来界定它,而不是关注公平和正义等更深层的问题。研究人员得出结论,这种表达方式可能会让公司看起来负责任,但也意味着关于 AI 在“对”与“错”方面究竟是什么的那些艰难且复杂的问题,正被推向背景,隐藏在技术安全话术的围墙之后。
技术摘要:竞争性的 AI 伦理愿景:以 OpenAI 为案例研究
问题陈述 本文探讨了理解领先人工智能开发者如何公开构建伦理话语的一个关键空白。尽管高层级的伦理原则(如增益、正义、自主)在学术文献中被广泛引用,但学者们认为,在面对通用人工智能系统的快速规模化时,这些原则往往无法转化为实践。作者指出,组织语言执行着“构成性工作”(constititive work),即定义了什么才算作负责任的做法,以及哪些风险被置于显著位置。然而,很少有研究能够纵向追踪特定开发者如何部署显性的“伦理”(ethics)词汇,并将其与相邻的、通常更具技术性或管理性的术语(如“安全/safety”、“对齐/alignment”和“风险/risk”)进行对比。核心研究问题在于调查 OpenAI 的公共话语如何随时间利用这些概念,以及这反映了实践中伦理框架的何种信号。
研究方法 本研究采用混合方法,分析了从 2015 年 12 月到 2025 年 7 月的 OpenAI 公共传播内容。研究设计结合了用于大规模模式识别的计算文本分析,以及用于捕捉上下文细微差别的定性审计。
案例选择: 基于四个标准选择 OpenAI:前沿 AI 开发(基础模型)、持续参与伦理话语、通过公共存档实现的跨时间可追溯性,以及显著的规模/影响力(超过 10^23 FLOPs)。
语料库构建: 数据集包含来自 OpenAI 主要公共渠道的 454 份文件:
网络文章 (n=424): 收集自 OpenAI.com 的新闻(News)和研究(Research)板块。
出版物 (n=30): 包括 25 篇 arXiv 预印本和 5 篇由 OpenAI 撰写或共同撰写的站内托管项目(PDF/HTML 报告)。
预处理: 文本经过标准化处理(转为小写、词干提取、停用词去除)并排除了副文本元素(脚注、参考文献),以专注于实质性内容。
定量分析:
关键词频率: 追踪了一个包含 75 个核心概念的库,以衡量“伦理”、“安全”、“风险”和“对齐”等术语的年度出现频率。
主题建模: 采用一种无监督方法,利用 N-gram 向量表示(通过 all-MiniLM-L6-v2 SentenceTransformer)和基于密度的 HDBSCAN 聚类,在不预设聚类数量的情况下识别涌现的主题结构。
定性分析: 对包含“ethic-”项或特定标签(如“伦理与安全/Ethics & Safety”)的文档子集进行了系统性的手动审计。研究人员针对术语频率、位置(标题、摘要、正文)和框架进行编码,并将这些发现与计算数据进行交叉验证,以确保覆盖范围并解决差异。
主要贡献
纵向话语分析: 本文提供了对单一前沿 AI 开发者的稀缺的时间序列分析,区分了面向普通受众的沟通(网络文章)与面向学术受众的沟通(出版物)之间的差异。
方法论整合: 展示了一种结合关键词频率追踪、基于 NLP 的语义聚类以及人工定性审计的稳健工作流,用以验证计算发现。
可复现数据: 作者发布了其代码和数据流水线,以确保其话语建模结果的可复现性。
结果 分析揭示了“伦理”术语与相邻概念之间存在明显的频率分歧,同时也显示了网络文章与学术出版物之间的话语差异。
“安全”与“风险”的主导地位: 在 OpenAI 的公共网络文章中,“安全”(safety)和“风险”(risk)主导了话语。在 2024 年,“安全/安全性”(safe/safety)的提及次数接近 700 次,而“风险”(risk)在同年出现了 386 次。相比之下,显性的“伦理”(ethics)引用非常罕见,仅出现在 3.8% 的网络文章中(424 篇中的 16 篇),且在 2024 年的峰值仅为 7 次。
时间偏移: “对齐”(alignment)和“治理”(governance)等术语分别在 2019 年和 2023 年之后才开始出现,反映了向技术性和制度性框架的转变。“负责任”(responsible)在 2023 年后出现了激增。
表象化使用: 定性分析表明,当“伦理”出现在网络文章中时,其用法往往是极简且表象化的(例如,仅出现一次或作为“伦理标准”之类的固定短语)。它更多地作为一种修辞手段,而非持续性的分析框架。
标签与内容的差异: 元数据标签与实际内容之间存在差异。虽然有 52 篇研究文章被标记为“伦理与安全”(Ethics & Safety),但其中仅有 7 篇在正文中包含“伦理”一词。研究发现标签惯例会随时间动态变化(例如,文章从“安全与对齐”重新标记为仅为“安全”)。
出版物的细微差别: 在 OpenAI 撰写的出版物中,“伦理”的使用率较高(17.2% 的文档),但仍然频繁度较低。当出现时,它通常出现在外部引用、政策指南或边缘性框架(页眉、图表)中,而非作为核心分析焦点。诸如“偏见”(bias)、“伤害”(harm)或“歧视”(discrimination)等术语很少与“伦理”共现,且其框架属于技术或声誉层面,而非道德层面。
意义与主张 本文主张,OpenAI 的公共话语呈现出一种“话语收缩”(discursive narrowing),即安全和风险管理框架已有效地取代了更广泛的伦理词汇。作者认为,这种模式暗示了“伦理洗白”(ethics-washing)现象,即伦理语言成为一种声誉资产或传播层,而非约束决策的约束性条件。
研究得出结论,领先 AI 开发者的语言选择重新分配了认识论权威,优先考虑技术和管理概念(安全、对齐、治理),同时边缘化了明确的政治或正义导向的语言。这种框架通过将“负责任的发展”主要定义为风险缓解和灾难性场景的视角来塑造规范,可能掩盖了更近期的伦理问题,如劳动力流失。作者将这些发现作为对治理的影响提出,强调了行业实践中高层级伦理原则与操作性词汇之间的差距。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。