← 最新论文
💻 computer science

A Closer Look at the Existing Risks of Generative AI: Mapping the Who, What, and How of Real-World Incidents

本文通过系统分析 499 起真实世界事件,提出了一种生成式人工智能故障的新分类法,揭示出大多数危害源于影响终端用户之外利益相关者的使用相关问题,从而将生成式人工智能的风险格局与传统人工智能区分开来,并倡导采取公开披露、教育和监管等非技术性缓解策略。

原作者: Megan Li, Wendy Bickersteth, Ningjing Tang, Jason Hong, Lorrie Cranor, Hong Shen, Hoda Heidari

发布于 2026-04-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Megan Li, Wendy Bickersteth, Ningjing Tang, Jason Hong, Lorrie Cranor, Hong Shen, Hoda Heidari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将生成式人工智能想象成一个超强力、超具创造力的工厂,能够即时生产文本、图像、音频和视频。它就像一台永不休眠的魔法印刷机。但就像任何强大的工厂一样,它不仅生产商品,也会制造“事故”和“混乱”。

这篇论文本质上是对该工厂引发的 499 起真实世界事故进行的法医式调查。研究人员(来自卡内基梅隆大学)并非仅仅猜测可能出现的问题;他们查阅了海量的警方报告、新闻报道和公众投诉,以精确描绘出究竟发生了什么、谁受到了伤害以及原因何在。

以下是他们研究发现的简明拆解:

1. 最大的意外:“旁观者”问题

在大多数安全故事中,我们假设受到伤害的人是工具的使用者。如果你鲁莽驾驶,就是那个遭遇车祸的人。

但在生成式人工智能领域,研究人员发现情况往往恰恰相反。

  • 类比:想象你在参加一个派对。你决定用一支魔法画笔为朋友画一幅滑稽的画像。你(使用者)觉得这很有趣。但画中的人(旁观者)现在正被全镇的人嘲笑,或者其声誉遭到毁灭。
  • 发现:研究发现,大多数伤害并非发生在人工智能的使用者身上,而是发生在与它毫无关系的人身上——陌生人、社区或整个社会。 “使用者”往往获得了好处(乐趣、生产力),而“非使用者”却承受了创伤(诈骗、身份盗窃、混乱)。

2. 两大罪魁祸首:“故障”与“恶棍”

研究人员将事故发生的起因归类为两大类:

  • 故障(技术失败):有时人工智能就是会出错。它会产生幻觉(编造事实)、陷入混乱,或未能遵守规则。
    • 谁受到了伤害? 通常是用人工智能的人。例如,律师使用人工智能撰写法庭辩护词,人工智能编造了一个虚假案例,导致律师陷入麻烦。
  • 恶棍(恶意使用):这是最大的意外。造成伤害的最常见原因并非人工智能本身坏了,而是人们故意利用正常运作的人工智能作恶
    • 谁受到了伤害? 几乎总是旁观者。
    • 示例:有人利用人工智能制作政治人物的虚假深度伪造视频以引发骚乱,或制作同学的虚假裸照进行霸凌。人工智能完全按照设计运行;问题出在背后的人类身上。

3. “谁、什么、如何”地图

该论文构建了一张新地图(分类法)来组织这些事件:

  • 发生了什么(伤害类型):最常见的伤害类型涉及人们的自主权(被欺骗或被冒充)、政治/经济(虚假新闻左右选举或市场)以及声誉(诽谤)。
  • 如何发生(失效模式):最常见的原因是恶意使用(蓄意的不良行为者)。第二常见的是未披露的使用(在应当由人类完成的工作中使用人工智能,例如学生作弊或杂志被人工智能垃圾信息淹没)。
  • 谁受到了伤害:如前所述,“未互动”的人群(公众、深度伪造的受害者)承受了主要的损害。

4. 为何现行规则行不通

该论文认为,我们目前关于安全的思维方式存在缺陷,因为它假设工具的使用者是唯一需要保护的人。

  • 类比:这就像拥有一本锤子的安全手册,只告诉你如何不砸到自己的拇指,却只字未提如何不砸到邻居。
  • 现实:由于人工智能的使用者往往不会承受后果(受害者才会),他们就没有动力去谨慎行事。“利益”归于使用者,而“风险”却转嫁给了陌生人。

5. 我们应该怎么做?

作者提出了三项主要措施来解决这一混乱局面,侧重于人和规则,而不仅仅是更好的代码:

  1. 教育公众(人工智能素养):我们需要教育大众了解这个“工厂”是如何运作的。如果人们明白人工智能会撒谎(产生幻觉)或被用于诈骗,他们就不会盲目信任它。这将阻止一些由无知引起的“事故”。
  2. 监管“开源”的狂野西部:论文指出,许多最糟糕的工具(例如制作虚假裸照的应用程序)都是建立在任何人都可以下载和修改的“开源”模型之上的。目前的规则允许这些工具在极少限制的情况下存在。作者建议我们需要在此处实施更严格的规则,以阻止“恶棍”制造他们的武器。
  3. 追踪“纸质痕迹”(来源证明):我们需要更好的方法来辨别什么是真实的,什么是人工智能生成的。如果我们能够给人工智能内容打上标签(例如“由人工智能制作”的标签)并检测伪造内容,诈骗者散布谎言或深度伪造破坏声誉就会变得更加困难。

核心结论

生成式人工智能不仅仅是一个偶尔会出故障的工具;它是一个经常被人类武器化以伤害那些甚至未曾要求它的人的工具。解决方案不仅仅是让人工智能变得更“聪明”;而是要改变我们监管它的方式,教导公众如何识破诡计,并认识到使用技术的人并非唯一需要保护的对象。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →