LLM Harms: A Taxonomy and Discussion
本文提出了一种涵盖从预开发到下游应用的大语言模型(LLM)危害综合分类体系,倡导建立标准化的问责机制、透明度要求及动态审计系统,以指导负责任的AI发展与风险缓解。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
将大语言模型(LLMs)想象成一座庞大、超级聪明的图书馆,它几乎阅读了互联网上所有曾写下的内容。这座图书馆能够写故事、回答问题并解决问题,其表现优于几乎所有人。但是,就像一座由全世界所有书籍建成的图书馆一样,它也存在一些严重的问题。
本文就像是为这座图书馆出具的一份安全检查员报告。作者团队来自德克萨斯大学奥斯汀分校和 IBM,他们查阅了数千项研究,绘制出了一张关于这座图书馆可能出错的“地图”。他们将这张地图称为危害分类法(Taxonomy of Harms)。
以下是他们研究发现的简要概述,以通俗易懂的方式解释:
1. 施工现场(部署前危害)
在图书馆甚至尚未开门迎客之前,其建造方式就已存在问题。
- “偷书”问题(训练数据): 这座图书馆是通过抓取互联网构建的。有时,它在未获许可的情况下“偷走”了私人信件、医疗记录或受版权保护的书籍。这就像一位厨师使用了未购买或未获授权使用的食材。
- “电费账单”问题(环境): 建造这座图书馆需要消耗大量的电力和水来冷却计算机。这就像运营一家巨大的工厂,即使最终产品只是几行文字,也会留下巨大的碳足迹。
- “无偿劳工”问题(劳动): 在幕后,成千上万的人仅获得极低的报酬,负责标注数据并教导图书馆什么是“好”什么是“坏”。其中一些工人为了能让图书馆学会避免有害内容,不得不目睹可怕、暴力的内容,这对他们来说可能造成创伤。
2. 图书管理员的失误(直接输出危害)
一旦图书馆开放,图书管理员(即人工智能)有时会提供错误信息。
- “刻板印象”问题: 如果你向图书管理员询问关于“护士”的信息,他们可能只展示女性的图片,尽管男性也是护士。这座图书馆从它所阅读的书籍中学到了坏习惯,重复了关于种族、性别和残疾的陈旧偏见。
- “撒谎”问题(幻觉): 图书管理员非常自信,但有时会编造事实。他们可能会发明一种虚构的医疗药物或一个不存在的法庭案件。他们并不知道自己是在撒谎;他们只是听起来非常确信。
- “有毒”问题: 有时,图书管理员会喷吐仇恨言论或欺凌性语言,尤其是当有人诱导他们这样做时。
3. 不良行为者(滥用与恶意应用)
这座图书馆不仅仅是在犯错;有时,人们故意利用它来做坏事。
- “假新闻工厂”: 不良行为者可以利用这座图书馆在几秒钟内撰写成千上万篇假新闻文章或仇恨言论信息,淹没社交媒体以迷惑大众。
- “骗子的最佳朋友”: 骗子利用这座图书馆撰写完美的网络钓鱼邮件,这些邮件看起来足够真实,足以诱骗人们交出密码。
- “黑客的工具”: 黑客利用这座图书馆寻找计算机系统的弱点,或者窃取图书馆意外记住的私人数据。
4. 涟漪效应(社会与系统性危害)
当这座图书馆被所有人使用时,它会改变社会的运作方式。
- “工作替代”浪潮: 这座图书馆处理许多办公室工作(如撰写报告或回答客户服务电话)的速度比人类更快。这威胁到数百万人的工作,尤其是在创意领域和行政角色中。
- “民主危险”: 如果利用这座图书馆向选举中淹没虚假故事,人们将难以辨别真伪。这会破坏民主运作所需的信任。
- “贫富差距”: 只有最大、最富有的公司才负担得起建造最大的图书馆。这意味着他们控制着技术,而较小的国家或学校则被抛在后面,造成一种新型的数字不平等。
5. 高风险博弈(下游应用危害)
当人们利用这座图书馆做出严肃的、关乎生死的决策时,风险会变得更高。
- “医生助手”风险: 如果医生利用这座图书馆来诊断病人,图书馆可能会发明一种虚构的疾病,或建议一种不存在的药物。
- “教师助手”风险: 在学校里,学生可能会利用这座图书馆撰写论文而不学习任何知识,或者图书馆可能会不公平地给他们的作业评分。
- “律师助手”风险: 在法庭上,图书馆可能会引用虚构的法律,这可能导致无辜者入狱,或让有罪者逍遥法外。
我们如何解决它?(缓解措施)
该论文指出,我们不能简单地关闭这座图书馆。相反,我们需要建立多层防御:
- 红队测试(Red Teaming): 聘请“道德黑客”在图书馆公开之前尝试攻破它,找出漏洞以便修补。
- 更好的规则: 政府(如欧盟)正开始制定法律,要求公司透明地披露他们使用了哪些数据,并测试其模型的安全性。
- 动态审计: 我们需要持续不断地检查这座图书馆,而不仅仅是一次。随着图书馆学习新事物,可能会出现新问题,因此我们需要新工具来捕捉它们。
核心结论
该论文总结道,虽然这座“超级图书馆”令人惊叹且能成就伟大之事,但目前它仍是一个难以预测的变数。它有着偷窃、撒谎和带有偏见的历史。为了安全地使用它,我们需要停止将其视为魔法盒子,转而将其视为一种强大的工具,需要严格的监督、持续的检查和明确的规则,以确保它造福人类而非伤害人类。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。