Empirically Derived AI Harm Profiles and the Case for Context-Sensitive Moral Responsibility
本研究通过分析849起人工智能事件,实证地推导出三种截然不同的伤害特征谱系——自主/具身型、视觉识别型以及生成式人工智能型——并主张从广泛的治理原则转向一种上下文敏感型框架,从而针对这些特定的风险模式量身定制问责与监测机制。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人工智能不再是一个遥远的承诺,它已成为一种日常现实,正在影响着我们的安全、工作、隐私以及获取服务的途径。当这些系统正常运作时,它们能简化我们的生活;而当它们失效时,后果可能非常严重,从身体伤害到剥夺公民权利不等。多年来,专家们一直试图利用公平、透明和安全等宏观伦理原则来治理这些技术。然而,这些高层级的理念往往难以转化为适用于现实世界中复杂多变的AI实际应用场景的具体规则。一个关键的挑战在于理解不同类型的AI在特定情况下是如何失效的。一辆发生碰撞的自动驾驶汽车,与一个传播虚假信息的聊天机器人,或者一个误识别嫌疑人的面部识别系统,其问题类型是一样的吗?为了回答这个问题,研究人员开始将记录在案的失败案例视为不仅仅是孤立的事故,而是可能揭示更深层模式的数据点。
来自坎伯兰大学(University of the Cumberlands)的一个研究小组致力于通过检查大量现实世界的AI事件来寻找这些模式。他们从一个名为AIAAIC Repository的公开数据库中收集了849起记录在案的AI失效案例,该数据库追踪涉及人工智能、算法和自动化的事件。研究人员并没有将每个事件视为一个独特的故事,而是分析了这些失效如何根据技术类型、使用场景、预期功能以及造成的伤害类型进行聚类。他们的目标是观察这些个体事故的混乱状态是否可以被组织成几个清晰的类别或“伤害剖面”(harm profiles),从而帮助监管机构和公司建立更具体、更有效的监督规则。
分析显示,AI的失效并非随机发生的。它们倾向于围绕两个主要的结构性主题进行分组。第一个主题区分了直接与物理世界交互的系统与主要处理信息的系统。第二个主题则将旨在识别和监测人员的系统与旨在生成内容的系统区分开来。通过绘制这些关系图,研究人员识别出了当问题发生时会出现的三个清晰且反复出现的伤害剖面。
第一个剖面是研究人员称之为“自主或具身AI”(Autonomous or Embodied AI)的类别。这些系统具有物理存在感,并可能造成直接的身体伤害,例如自动驾驶汽车或机器人。在数据中,这些失效几乎总是发生在交通运输领域。当这些系统失效时,结果通常是安全故障:汽车碰撞、机器人故障或人类操作员失去控制。这里的风险是即时的且物理性的,影响着乘客、行人及应急响应人员的安全。由于后果是切实的且危险的,研究人员建议针对这类系统的治理必须侧重于操作安全、硬件与传感器的严格测试,以及明确发生物理事故时的责任归属规则。
第二个剖面是“视觉识别”(Vision Recognition)。这一类别包括使用摄像头和软件来识别人员的系统,例如执法部门或安全机构使用的面部识别技术。数据显示,该领域的失效集中在司法和执法部门。与第一组的物理碰撞不同,这里的伤害与公民权利和歧视深度相关。最常见的问题涉及系统误识人员(特别是特定人口统计学群体中的人员),或以超出法律边界的方式进行监控。研究人员发现,这些失效创造了一种不同的风险:对隐私、公平性以及免受错误指控权利的威胁。因此,针对该剖面的治理需要侧重于防止偏见、确保系统使用的透明度,并为人们质疑错误识别提供清晰的路径。
第三个剖面是“生成式AI”(Generative AI)。这是开发文本、图像和其他媒体工具背后的技术。数据显示,此类失效在媒体和信息领域最为常见。与前两组相比,与之相关的伤害是截然不同的;它们极少涉及身体伤害或直接监控。相反,问题围绕着信息的质量和真实性展开。失效形式包括创建具有说服力但虚假的内容、冒充真实人物,以及传播可能损害名誉或操纵公众舆论的虚假信息。由于风险在于信息的完整性而非物理安全或即时监控,研究人员认为,针对这一组别的监管应侧重于验证内容来源、监控欺骗性输出,并确保创作者和平台对其系统产生的内容负责。
有趣的是,研究人员发现一种常见的AI能力——“预测性监测”(predictive monitoring)——并未形成独立的组别。预测性监测是指分析数据以预测未来事件的系统,例如预测犯罪、贷款违约或健康状况。研究表明,这些系统之所以没有聚类在一起,是因为它们的风险完全取决于其应用场景。用于医疗领域的预测系统所面临的伦理挑战,与用于招聘或金融领域的预测系统完全不同。这一发现表明,预测性监测并不是一种单一的风险类别,而是一种会随着其进入的环境而改变特征的工具。如果一个预测系统被用于执法环境,它就会继承“视觉识别”剖面的风险;如果用于金融领域,它就会继承其他剖面的经济风险。这意味着,针对这些系统的规则不能是“一刀切”的,必须根据其进行的预测的具体语境进行定制。
基于这些发现,研究人员提出了一种新的AI治理方式。他们建议,监管机构和公司不应将同样的宽泛规则应用于所有人工智能,而应首先识别一个系统属于哪种伤害剖面。一旦系统被分类,就可以应用特定的监控、审计和责任分配规则。例如,自动驾驶汽车将受到严格的安全审计和物理险情即时报告的要求。面部识别系统将被要求定期进行种族偏见检查,并为公民提供申诉误识别的清晰渠道。生成式AI平台则需要证明其内容的真实性,并具备快速移除有害虚假信息的机制。
这种方法将AI治理从抽象原则转向了具体行动。它承认,机器人的失效与聊天机器人的失效有着本质的区别,且负责修复它们的人员也应当不同。通过观察AI失效的实际历史,研究人员为构建一个更具上下文敏感性的监督体系提供了地图。他们认为,这种方法使社会能够在不陷入泛泛而谈的情况下,应对每种技术类型的特定危险,从而确保我们制定的规则与技术本身一样实用且精准。研究结论指出,通过将记录在案的事件视为一种资源而非仅仅是对过去错误的记录,我们可以建立一个基于对现实世界影响的理解来进行AI治理的未来,使这项技术对每个人来说都更加安全且更具问责性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。