Multi-Agent LLMs as Ethics Advocates for AI-Based Systems
本文提出并评估了一个具有伦理倡导者智能体的多智能体大语言模型框架,该智能体能够有效地为人工智能系统起草伦理需求,尽管文章也强调了为确保可靠性而持续进行人工监督的必要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在制造一个机器人,但不仅仅是任何一个机器人——它是一个能帮助医生诊断疾病、决定谁能获得贷款或为聋人翻译手语的机器人。在按下“启动”按钮之前,你必须为它编写一本规则手册。这本规则手册被称为“需求工程”。它就像房子的蓝图;如果蓝图说“在这里放一扇窗户”,建造者就会在那里放一扇窗户。但如果蓝图忘了说“确保窗户不要太大,以免让飓风灌进来”怎么办?在人工智能(AI)的世界里,这些缺失的规则被称为“伦理需求”。它们是告诉 AI 要公平、透明和善良,而不是带有偏见或隐瞒真相的指令。
问题在于,编写这些伦理规则很难。这通常需要一场由许多不同领域的人员——工程师、律师、社区成员——参加的大型会议,进行数小时的争论和头脑风暴。这既缓慢又昂贵,而且有时因为大家都很疲惫,最重要的伦理规则会被遗忘。这篇论文提出了一个大问题:我们能否使用一组超级聪明的计算机大脑,也就是“大语言模型”(LLMs),来充当“道德监督员”,从而更快地编写这些规则?把它想象成雇佣了一组 AI 侦探,在你在开始建造之前,去检查你的机器人蓝图并大喊:“嘿,你忘了检查这是否公平了!”
AI 侦探团队
研究人员 Asma Yamani、Malak Baslyman 和 Moataz Ahmed 构建了一个名为 MALEA(多智能体 LLM 伦理倡导者)的系统。他们并没有要求一台计算机完成所有的思考,而是创建了一个由四个 AI 智能体组成的虚拟团队,每个智能体都有特定的职责,像一群正在一起编辑故事的朋友一样协同工作。
首先是需求工程师,他负责将一个简单的系统描述(例如“一个识别虚假评论的应用”)转化为初始规则。接下来,质量保证智能体扮演严厉编辑的角色,检查规则是否清晰且合乎逻辑。随后是全场的明星:伦理倡导者。这个智能体的唯一任务就是审视规则并说:“等等,这公平吗?隐私怎么办?如果有人受伤了怎么办?”最后,文档助手会将所有内容整齐地记录下来。
这些智能体并不只是排队工作,它们在一个循环中相互交流。工程师写下一条规则,质量智能体修正语法,伦理智能体进行道德批判,然后工程师回到原点进行修正。它们不断地把球传给对方,直到所有人都认为规则没问题为止。研究人员在两个现实场景中测试了这支团队:一个用于识别阿拉伯语虚假在线评论的系统,以及一个将沙特手语翻译成文本的应用。
研究发现
当研究人员将他们的 AI 团队与人类专家以及单个 AI 计算机进行比较时,结果呈现出一种“哇!”与“哎呀!”并存的状态。
在虚假评论检测器的案例中,人类专家在 3�分钟的会议中发现了 8 条伦理规则。单个 AI 计算机找到了大约 6 条(召回率为 75%),而 MALEA 团队找到了 7 条(召回率为 87.5%)。AI 团队比人类更好地捕捉到了错误。例如,人类漏掉了一条关于追踪“假阳性”(即真实评论被错误标记为虚假的现象)的规则,但 AI 团队增加了一项关于季度报告的要求,以追踪这些错误。
在手语应用场景中,人类专家发现了 13 条规则。单个 AI 找到了大约 8 条(62%),而 MALEA 团队找到了大约 7 条(54%)。在这里,人类专家在捕捉特定技术细节(如需要响应时间低于 5 秒)方面表现得略好。然而,AI 团队在提出人类从未想到的“新想法”方面表现出色。AI 团队提出了诸如“审计匿名化”(以一种可检查的方式隐藏用户身份)和特定的加密标准(如 TLS 1.3)等概念,而人类完全忽略了这些。
论文指出,AI 团队非常擅长通过广泛的思路进行头脑风暴,并将模糊的规则变得非常具体。例如,与其仅仅说“保护数据安全”,AI 团队会写成“使用 AES-256 加密”。但论文也警告说,AI 并非完美。有时它会遗漏特定的文化细微差别或弄错数字。在一次运行中,AI 注意到沙特女性佩戴不同类型的头饰,并建议训练数据应包含每种类型视频的具体数量。但在另一次运行中,它完全忘记了这个细节。这表明 AI 就像一个富有创造力的作家,有时会记住一个细节,有时又会忘记。
结论:是得力的助手,而非替代品
主要的启示是,这种多智能体系统是一个能够快速生成伦理规则“初稿”的强大工具。它可以比单个计算机产生更多的想法,并且比单个计算机更具具体性,而且它经常能捕捉到人类在短时间会议中可能忽略的东西。然而,研究人员非常明确地表示:这并不取代人类。
AI 擅长提出建议,但它需要人类来说:“是的,这是一个好主意,”或者“不,这不符合我们的文化。”该系统甚至留下了许多“占位符”(如 [在此处插入数字]),以提醒工程师他们需要填入具体的细节。论文认为,我们不应该试图完全自动化伦理,而是应该利用这些 AI 团队来加速过程,这样人类就可以把更多时间花在讨论那些困难且重要的核心问题上,而不是仅仅编写基础规则。
简而言之,论文建议,AI 智能体团队可以作为一个极佳的“道德头脑风暴伙伴”,帮助我们构建更安全、更公平的 AI 系统,但前提是我们必须保持“人在回路”中,由人类做出最终裁决。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。