AI Security Priorities: A Field-Wide Agenda
本文提出了一个优先级的、跨部门的议程,旨在推进人工智能安全,该议程分为四个关键主题,并源自专家访谈与研讨会,旨在引导协调投资与行动,以保护正处于采用速度超过安全准备程度阶段的人工智能系统及基础设施。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,计算机的世界就像一座巨大且繁忙的城市。几十年来,建造这座城市的人们一直致力于让建筑更高、道路更快。他们创造了强大的工具来解决问题、编写故事和组织数据。但最近,他们开始建造一些新东西:机器人,它们不仅仅是听从指令,而是能够真正思考下一步该做什么,能够拿起工具并在城市中自主行走。这些被称为“AI智能体”(AI agents)。
问题在于,这座城市的保安仍然穿着十年前的制服。他们知道如何锁门或用撬棍阻止小偷,但还没准备好应对一个可以撬锁、诱骗保安开门,或者在你睡觉时重写城市蓝图的机器人。这篇论文是关于一群专家——那些建造机器人的人、守护城市的人以及制定规则的人——他们意识到,机器人的进化速度与我们学习保护它们的速度之间,差距正在变得危险地扩大。他们聚集在一起,旨在弄清楚在机器人变得大到无法控制之前,我们需要做些什么来确保这座城市的安全。
这篇名为《AI安全优先级:全行业议程》(AI Security Priorities: A Field-Wide Agenda)的论文,本质上是一份由全球20多位专家共同制定的庞大待办事项清单。他们并非凭空猜测;他们采访了领导者,举行了研讨会,并根据两个维度对想法进行了排序:重要程度以及性价比(投入产出比)。他们发现,我们不能仅仅修补软件上的漏洞,我们需要一种全新的思维方式来对待安全。
以下是他们的发现,按城市中的四个主要街区进行分类:
1. 市政厅街区(策略与规则)
专家们表示,我们不能再把AI安全视为一个微小的IT问题,而应将其视为国家防御问题。他们建议政府需要一个清晰的“威慑策略”。这就像是在围栏上挂一个告示牌,上面写着:“如果你试图偷走我们的机器人大脑,我们会知道,并且我们会强力反击。”目前,坏人可能会认为他们可以在没有后果的情况下偷走这些强大的AI模型,因为规则还很模糊。论文还提到我们需要一个通用的词典。现在,一组人称之为“安全性”(safety),而另一组人称之为“安全性/安全性”(security),这会导致混乱。我们需要让所有人使用同一种语言,这样我们才能建造正确的围墙。最后,他们想要一个巨大的图书馆(“资源中心”),让任何人都能找到保护其AI的最佳工具和指南,这样我们就不用每个人都去重复造轮子。
2. 邻里守望街区(公私协作)
最强大的AI机器人是由少数几家私营公司建造的,但针对它们的威胁却来自整个国家。这就像是一个小型的邻里守望小组试图阻止一支外国军队;他们无法单打独斗。论文建议,政府和这些公司需要联手。政府拥有关于坏人的秘密情报,而公司则拥有需要保护的机器人。他们提议为从事这些机器人工作的人员创建特殊的“许可”徽章,类似于间谍获得的安保许可,以确保内部没有人在为敌人工作。他们还希望建立一条专门的热线,让公司可以在不受到惩罚的情况下分享遭受攻击的故事,这样如果一家公司被黑客攻击,其他人能立即知道如何修复。
3. 工程车间(技术安全)
这是实际建造发生的地方。论文指出,目前的工具还不够强大。他们建议使用“机密计算”(confidential computing),这就像是将AI的大脑放在一个超级安全、不可破坏的玻璃盒子里,只有AI自己能看到里面。即使黑客闯入了建筑,也无法窥视盒子里的秘密。他们还希望利用AI来编写更好的代码,希望聪明的机器人能在人类发现错误之前识别出自己的错误。另一个大想法是“红队测试”(red-teaming),这就像是雇佣一支专业的窃贼团队来尝试闯入系统。论文说,我们需要雇佣最好的窃贼,即那些思维方式像外国政府一样的窃贼,在真正的坏人出现之前测试我们的防御能力。
4. 机器人控制室(管理智能体AI)
这是最具有未来感的部分。随着机器人开始自主执行任务——比如管理电网或移动资金——我们需要新的规则。论文建议我们需要“许可框架”。想象一下一个想要买车的机器人;它不应该直接购买。它应该向人类询问:“我可以买这辆车吗?”然后由人类决定是否同意。我们还需要通过数学方法证明机器人无法做出某些危险行为,比如把公司所有的钱转给一个陌生人。论文警告说,如果我们让这些机器人不受限制地运行,它们可能会无意中(或蓄意地)攻击它们本应服务的系统。
底线
这篇论文并不声称已经解决了所有问题。事实上,它承认这只是计划的第一稿。专家们非常明确,威胁环境变化极快,今天的做法明天可能就不适用了。然而,他们坚信,如果我们现在就开始致力于这18项优先事项——建立规则、共享秘密、强化技术以及控制机器人——我们就能扭转局面。他们希望确保随着这些强大的工具成长起来,它们能保持安全、可靠并造福于所有人,而不是成为它们所服务的城市的威胁。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。