🤖 AI
AI Security Research Should Better Incentivize Defense Research
本文认为,由于评估标准存在偏见,人工智能安全研究在攻击研究与防御研究之间出现了偏向攻击研究的失衡,因此需要调整激励机制,以优先发展切实可行且可部署的防护措施。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,人工智能(AI)安全的世界就像一场规模宏大、 stakes 极高的“锁匠与开锁者”博弈。
在这场博弈中,存在两类研究人员:
- 开锁者(攻击研究人员):他们的工作是寻找侵入 AI 系统的方法。他们寻找门上的裂缝、撬锁,或者欺骗安全摄像头。
- 锁匠(防御研究人员):他们的工作是制造更好的锁、加固门,并创建在有人试图闯入时真正有效的警报系统。
这篇由香港理工大学张有谦撰写的论文指出,学术界对开锁者痴迷不已,却忽视了锁匠。
以下是利用简单类比对该论文主要观点的拆解:
1. 记分牌存在偏差
作者统计了在顶级安全会议上发表的论文数量。
- 发现:每有一篇关于修复安全漏洞的论文,就有大约2 到 3 篇关于如何制造或利用该漏洞的论文。
- 类比:想象一个城镇,每有一人发明更好的灭火器,就有三人撰写关于如何生火的书籍。这个城镇非常擅长理解火灾如何发生,但懂得如何有效灭火的人却越来越少。
2. 游戏规则不公平
论文指出,学术出版的“规则”使得成为开锁者比成为锁匠容易得多。
“一击即中”与“完美盾牌”问题:
- 对于攻击者:如果你能在特定条件下,一次攻破一个特定的 AI 模型,你就拥有一篇获奖论文。这就像你展示了能在特定房子里撬开一把锁。这就足以发表。
- 对于防御者:要发表论文,你必须证明你的锁能抵御所有类型的小偷,在所有类型的天气下都有效,且不会让门变慢或变丑。如果你的锁仅因一种新技巧而失效,你的论文可能会被拒稿。
- 结果:通过破坏事物来获得“胜利”比通过修复事物要容易得多。
“新玩具”效应:
- 每当一个新的 AI 模型发布(就像新的游戏主机),开锁者会立即冲上去寻找其中的漏洞。这令人兴奋且易于撰写。
- 锁匠必须等待、研究漏洞,然后构建修复方案。等到他们发表时,“新玩具”可能已经过时,而修复方案可能被视为“仅仅是在追赶”。
3. “秘密行业”的差距
论文还指出了一个隐藏的问题:行业差距。
- 类比:想象锁匠在秘密政府实验室或私营公司工作。他们实际上正在构建强大的安全系统,但由于商业秘密,他们无法谈论这些系统。
- 与此同时,大学里的开锁者却在公开场合大声宣扬他们发现的每一个小裂缝。
- 错觉:因为公众只能看到开锁者的工作,所以看起来我们没有任何防御手段。但论文警告说,即使存在秘密防御,学术界也没有分享足够的关于如何构建这些防御的知识,从长远来看,这使我们处于脆弱之中。
4. 这为何重要?
作者并非说我们应该停止研究如何破坏 AI。我们需要开锁者来发现漏洞。
- 问题:我们目前非常擅长发现漏洞,以至于那些能够以在现实世界中行之有效的方式修补漏洞的人正在减少。
- 风险:如果我们只专注于破坏事物,我们将拥有一个充满“如何破坏 AI"书籍的图书馆,却几乎没有“如何保护 AI"的蓝图。当 AI 被用于自动驾驶汽车或医疗诊断等关键领域时,仅知道如何破坏它是远远不够的;我们需要知道如何使其安全。
主要结论
该论文呼吁改变“激励结构”。
- 当前状态:该系统奖励发现漏洞(破坏事物)多于奖励修复漏洞。
- 拟议变革:我们需要将防御研究视为“一等公民”。我们需要让构建坚固盾牌变得与发现墙壁裂缝一样令人兴奋、一样受到奖励、一样易于发表。
简而言之:我们需要停止仅仅计算我们能破坏 AI 多少次,转而计算我们能成功保护它多少次。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。