NeurIPS Should Require Reproducibility Standards for Frontier AI Safety Claims
本立场文件主张,NeurIPS 必须为前沿人工智能安全主张强制规定可复现性标准,并提出一个三级披露框架,以应对当前因关键材料被隐瞒而导致最具重大意义的断言反而最难以验证的“证据倒置”现象。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:一家公司建造了一台极其强大的新机器。在向公众出售之前,他们发布了一份报告,声称:“别担心,这台机器是安全的。它不会伤害任何人。”
根据这篇论文,问题在于,该公司往往拒绝展示他们是如何测试这台机器的。他们只给你最终得分(例如"99% 安全!”),却隐藏了测试题目、评分规则和机器的设置。他们说:“相信我们,我们检查过了。”
这篇论文的作者认为,NeurIPS 会议(计算机科学家的主要聚会)需要改变规则。他们提出:“如果你想要发表关于超级强大 AI 的安全声明,你就必须证明它。如果你无法展示你的工作过程,你就不能提出这一重大声明。”
以下是他们提案的分解,使用简单的类比:
1. 问题:“证据倒置”
通常,在科学中,一个声明越重大、越重要,你就需要越多的证据来支持它。
- 正常科学:如果一位科学家说“我发现了一颗新行星”,他们必须展示望远镜数据,以便其他人也能查看。
- AI 安全(问题所在):如果一家公司说“这个 AI 足够安全,可以运行电网”,他们往往会隐藏数据。
作者将这种现象称为"证据倒置"。这就像一位魔术师声称他的戏法无害,却拒绝让人看牌组。论文认为,这是科学的失败,而不仅仅是缺乏透明度。
2. 解决方案:三级“交通信号灯”系统
作者知道,有时展示“牌组”(测试数据)是危险的。如果你展示如何破解一个安全系统的确切方法,不良行为者可能会学会这样做。
因此,他们提出了一个三级系统(像交通信号灯一样),规定必须共享多少信息:
🟢 一级(绿灯 - 公开):
- 何时:测试数据可以安全地向所有人展示。
- 规则:你必须发布所有内容:你向 AI 提出的问题、你使用的代码以及结果。任何人都可以重新运行测试。
- 结果:完全信任。该声明得到充分支持。
🟡 二级(黄灯 - 受控):
- 何时:向公众展示数据将是危险的(例如,它会教人们如何黑客攻击),但受信任的专家可以安全地查看它。
- 规则:你不向公众发布数据。相反,你将数据交给一个秘密的受信任独立专家小组(类似于私人安全许可)。他们在幕后检查工作,并给出“通过”或“不通过”的结论。
- 结果:该声明得到支持,但附带说明:“我们私下检查了这一点,但你无法查看原始数据。”
🔴 三级(红灯 - 受限):
- 何时:即使是秘密小组也无法查看数据,因为它太危险了(例如,测试涉及制造生物武器模拟)。
- 规则:你仍然可以撰写论文,但你不能做出"AI 足够安全可以发布”的重大声明。你只能说:“我们尝试测试了这一点,但数据过于敏感。”
- 结果:声明被“正确缩放”。你不能利用这篇论文来证明向全世界发布 AI 是合理的。
3. “声明清单”(收据)
为了确保公司不作弊,论文建议作者必须填写一种新表格,称为声明清单。
- 这就像商店里的收据。
- 作者必须列出他们提出的每一项安全声明。
- 在每个声明旁边,他们必须勾选一个框:“我们是否展示了数据?我们是否让秘密小组检查了它?还是说展示数据太危险了?”
- 如果他们勾选“太危险”但没有正当理由,论文将被拒稿,或者该声明将被削弱。
4. 为什么是 NeurIPS?
作者选择 NeurIPS 是因为它是 AI 研究的“奥运会”。
- 目前,公司喜欢在 NeurIPS 发布他们的安全报告,因为这赋予了他们的声明科学合法性。这让公众和政府信任他们。
- 论文认为:“如果你想要金牌(在 NeurIPS 发表),你就必须遵守规则。你不能只说自己安全;你必须证明它,要么公开证明,要么向受信任的裁判证明。”
5. 如何阻止作弊
作者预见到,一些公司可能会试图利用系统(例如,声称他们的数据“太危险”,只是为了隐藏它)。
- 解决办法:他们提出了一个联邦审查系统。想象一下,有一组不同的“安全许可”(如不同的国家安全研究所或独立实验室)。如果一家公司说他们的数据对 NeurIPS 来说太敏感,该小组中的一位中立专家将对此进行检查。
- 如果专家说“不,这实际上并没有那么危险,你应该展示它”,公司就必须展示它。如果他们拒绝,论文将被拒稿。
总结
这篇论文是对 AI 社区的行动呼吁:停止接受“相信我们”作为安全的证明。
如果你声称一个强大的 AI 是安全的,你必须做到以下之一:
- 向所有人展示你的工作。
- 让受信任的独立裁判在秘密中检查你的工作。
- 如果你两者都无法做到,就承认你尚未证明它是安全的,并且不要利用你的论文来证明向公众发布 AI 是合理的。
目标不是阻止 AI 发展;而是确保当我们说“这是安全的”时,我们实际上拥有证明它的“收据”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。