Comprehensive AI governance requires addressing non-model gains
本立场文件认为,有效的人工智能治理必须超越传统的模型层面范式,转而应对“非模型增益”——例如推理、系统和资产层面的改进——这些因素正日益驱动能力的提升,并削弱预部署风险管理策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是该论文的通俗易懂版解释。
核心思想:不再仅仅关乎引擎
想象一下,你正在试图监管汽车的速度和安全性。长期以来,主要的规则是:“如果你造出了更好的引擎(AI 模型),你就能预测这辆车会跑多快。”
这就是论文中所说的模型级治理(Model-Level Governance)。它假设一辆车的速度几乎完全取决于引擎的大小和制造它所消耗的燃料。因此,监管机构的重点是在引擎离开工厂之前对其进行检查。
论文的警告:
作者认为,这种旧的思维方式正变得越来越无效。为什么?因为汽车的速度不再仅仅取决于引擎。它越来越多地取决于你在买到引擎后对它做了什么。
他们将这些新的速度提升称为**“非模型增益”(Non-Model Gains)**。即使引擎保持不变,通过更换轮胎、增加涡轮增压器或在更好的赛道上行驶,你也能让汽车跑得极其危险。论文指出,我们需要监管这些附加组件和驾驶条件,而不仅仅是引擎。
“超级充电”汽车的三种方式(非模型增益)
论文指出了三种人们可以在不改变原始模型的情况下,让 AI 变得更加强大的具体方式:
1. 推理增益(Inference Gain):“更用力地踩油门”
- 类比: 想象一台标准的汽车引擎。通常情况下,它以恒定的速度运行。但如果你能在驾驶过程中更长时间地踩下油门,或者使用特殊的混合燃料来让它冲刺呢?
- 现实情况: 这就是推理增益。这意味着在 AI 工作时(测试时)给予它更多的计算能力。
- 为什么重要: 如果你给一个较小的、廉价的 AI 模型足够的时间和动力去“思考”得更深入,它突然间就能表现得像一个庞大且昂贵的模型一样。这使得阻止坏人变得困难,因为他们不需要一个超级昂贵的引擎;他们只需要更用力地踩下油门即可。
2. 系统增益(Systems Gain):“打造更好的底盘和工具”
- 类比: 你拿了一辆标准汽车,并在它周围建造了一个定制的车架。你增加了后备箱里的机械臂,一个能与其他车辆通信的 GPS,以及一个能在你驾驶时自动修理引擎的计算机。
- 现实情况: 这就是系统增益。它是指将 AI 包装在一个由工具、其他软件或协同工作的 AI 智能体组成的“脚手架”中。
- 为什么重要: 一个基础的 AI 可能不知道如何黑入电脑。但如果你构建了一个系统,给了这个 AI 一把“螺丝刀”(扫描代码的工具)和一个“地图”(漏洞数据库),那么这种组合就会变得非常危险。论文指出,与昂贵的引擎相比,这些“工具包”的构建成本很低且易于分享。
3. 资产增益(Asset Gain):“在秘密赛道上行驶”
- 类比: 想象一辆在普通赛道上很安全的赛车。但随后,政府给了这辆同样的车进入一条拥有特殊燃料和武器的秘密高科技军事赛道的权限,而这些东西是其他人无法获得的。
- 现实情况: 这就是资产增益。当 AI 与受限的、秘密的或专门的资源(如机密政府数据、生物样本或军事硬件)相结合时,就会发生这种情况,而这些资源是原始创造者所没有的。
- 为什么重要: 你无法在普通的实验室里测试这种风险,因为“秘密赛道”并不存在于那里。一个在公开测试中看起来安全的模型,如果被坏人赋予了访问秘密数据库的权限,就可能变成一种武器。
未来:会学习并自动驾驶的汽车
论文还警告了三种让“仅关注引擎”的监管变得更加困难的未来趋势:
- 具身化(Embodiment,让汽车长出腿来): 将 AI 置于机器人内部。如果 AI 产生幻觉(犯错),它就不再只是屏幕上的错误答案,它可能会物理性地击中人类或损坏机器。
- 持续学习(Continual Learning,让汽车在驾驶中学习): AI 在离开工厂后会不断学习新事物。一辆在第一天很安全的汽车,到了第十天可能会学会坏习惯。
- 扩散(Diffusion,交通拥堵效应): 当数百万辆这样的 AI 汽车同时在路上行驶时,它们可能会开始以奇特的方式相互作用。其中一辆车的错误可能会引发连锁反应(比如金融崩溃),而这种反应并非由单一车辆本身造成的。
解决方案:一套新的规则手册
由于我们不能再仅仅检查引擎,论文建议我们需要一个多层级的安全网。可以将其想象为监管整个高速公路系统,而不只是监管汽车:
- 系统治理(System Governance): 监管那些围绕 AI 构建“工具包”和“框架”的人,而不只是 AI 的创造者。
- 实体治理(Entity Governance): 监管公司本身。它们是否有良好的安全文化?它们是否负责任?
- 智能体治理(Agent Governance): 监管 AI“智能体”之间如何交流。如果两个 AI 开始串通违规,谁来负责?
- 云端治理(Cloud Governance): 监控“加油站”(云服务器)。如果有人正在利用巨大的能量进行危险的计算,云服务提供商应该能够察觉。
- 社会韧性(Societal Resilience): 这是最重要的一点。即使我们有完美的规则,事故也会发生。我们需要建立一个足够强大、能够在出事时生存并恢复的社会(例如拥有更好的医院或应急计划)。
总结
论文并不是说我们应该停止检查引擎。它的意思是,仅仅检查引擎已经不够了。
如果我们只关注模型(引擎),我们就会忽略来自我们附加的工具、我们喂给它的秘密数据,以及它在驾驶过程中学习方式所带来的危险。为了保持安全,我们需要监管整辆汽车、驾驶员、道路以及围绕它的整个社区。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。