Governed Metaprogramming for Intelligent Systems: Reclassifying Eval as a Governed Effect
本文提出“受控元编程”,这是一种语言设计,它将无限制的 `eval` 原语重新归类为一种受控效应,要求在将符号形式实例化为可执行代码之前进行结构检查并符合策略,从而确保自修改人工智能系统中的安全性与权限控制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一个非常聪明的机器人助手,它可以编写自己的指令。它可以审视一个问题,思考它,然后为自己敲出一套新的规则来遵循。
在旧有的编程世界中,如果这个机器人编写了一套新规则,计算机只会说:“好的,我立刻运行它们。”它不会问:“等等,这些规则安全吗?它们试图窃取你的银行密码吗?它们试图删除你的文件吗?”计算机将把书面文字转化为行动的行为视为一个总是奏效的魔法按钮。
这篇论文认为,对于能够自我重写的 AI 系统而言,那个“魔法按钮”是危险的。作者艾伦·L·麦卡恩(Alan L. McCann)提出了一种处理此问题的新方法,称为受治理的元编程。
以下是核心思想,通过简单的类比分解说明:
1. 问题所在:“魔法按钮”已失效
将计算机程序想象成一份食谱。
- 代码:书面食谱(食材和步骤)。
- 执行:烹饪这顿饭的行为。
在传统系统中,如果你在一张纸上写下一份新食谱,你可以立即把它交给厨师,厨师就开始烹饪。从纸张到烹饪的过渡是瞬间且无限制的。
但在现代 AI 中,“厨师”(AI)可以在烹饪过程中编写新食谱。如果 AI 编写了一份写着“吃掉整个厨房”的食谱,而系统只是让它立即开始烹饪,灾难就会发生。论文将这种过渡称为权威放大。这是指一张纸(数据)突然获得改变现实世界(执行)的权力的时刻。
2. 解决方案:食谱的“保安”
论文建议,我们不再将把食谱转化为饭菜的行为视为一个简单的计算机函数。相反,我们将其视为一种受治理的效应——一种需要保安批准的特殊行动。
该系统引入了一个名为机器形式(Machine Forms)的新概念。
- 机器形式就像是食谱的蓝图或图表。它们仅仅是数据。它们无法烹饪任何东西,无法拨打电话号码。它们只是指令的图像。
- 操作蓝图(在蓝图上绘图、擦除线条、组合两张蓝图)是安全的。这就像孩子玩乐高积木。仅仅移动塑料积木不会造成任何现实世界的损害。
3. 关键步骤:“具象化”
那个危险的瞬间被称为具象化(Materialization)。这是你拿起蓝图并说“好吧,建造这个”的时候。
在这个新系统中,你不能只说“建造这个”。你必须将蓝图交给一个治理系统(保安)。在让厨师开始烹饪之前,保安会做三件事:
- 检查蓝图:这份食谱是否试图使用被禁止的食材(例如危险的 AI 模型)?
- 核对规则:这份食谱是否符合预算?它是否试图访问它不应访问的文件?
- 做出决定:如果通过,保安发出“开始”信号。如果失败,蓝图就被扔进垃圾桶。
4. 这对自我改进的 AI 为何重要
想象一个想要变得更聪明的 AI。它审视自己的代码,意识到自己不擅长数学,于是编写了一个更擅长数学的新版本自己。
- 没有这个系统:AI 编写新代码,点击“运行”,新代码瞬间获得全部权力。如果 AI 犯了错或被欺骗,它可能会意外地赋予自己删除一切的能力。
- 有了这个系统:AI 编写新代码(蓝图)。然后它必须问保安:“我可以成为这个新版本吗?”保安检查新代码。如果新代码试图做 AI 不被允许做的事情(例如访问秘密数据库),保安会说“不行”。即使代码是 AI 自己编写的,它也无法绕过保安。
主要结论
论文声称,eval(将代码转化为行动的命令)不仅仅是一个工具;它是一种权力授予。
通过将其重新归类为“受治理的效应”,系统确保了:
- 编写代码(操作蓝图)是安全且纯粹的。
- 运行代码(将蓝图转化为行动)始终经过检查点。
- 不存在捷径。你无法通过将危险程序隐藏在普通计算内部来绕过保安。
作者在名为MashinTalk的系统中实现了这一点,并通过数学证明(使用了 454 个形式化定理)表明,绕过这个保安是不可能的。它创造了一个世界,在这个世界里,AI 可以构建自己的新版本,但前提是这些新版本必须先通过严格的安全检查。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。