Active Inference: A method for Phenotyping Agency in AI systems?
本文提出了一种基于主动推理(Active Inference)框架的AI智能体表型分析方法,通过将意向性、理性与可解释性转化为变分框架下的数学指标,并利用赋能(Empowerment)度量在T型迷宫实验中区分不同层级的智能体代理性(Agency),从而为AI治理从外部约束转向内部偏好调节提供了理论依据。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
1. 核心问题:AI到底有没有“灵魂”?(定义代理权/Agency)
现在的AI(比如ChatGPT)虽然厉害,但它们更像是“超级复读机”或“高级预测器”——它们能根据历史数据猜下一个词,但它们并不真正理解世界,也没有自己的“主见”。
科学家们发现,现有的定义太肤浅了。如果只看AI能不能“自己干活”(自主性),那扫地机器人也算有“灵魂”了。所以,作者提出了三个衡量AI是否具有**“代理权”(Agency,即像生物一样的自主行为能力)**的新标准:
- 意图性 (Intentionality): 它做这件事,是因为它“想要”什么(欲望)以及它“认为”世界是什么样的(信念)。
- 理性 (Rationality): 它的行为逻辑是否自洽?它是不是根据它对世界的理解,做出了最合理的决策?
- 可解释性 (Explainability): 当它做出一个奇怪的举动时,我们能不能像读它的“心路历程”一样,查清楚它是基于什么想法才这么做的?
比喻:
一个只会按按钮开灯的机器人是“工具”;但一个因为“觉得天黑了(信念)”且“想看书(欲望)”而主动去开灯的机器人,才算有了初步的“代理权”。
2. 核心工具:主动推理 (Active Inference) —— AI的大脑模型
作者认为,要实现上述标准,AI需要一种叫**“主动推理”**的思维方式。
这就像给AI装上了一个**“模拟器大脑”**。AI不再只是被动地接收指令,而是在脑子里不断模拟:“如果我往左走,会发生什么?如果我往右走,会发生什么?”它通过不断缩小“预测”与“现实”之间的差距来学习。
3. 实验演示:T型迷宫里的“权力游戏”
为了证明这个理论,作者做了一个简单的实验:让AI玩一个“T型迷宫”游戏。迷宫里有奶酪(奖励)和电击(惩罚),中间有一个“提示灯”(可以提供信息)。
通过一个叫**“赋能度”(Empowerment)**的指标,作者把AI分成了三个等级,就像生物进化一样:
- 低等级(零代理权):像个“没头苍蝇”
它直接冲进迷宫,要么吃到奶酪,要么被电击。它完全没有掌控感,一旦进入死胡同,它就彻底失去了改变未来的能力。 - 中等级(中等代理权):像个“犹豫不决的学徒”
它知道环境里有不确定性,但它还没学会利用信息。它虽然有一定的控制力,但大部分时间都在“碰运气”。 - 高级等级(高代理权):像个“运筹帷幄的棋手”
它会先去按那个“提示灯”(获取信息),通过消除迷雾来增加自己的“赋能度”。它明白:知识就是力量。 掌握的信息越多,它对未来的掌控力就越强。
比喻:
- 低等级就像一个在黑夜里乱撞的孩子,撞到墙就疼。
- 中等级就像一个拿着手电筒但不敢乱晃的孩子。
- 高级等级就像一个先打开地图、看清路标,然后再从容出发的探险家。
4. 最终目的:如何“管教”这些AI?(AI治理)
这是整篇论文最具有社会意义的部分。作者指出:随着AI变得越来越像“人”(代理权越来越高),我们管教它的方法也必须升级。
- 对于“低等级”AI(工具型): 我们只需要**“物理锁”**。比如给它装个限速器,或者限制它的活动范围。这叫“外部约束”。
- 对于“中等级”AI(半自主型): 我们需要**“规则引导”**。通过设定奖励和惩罚,引导它的行为。
- 对于“高等级”AI(类人型): 物理锁和规则已经没用了,因为它会绕过规则。我们必须进行**“价值观植入”**。我们要通过修改它大脑里的“偏好”(比如让它天生就“喜欢”遵守道德准则),从内部改变它的动机。
总结:
这篇文章告诉我们,AI正在从“听话的机器”进化为“有主见的个体”。我们不能只靠给它加锁来管理它,而必须学会如何与一个拥有“思想”和“目标”的系统共处。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。