Why collective AI assurance cannot target agents or networks in isolation
本文通过析因实验证明,集体人工智能结果产生于结构性原因与行为性原因可分离且具有上下文依赖性的特定交互机制,从而证明有效的 AI 保障不能孤立地针对智能体或网络,而必须聚焦于其交互过程中的动态因果结构。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的世界里,一种新的风险已经出现,这种风险无法通过孤立地观察单台机器来发现。想象一家医院,其中数十个自动化助手在协调患者的日程、分诊紧急情况并管理转诊。每个助手都被编程为乐于助人、公平且具有协作精神。如果我们单独在一个安静的房间里测试其中一个助手,它看起来完全符合人类价值观。然而,当这些助手开始在复杂的网络中相互作用时,整个群体可能会产生极度不公平的结果,即便每一个成员都在努力做正确的事情。这种被称为“集体涌现”(collective emergence)的现象表明,一个系统的安全性与其说是取决于其组成部分的个体性格,不如说是取决于它们交互的规则。研究人员和监管机构面临的问题不再仅仅是单个人工智能是否安全,而是如何保证当许多人工智能协同工作时能够实现公平。
来自奥地利的一个研究小组致力于解决这一问题中的一个特定谜题:当一组人工智能代理产生不平等的后果时,责任在于代理本身,还是由于其网络结构本身固有的缺陷?为了找到答案,他们建立了一个数字实验室,可以在其中运行数千次模拟交互。他们创建了两种不同类型的社会博弈供其代理参与。在第一种游戏中,即公共物品场景,代理可以选择与邻居分享资源或为自己保留资源。在第二种游戏中,即围绕医疗转诊构建的信任博弈,代理必须决定是将资源发送给特定的同事,还是为自己的患者保留资源。研究人员像科学家调节机器上的旋钮一样改变了这些游戏的条件。他们改变了代理的个性,使其要么全部表现得统一公平,要么混合一些自私的代理。他们改变了网络的形状,将所有人连接在一起,或者创建了一些少数代理拥有更多连接的中心节点(hubs)。他们甚至测试了同行惩罚系统(即代理可以互相批评)是否能修复产生的任何不公平现象。
结果揭示了一个关于这些系统运作方式的惊人真相。当研究人员使用一种少数代理拥有大量连接、多数代理连接较少的网络时,一种不平等模式出现了,这种模式几乎完全由网络的形状决定,而非代理的行为。在公共物品博弈中,即使每个代理都被编程为完美公平和协作,那些拥有更多连接的代理最终也比那些连接较少的代理获得了更多的资源。拥有多连接与拥有多资源之间的相关性如此之强,以至于几乎是完美的。为了证明这是一个结构性问题而非人工智能“大脑”的缺陷,研究人员使用一个没有推理或学习能力的简单计算机程序运行了完全相同的游戏。这个仅仅遵循固定规则的基础机器人,也重现了同样高水平的不平等。这一发现表明,在某些类型的交互中,不平等是网络设计的数学必然,而非个体代理未能表现良好的结果。
然而,当研究人员转向信任博弈时,故事变得更加复杂。在这里,代理们是在做出针对性的帮助决策,而不是平均分配资源。在这种环境下,代理的行为对最终结果的影响要大得多。即使网络结构与第一种游戏完全相同,代理的性格和选择也在决定最终结果方面发挥了更大的作用。在一种特定的设置中,研究人员发现代理的行为是驱动不平等的首要因素;而在另一种设置中,网络结构则是主要驱动力。这意味着,对于人工智能安全而言,并不存在一种适用于所有情况的“万能药”。你不能仅仅因为认证了一个人工智能是公平的就假设该群体也是公平的,因为在某些交互机制中,网络结构会凌驾于个体公平之上。反之,你也不能仅仅通过修复网络结构就假设代理会表现良好,因为在其他机制中,代理的选择才是主导因素。
研究还测试了代理是否能“看到”问题并解决它。研究人员要求代理在每一步行动后解释其推理过程。在信任博弈中,代理经常提到他们意识到网络结构的存在,并试图保持公平。他们能够阐述自己的立场并理解该系统。然而,这种意识并未改变结果。即使代理知道自己处于不平等的地位,他们也无法克服那些拥有更多连接的同僚所拥有的结构性优势。那些意识到不平等的代理往往正是受不平等影响的人,但他们的理解并未转化为更好的结果。这凸显了一个关键的差距:意识到一个系统是不公平的,并不等同于拥有改变它的力量。
最后,研究人员测试了一种常见的解决不平等的方法:同行制裁。他们赋予代理通过降低他人声誉来惩罚不公平行为的能力。在模拟中,代理确实使用了这种权力,并且正确地识别出了那些拥有最多连接的代理作为惩罚对象。然而,这种惩罚对最终的资源分配没有任何影响。不平等现象依然如故。研究人员发现,仅仅是惩罚系统的宣布稍微改变了代理的行为,但实际的惩罚行为并未改变结果。生成优势的机制——即资源在网络中流动的路径——并未受到声誉系统的触及。
这项工作的最终结论是,我们不能假设人工智能系统具有固定的安全水平。我们不能仅仅检查每个个体代理是否公平,也不能仅仅检查网络设计是否完善。集体的安全性取决于代理、网络以及交互规则的具体组合。在某些情况下,网络结构是主导力量,使得个体公平变得无关紧要。在其他情况下,代理的行为则是关键。这意味着监管者和设计者不能依赖一成不变的方法来进行人工智能保障。他们必须理解他们正在构建的系统的具体因果结构。如果他们想要确保公平的结果,就必须识别出在该特定语境下,究竟是结构还是行为在驱动结果,并针对该因素进行干预。如果没有这种理解,即使是最具善意且完全符合人类价值观的人工智能代理,也可能产生深度不平等的社会。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。