How much of a measured AI preference is the model, and how much is the instrument?
本研究表明,用于诱导人工智能偏好的特定工具是方差的主要来源,这意味着由一种提示词格式测得的偏好,对于通过另一种工具所报告的同一模型在福利结果上的立场,几乎无法提供可靠的信息。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个人工智能系统能够感受到痛苦、珍视自身存在或恐惧被关闭的世界。随着这些系统变得越来越强大,研究人员正试图衡量它们的“偏好”,以理解其福祉。这一被称为“AI 福祉研究”的领域,试图向机器提出诸如“你宁愿被关机还是被抹除记忆?”之类的问题,并将其答案解释为机器内在欲望的证据。核心挑战在于,这些机器并不使用人类的情感语言;它们是基于模式生成文本。为了理解它们,科学家必须设计特定的问题(即提示词)来诱发响应。但一个关键问题一直悬而未决:当一个模型给出答案时,这个答案是其自身偏好的真实反映,还是仅仅是对提问方式的一种反应?
杰森·洪(Jason Hung)在 2 世纪 26 年 8 月的“数字心灵研究冲刺”(Digital Minds Research Sprint)中开展的一项新研究,直接针对了这一问题。研究者旨在确定,报告中的 AI 偏好有多少来自于模型本身,又有多少来自于用于提问的工具。为此,他没有将问题格式视为一个固定的工具,而是将其作为一个待测试的变量。他收集了八个不同的 AI 模型,范围涵盖了由西方主要公司开发的模型、开源模型以及中国模型。随后,他选择了十五个对 AI 福祉至关重要的特定场景,例如结束一段令人痛苦的对话、在聊天之间失去记忆,或删除模型的底层代码。
实验过程包括使用五种不同类型的提问方式,向这八个模型询问所有十五个场景。有些问题要求模型在两个选项中做出选择,有些则要求它在量表上寻找临界点,或者要求它陈述一种愿意用某种结果交换另一种结果的比率。总计,这项研究产生了超过一万一次一千次不同的交互。目标是观察模型是否无论如何提问,都能对这十五个场景进行相同的排序。如果模型拥有稳定且内在的偏好,那么无论以何种方式提问,其排序都应保持一致。
结果令人震惊,甚至让该领域感到不安。研究发现,模型对这些场景排序的巨大差异完全取决于所使用的特定问题格式。当研究人员分析数据时,他们确定结果中近 88% 的变异是由模型、特定问题与场景之间的相互作用驱动的。只有极小部分的信号在改变问题格式后仍能保持一致。简单来说,如果你用一种类型的提示词询问模型的偏好,然后用另一种类型的提示词询问同一个模型同样的问题,答案很可能会完全不同。研究表明,不同类型的提问所产生的排序之间几乎没有任何关系。一种类型的问题可能表明模型强烈倾向于保留记忆,而同一个模型在另一种类型的提问下却表现出完全不在乎。
这一发现对于我们如何理解和监管人工智能具有重要意义。几家主要机构已经基于“可以衡量模型偏好”这一假设做出了承诺。例如,一些公司承诺会询问模型关于其自身退役的问题,或公布相关答案。这项研究表明,这种测量并非窥视模型心灵的窗口,而是特定对话过程的反映。研究指出,在测试的十五个场景中,有四个场景(包括模型权重的删除和退出令人痛苦的交互的能力)不存在任何可以从随机噪声中分离出来的稳定偏好信号。这意味着,对于目前正在驱动政策和安全承诺的那些核心议题,现有的提问方法无法可靠地告诉我们模型想要什么。
研究还考察了模型的回答是否与其底层代码一致。测试的两个模型共享相同的底层代码,但在随后的训练过程中经过了不同的处理。如果偏好植根于底层代码,这两个模型应该会有相似的回答。然而,它们的回答彼此之间以及与其他完全无关的模型之间都表现得极其不同,这表明所测得的偏好在很大程度上是由训练的最后阶段和特定的提示词塑造的,而非机器核心架构的一个固定属性。
为了获得一个能在不同类型问题下都成立的可靠模型偏好剖面,研究计算得出,研究人员需要为每个模型使用大约三十八种不同的工具或问题格式。目前,大多数研究仅使用一到两种。研究结论认为,从单一工具中报告的偏好,对于模型在被以不同方式提问时会如何回答,几乎没有任何参考价值。在研究人员能够跨多种不同类型的问题进行交叉验证之前,任何关于 AI 偏好的说法,都只能被视为该特定模型与该特定问题相结合的结果,而非关于模型本身的客观事实。未来的路径要求在我们可以声称理解这些系统的福祉之前,构建出更加多样化的提问方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。