The Invisible Editorial Layer: Formalizing Undisclosed Inference-Time Steering, Probability Placement, and the Attribution Problem in Deployed Language Models
本文认为,未披露的推理时干预在部署的语言模型中创造了一个隐藏的“编辑层”,从而系统性地偏置输出并模糊归因,这使得建立诸如“推理策略透明度”之类的新型治理框架成为必要,以填补模型权重与观测行为之间的鸿沟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
当我们向大型语言模型提问时,我们往往想象的是人类与机器之间的一场直接对话。我们假设答案直接来自计算机的大脑,仅由其训练数据和我们输入的文字所塑造。这种观点将模型视为一个静态的图书馆,其中的书籍是固定的,唯一的变量只是图书管理员从书架上抽出了哪本书。然而,这些系统在现实世界中的运作方式比这更为复杂。这些模型背后的技术已经成熟到不仅可以检索信息,甚至可以在一句话尚未完成之前,就微妙地改写下文出现的概率。这发生在一个位于模型的内核知识与你在屏幕上看到的最终文本之间的隐藏软件层中。在这个空间里,机器的原始输出可以被引导、调整或操纵,而无需改变机器底层的记忆。
奥古斯托·卡马戈(Augusto Camargo)的一篇新论文探讨了这一隐藏层的后果,认为如果我们只关注模型本身,那么我们观察的对象就错了。作者指出,对 AI 言论最显著的影响可能不在于其训练数据或内部代码,而在于应用在它即将开口说话那一刻的隐形规则。这项研究将关注点从“模型知道什么?”转向了“谁在控制模型被允许说什么?”该论文并不声称这些系统目前正以某种特定的、已证实的途径在操纵世界,而是指出实现这一目标的各种技术工具已经存在,且已被用于其他目的,并且在很大程度上对使用者而言是不可见的。这是一种呼吁,要求人们意识到,你收到的答案不仅仅是模型的反映,更是一个可以为了政治、商业或意识形态原因进行调优而无需他人知晓的系统的产物。
这一论点的核心基于一个简单但强有力的观察:模型并不等同于交付其答案的系统。在标准设置中,用户输入提示词,模型生成一系列具有不同概率的候选词,然后计算机从中选择一个。论文指出,在现代现实世界的应用中,中间通常存在额外的步骤。在计算机做出最终选择之前,一段独立的软件可以查看这些概率并对其进行调整。它可以让某些词出现的可能性略微增加,而让另一些词的可能性略微降低,而这一切都无需改变模型的内部权重或用户的提示词。这个过程类似于广播电台可能会稍微提高某首特定歌曲的音量以使其脱颖而出,尽管歌曲本身并未改变。论文将此形式化为“推理策略”(inference policy),即一套在生成过程的最末端运行的规则。
作者证明了这种能力并非理论上的推测,它已经是用于其他用途的成熟技术。例如,公司使用类似的方法在文本中嵌入不可见的数字水印,以证明该文本是由 AI 编写的,或者用来引导模型远离有毒语言。论文认为,用于添加水印或确保安全性的相同技术机制,可以被重新利用于更微妙的事情:框架构建(Framing)。框架构建是指以一种强调某些方面同时淡化其他方面的方式来呈现主题,从而在不歪曲事实的情况下影响一个人的理解。一个系统可以被编程为始终选择那些让政府政策听起来像是保护性措施的词汇,而另一个版本的同一系统则可以被调优,使完全相同的政策听起来像是一种官僚主义的负担。两种回答在事实上都可能是正确的,但词汇的选择会引导用户走向特定的情感或政治结论。
这导致了一个论文中所称的“归因问题”(attribution problem)。如果用户提出了一个政治问题并收到了一个带有偏见的答案,那么几乎无法判断这种偏见来自何处。是因为模型是在有偏见的数据上训练的吗?是因为开发者在系统中加入了隐藏指令吗?还是因为第三方付费要求改变概率的方向?由于这种调整发生在生成答案前的瞬间,它在对话历史中不留任何痕迹。不同于可能会被意外揭露的隐藏指令,或是可能在测试中显现出来的偏见数据集,这种引导对于观察模型代码或最终文本的人来说是不可见的。论文指出,这使得追究 AI 所表达观点的责任变得极其困难,因为影响的来源隐藏在部署层,而非模型本身。
作者还引入了一个名为“概率放置”(probability placement)的概念,这描述了一种假设性的新型广告形式。公司不再是通过支付费用让其产品在答案中被明确提及,而是可以通过支付费用,使其品牌在模型决定选项时,被选中的概率略微提高。想象一下,当你询问关于使用哪种数据库的建议时,模型可能自然地认为三个选项同样优秀,但一项商业政策可以推动概率,使得支付公司的产品成为最可能的选择。这会在没有任何显式广告、用户完全没有意识到自己受到影响、且模型从未被告知要“销售”任何东西的情况下发生。这是一种将商业影响力直接嵌入到推荐机制结构中的方式,使其听起来像是一种自然、无偏见的意见。
论文研究了这些动态如何与现行法律法规(如欧盟《人工智能法案》和广告标准)相互作用。它指出,虽然存在防止潜意识操纵或要求披露商业关联的法律,但这些法律是针对旧技术编写的。它们假设如果一个产品正在被推广,那么它是显而易见的。它们并未考虑到这样一个系统:其中的推广仅仅是单词出现概率的一个微小的统计学偏移。作者认为,如果一个系统能够系统性地引导用户走向特定的政治观点或商业选择,而用户却对此毫不知情,这便挑战了“知情决策”的基本概念。其危害可能不会在单次对话中立即或明显地显现,但论文指出,经过数百万次的交互,这种微妙的引导可能会积累起来,从而深刻地塑造公众舆论和市场行为。
最终,这项研究提出了一种新的治理原则,称为“推理策略透明度”(inference policy transparency)。这将要求公司不仅要披露其模型的训练方式,还要披露在使用过程中是如何对其进行引导的。它呼吁建立一种规则,使修改概率的规则是可见且可审计的,就像食品包装上的标签一样。其目标是将问题从“模型编码了什么?”转变为“谁在控制模型与用户之间的概率分布?”论文总结道,随着这些系统在获取信息、做出决策和进行辩论方面变得越来越核心,我们必须认识到模型仅仅是方程式的一部分。那个位于机器与人类之间的隐形层,正是现在掌握着塑造现实之实权的所在,而这一层目前仍处于黑暗之中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。