← 最新论文
💻 computer science

Silent Updates: Measuring and Closing the Post-Deployment Disclosure Gap

本文研究了人工智能系统中的“部署后披露差距”问题,揭示了尽管提供商发布了安全性文档,但他们缺乏外部验证机制来确保已部署的模型与其报告的版本一致,从而促使作者提出了一种“静默更新计分卡”和一套“三部分行为触发系统”,以强化透明度与问责制。

原作者: Sophia Abraham, Ben Bucknall

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Sophia Abraham, Ben Bucknall

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正身处一个巨大的、充满魔力的自助餐厅,那里的厨师是超级聪明的机器人。你点了一道特定的菜,比如“GPT-5 汉堡”,菜单上详细说明了它包含什么成分、食用是否安全,以及根据一位著名美食评论家的评价,它吃起来是什么味道。因为你信任这份菜单,所以你感到很安心。但转折来了:厨师可以在你还在吃汉堡的时候,偷偷更换汉堡肉饼、改变秘制酱汁,甚至在不告知你的情况下,把整个面包换成完全不同的东西,且不更改盘子上的名字,也不更新菜单。在人工智能的世界里,这就是“基础模型”(foundation models)发生的事情。这些是驱动聊天机器人和各种工具的巨大 AI 大脑。这里有一个核心概念叫做“监管链”(chain of custody),它就像是一张收据,证明你正在吃的汉堡正是那位评论家品尝过的那个。另一个概念是“静默更新”(silent updates),即那些秘密更换食材的行为。人们之所以关心这个问题,是因为如果菜单说汉堡是安全的,但厨师却偷偷加入了辛辣的毒药,那么评论就失去了意义,你可能会中毒身亡。我们需要知道我们正在使用的东西,是否确实是经过测试过的那个东西。

现在,让我们来看看研究员索菲亚·亚伯拉罕(Sophia Abraham)和本·巴克纳尔(Ben Bucknall)所做的工作。他们扮演了食品检查员的角色,但他们检查的不是餐厅,而是九家大型 AI 公司和七个托管这些 AI 工具的地方。他们创建了一个特殊的清单,叫做“静默更新评分卡”(Silent Updates Scorecard),用来观察这些公司是否对他们的秘密食材更换保持诚实。他们寻找证据,以证明你今天与之交谈的 AI,正是他们在安全报告中所描述的那个特定模型。

结果有点像是发现这家自助餐厅有一个“幽灵厨房”。研究人员发现,虽然厨师们(AI 公司)非常擅长编写详细的菜单和安全报告(发布安全文档和评估),但他们却极不擅长证明你盘中的食物与菜单上的内容相符。事实上,在他们检查的九家主要 AI 提供商中,零家提供了让外部人员验证正在提供的特定 AI 模型是否与其安全报告中所描述的模型完全一致的方法。这就像是厨师说:“相信我,这就是菜单上的那个汉堡,”但却拒绝让你查看厨房或查看收据。

论文指出,这种情况之所以发生,是因为 AI 系统并非静态的;它们在后台不断发生变化。研究人员确定了进行这种“静默更新”游戏的四种主要方式:

  1. 变脸的名字:公司使用像“GPT-5”或“Claude”这样稳定的名称,但这些名称就像神奇的标签,会随着时间推移粘在不同的汉堡上。某一天“GPT-5”可能是牛肉饼,而下个月它可能变成了素食饼,但名字保持不变。
  2. 缺失的日志:虽然公司在推出一款汉堡时非常擅长公告,但当他们秘密更改菜单上已有的汉堡的成分时,却很少记录下来。
  3. 两副面孔:有时你在网站上得到的汉堡(聊天机器人)与你通过计算机程序(API)获取的汉堡是不同的,而公司并没有告知你它们之间的差异。
  4. 未关联的收据:安全报告通常讨论的是一个模型的“家族”(例如“GPT-5 家族”),而不是一个特定的、不可更改的版本。这意味着安全报告讨论的可能是去年的汉堡,而你今天吃的是今天的汉堡。

研究人员还发现,一些公司的合同条款实际上阻止了人们检查食物。例如,在他们检查的九家公司中,有六家公司的条款规定,你不得进行自己的测试,以查看 AI 的表现是否与菜单所说的不符。这就像是一家餐厅说:“你可以阅读我们的菜单,但如果你试图通过品尝食物来测试它是否符合菜单,我们就会把你赶出去。”

为了解决这个问题,作者提出了一个新的系统,称为“三部分行为触发系统”(Three-Part Behavioral Trigger System)。可以把这看作是一套新的厨房规则。与其等待厨师承认他们更改了配方,不如规定:

  • 如果 AI 开始表现得不同(例如拒绝回答以前可以回答的问题),这就是一个“漂移触发器”(Drift Trigger),他们必须更新菜单。
  • 如果他们更改了机器的特定部分(例如酱料分配器或烤架),这就是一个“组件触发器”(Component Trigger),他们必须立即记录。
  • 如果 AI 突然变得聪明得多或危险得多,这就是一个“能力触发器”(Capability Trigger),他们必须重新测试整个系统。

他们还建议设立一项“避风港”(safe harbor)规则,这就像是一项法律,规定:“如果你是一名为了公众利益而检查汉堡安全性的美食评论家,餐厅不能起诉你或将你赶走。”

这篇论文并不是在声称这些公司在撒谎,或者目前的 AI 是危险的。相反,它指出目前的系统是破碎的,因为不存在一种方法可以证明安全报告与你正在使用的实际 AI 之间的联系。作者通过公开信息衡量了这一点,并发现虽然文书工作存在,但“监管链”是断裂的。他们认为,在我们能够验证正在使用的 AI 是否就是经过测试的那个之前,我们都是在黑暗中进食。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →