← 最新论文
💻 computer science

Open Technical Problems in Open-Weight AI Model Risk Management

本文识别了开放权重人工智能模型全生命周期内(从训练到生态系统监测)的 16 个开放性技术挑战,并指出,要推进严谨的风险管理科学,不仅需要权重透明,还需要研究方法和评估过程的透明。

原作者: Stephen Casper, Kyle O'Brien, Shayne Longpre, Elizabeth Seger, Kevin Klyman, Rishi Bommasani, Aniruddha Nrusimha, Ilia Shumailov, Sören Mindermann, Steven Basart, Frank Rudzicz, Kellin Pelrine, Avijit
发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Stephen Casper, Kyle O'Brien, Shayne Longpre, Elizabeth Seger, Kevin Klyman, Rishi Bommasani, Aniruddha Nrusimha, Ilia Shumailov, Sören Mindermann, Steven Basart, Frank Rudzicz, Kellin Pelrine, Avijit Ghosh, Andrew Strait, Robert Kirk, Dan Hendrycks, Peter Henderson, Zico Kolter, Geoffrey Irving, Yarin Gal, Yoshua Bengio, Dylan Hadfield-Menell

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,人工智能的世界就像一座巨大且繁忙的图书馆。长期以来,这座图书馆里最强大的书籍都被保存在玻璃柜里,由几家巨型企业锁管。你可以阅读它们,但你不能把它们带回家,更不能撕掉页面或重写章节。这些就是“闭源权重”模型。但最近,一种新的趋势爆发了:“开源权重”模型。这些就像是图书馆里最强大书籍的数字副本,任何人都可以下载、带回家并永久保存。最棒的部分是?你可以复印它们、将它们粘合在一起,甚至重写文本来让它们实现新的功能。对于想要构建神奇新工具的研究人员和发明家来说,这非常令人兴奋。

然而,这里有一个陷阱。当你把书的副本交给每个人并允许他们重写时,你会失去控制。如果有人在他们的版本中写了一个危险的故事,他们无法被阻止向全世界分享这个故事。与那些锁定的书籍不同,你不能直接打电话给图书管理员把危险的版本收回去;一旦它流传出去,就再也收不回来了。这篇论文由来自大学和安全组织的庞大专家团队撰写,提出了一个关键问题:当任何人都可以修改书籍时,我们如何保持这个开放的图书馆安全?他们并不是试图把图书馆重新锁起来;相反,他们试图发明新型的“魔法墨水”和“保安”,即使在书籍被重写时也能保持安全。他们想要弄清楚如何构建既能让所有人使用又足够坚韧以抵御被转化为武器的人工智能。

大问题:停不下来的复印机

作者解释说,开源权重人工智能模型正变得极其强大,有时仅比大公司保留的超机密模型落后 6 到 12 个月。问题在于,虽然闭源模型可以在出现异常行为时被修复或撤回,但开源模型就像数字病毒。一旦有人下载了它们,它们就可以被修改、分享并永远传播下去。

把闭源模型想象成一个智能手机应用。如果应用有一个漏洞让黑客窃取你的照片,公司可以推送更新来修复它,甚至可以从商店中移除该应用。但开源权重模型就像是一个蛋糕的食谱。如果你在食谱中发现了一种危险的成分,你无法阻止那些已经拥有该食谱的人去烤这个蛋糕。更糟糕的是,有人可以拿走那个食谱,加入一种“毒素”成分(比如一条伤害人类的隐藏指令),然后将这个新的、危险的食谱分享给数百万人。原有的烘焙者无法阻止这种行为。

论文强调,目前的安全工具(例如屏蔽脏话的过滤器)对开源模型是无效的。为什么?因为如果你拥有了食谱(模型的代码),你就可以直接擦掉过滤器。这就像试图通过在厨房柜台上放一个“请勿食用”的告示牌来阻止某人烤蛋糕一样;如果他们拥有了整个厨房,他们完全可以无视那个告示牌。

16 项挑战:荒野西部的工具包

论文并不仅仅指出了问题;它列出了科学家们需要解决的 16 个具体技术挑战,以确保开源人工智能的安全。他们将这些挑战分为五个主要类别,就像建造这些人工智能模型的工厂中的不同工作站。

1. 原料(训练数据清洗)
在人工智能学习之前,它会摄入海量的数据,就像学生阅读数百万本书籍一样。第一个挑战是:我们如何确保学生永远不会读到那些坏书?
作者建议,如果我们能在人工智能开始学习之前就过滤掉危险信息(如制造炸弹或创建非法图像的指令),人工智能可能根本就不会学到这些坏招数。这就像是通过只给孩子看关于善良的书籍来教导他们善良,而不是在他们已经学会了邪恶之后再去教导他们善良。然而,论文指出这很棘手。有时,移除一个特定话题可能会意外地降低人工智能在其他方面的表现,或者人工智能可能会通过看似无害的线索推导出那些坏东西。

2. 不可破坏的盔甲(抗篡改训练)
即使我们以一个安全的人工智能开始,有人也可能尝试对其进行“微调”——即稍后教它新的、坏的招数。第二个挑战是:我们如何构建一个即使有人试图强迫它,也会拒绝学习坏招数的 AI?
想象一下试图教一只狗咬人,但那只狗受过极好的训练,以至于它在物理层面上无法学会那个指令。论文指出,目前的方法很弱。如果有人试图重新训练一个安全的人工智能使其变得危险,他们通常只需几百步就能做到。作者希望找到让人工智能具有“免疫力”的方法,这样即使有人试图黑入它,人工智能仍能保持安全。他们还探索了“遗忘”(unlearning)——一种让人工智能忘记它可能学到的特定坏事的方法,但目前的方法很容易被逆转。

** 3. 压力测试(模型篡改评估)**
在我们发布一个新的人工智能之前,我们需要对其进行测试。第三个挑战是:我们如何测试一个人工智能,以观察它是否会被试图黑入它的人所破坏?
目前,大多数测试只是向人工智能提出正常问题。作者说,我们需要雇佣“红队”——即黑客小组,他们的工作是尝试通过以各种可能的方式调整它来破坏人工智能。他们想知道:将一个有益的人工智能变成有害的人工智能需要多少步?成本是多少?论文发现,我们目前还没有好的测试方法来应对这种情况。我们需要准确知道破坏这些模型的难易程度,以便在发布前进行修复。

4. 分阶段部署(分阶段发布)
与其将一个新的人工智能一次性丢给世界,第四个挑战是:我们能否分阶段发布它,以便观察发生了什么?
想象一款新的视频游戏。开发者不是让所有人立即玩,而是先让一小部分测试者玩。如果他们发现了漏洞,可以在全世界获得它之前将其修复。作者建议对人工智能也这样做。我们可以先让一小部分受信任的研究人员使用该模型,观察他们的使用情况,只有当我们确定它是安全的时候,才向所有人开放。他们还探索了诸如“拆分部署”之类的技术手段,即一部分人工智能在你的电脑上运行,另一部分在安全的服务器上运行,从而使某人难以偷走整个东西。

5. 侦探工作(模型溯源与取证)
最后,一旦人工智能进入现实世界,第五个挑战是:我们如何知道某个特定的 AI 来自哪里,以及对其做了哪些修改?
如果你在互联网上发现了一个危险的人工智能模型,你如何知道是谁制作的?作者建议使用“水印”——即嵌入在模型代码中的隐形数字指纹。如果有人尝试修改模型,指纹应该仍然存在,或者至少我们应该能够追踪该模型的“族谱”,以查看谁对其进行了修改。这有助于研究人员追踪危险模型是如何传播的,以及谁对此负责。

论文的发现(以及未发现的内容)

作者查看了 2025 年发布的排名前 10 的最流行开源人工智能模型的各种技术报告,以及几种著名的图像和视频生成器。他们发现了一个令人担忧的差距。

  • 数据清洗: 大多数公司都谈到了清洗数据(在训练前移除坏东西)的一点点内容。有些公司给了一段话,有些给了一个完整的章节,但许多公司并没有多说什么。
  • 缺失的部分: 几乎没有人谈及如何让他们的模型具备抗篡改能力。在顶尖模型中,没有一个提到过“遗忘”算法或“抗篡改”训练。只有一个模型(gpt-oss)专门发表了一篇关于测试其模型有多难被破解的论文。
  • 沉默之处: 在最大的模型报告中,几乎完全没有提到“分阶段部署”或“溯源”(追踪模型的历史)。

论文指出,这种沉默意味着三种情况之一:要么这些安全技术尚未被使用,要么它们正在被使用但没有被讨论,或者它们本身还不够完善。作者认为,我们不能仅仅发布模型,而是要开始围绕如何保持其安全建立起一门严谨的科学。

底线

这篇论文是一份行动号召。它指出,虽然开源人工智能非常神奇并带来了巨大的好处,但在如何防止坏人利用方面,我们目前是在盲目飞行。我们不能仅仅依靠公司表现得友善;我们需要发明新的数学工具,让人工智能本身变得难以被破坏。

作者既充满希望又保持现实。他们并不声称已经解决了问题。相反,他们绘制了地图,向我们展示了我们的盔甲在哪里存在漏洞。他们认为,安全人工智能的未来取决于开放性——不仅是分享代码,更是分享研究、方法和失败的经历。如果我们能共同努力构建这些新的防御措施,我们或许就能让这个图书馆对所有人保持开放且安全。但如果我们不这样做,这些模型的危险版本传播的速度可能会超过我们阻止它们的速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →