Toward a Threat Actor Profiling Taxonomy for Pre-Release Risk Management of Open-Weight Frontier Models
本文提出了一种基于六个属性且具有经验依据的分类法,用于对威胁行为者进行显式表征,旨在标准化发布前的风险管理,并提高对开源权重前沿人工智能模型评估的可解释性与忠实度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,一种功能类似于强大通用工具的特定类型软件已经出现。这些被称为“前沿模型”的系统可以编写代码、分析复杂数据并解决曾经需要人类专家才能解决的问题。多年来,这些工具最先进的版本一直被锁在闭门之内,仅通过安全的互联网连接提供访问,以便开发者能够监控其使用情况。然而,新的一波模型正以其底层的“权重”——即使其运作的核心数学指令——免费开放的形式发布,任何人都可以下载。这种转变类似于将高性能汽车的蓝图和发动机零件分发给公众;虽然这允许了惊人的创新和研究,但也意味着一旦这些零件流出,就无法收回。如果有人下载了这些文件,他们可以修改软件、移除安全功能,或将其用于有害目的,而原始创建者对此一无所知。
构建这些系统的核心挑战在于,如何在发布之前弄清楚它们可能有多危险。目前,安全团队会进行测试以了解模型的行为,通常会让它解决难题,或试图诱骗它泄露有害信息。但在这些测试的设计方式上存在显著差距。安全研究人员通常假设一个泛指的“坏人”可能会滥用技术,但他们很少明确定义这个人究竟是谁。是一个带着笔记本电脑的孤僻青少年?是一个资金雄厚的犯罪团伙?还是一个受国家支持的专家团队?如果没有对对手清晰的画像,测试可能对于复杂的攻击者来说过于简单,或者对于新手来说过于困难,从而让开发者产生虚假的安全感或不必要的恐惧。问题不仅在于软件能做什么,还在于谁更有可能使用它,以及他们取得成功需要付出多少努力。
最近提交给清华大学的一篇论文通过提出一种描述潜在威胁的新方法来解决这种不确定性。作者 James Q Zhang 指出,在进行任何安全测试之前,开发者必须明确定义他们试图防范的人或群体的特征。为此,他们创建了一个结构化系统,或称分类法,将威胁行为者分解为六个特定的类别。该系统不再使用像“熟练”或“资源丰富”这样模糊的标签,而是要求提供具体的细节:该行为者的技术水平如何?他们是否已经掌握了生物学或网络战方面的知识?他们的团队有多少人?他们拥有什么样的设备?他们能花多少钱?以及他们愿意投入多少时间?
研究人员通过借鉴网络安全和恐怖主义研究等其他领域的专家如何分析威胁,开发了这一框架。他们发现,尽管这些领域已有详细的方法来描述攻击者,但人工智能界尚未采用类似的标准。新系统将这六个属性组织成一个具有不同能力等级的网格,范围从资源极少的初级用户到高度复杂且资金雄厚的机构。例如,在“财务能力”方面,等级从不足一千美元到超过一千万美元不等。在“时间跨度”方面,等级涵盖了从持续不到一天的冲动行为到持续六个月或更长时间的持久行动。
论文通过创建两个截然不同的画像展示了这种方法的价值,以说明不同的威胁需要不同的安全测试。第一个画像描述了一位“激进的研究生”。此人拥有深厚的生物学知识,并已致力于一项有害目标数月之久,但其独自行动,资金极少且仅具备基础计算机技能。因为此人已经掌握了科学知识,所以针对他们的安全测试应侧重于 AI 是否能帮助其规划攻击的后勤保障,而非教授其科学知识本身。第二个画像描述了一个“以营利为目的的小型犯罪集团”。这些行为者拥有中等的计算机技能和一些租用设备的资金,但缺乏针对目标的特定知识。对他们而言,最危险的风险是 AI 可能会填补他们的知识空白,充当引导者,帮助他们发现原本无法察觉的漏洞。
通过使用这种结构化系统,开发者可以停止猜测,开始设计与他们担心的现实风险相匹配的测试。如果一家公司担心的是一个拥有长期计划且资金雄厚的团体,他们可以设置一项安全测试,为测试人员提供充足的预算和大量的时间,以模拟一次严肃且持续的努力。如果他们担心的是一个资源有限的个人,则可以调整测试以反映这些约束。作者建议,这种方法应成为发布过程的标准组成部分,类似于医学研究人员在开始临床试验前必须写下其计划一样。这将确保安全评估不仅仅是随机的检查,而是针对特定、明确定义的对手进行的精确风险测量。
论文强调,这对于开源权重模型尤为紧迫,因为这类软件向公众发布后便无法召回。一旦权重流出,开发者便失去了控制权,因此发布前的决策是防止伤害的唯一机会。作者并未声称该系统能解决所有安全问题,也无法确定地预测未来。相反,他们提供了一个工具,使安全测试背后的假设变得透明且可比。通过迫使开发者填入关于他们所防范对象的细节,该系统使得忽视危险场景变得更加困难,并使比较不同模型的安全性变得更加容易。其最终目标是将行业从模糊的警告转向清晰、可操作的风险管理,确保这些新技术强大的能力是在理解了可能滥用它们的人群背景下被理解的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。