← 最新论文
🤖 machine learning

Model Merging is Secretly Certifiable: Non-Vacuous Generalisation Bounds for Low-Shot Learning

本文建立了模型融合与泛化证明之间的全新联系,证明了在处理使用大规模视觉和语言模型的高风险、少样本学习场景时,融合预训练模型而非对其进行微调,能够实现非空泛的泛化界限。

原作者: Taehoon Kim, Henry Gouk, Minyoung Kim, Timothy Hospedales

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Taehoon Kim, Henry Gouk, Minyoung Kim, Timothy Hospedales

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,日益增长的矛盾存在于这些系统的强大能力与我们对其信任的能力之间。我们依赖人工智能在医疗和安全等高风险领域做出决策,然而,信任最基本的要求是知道一个系统在面对新的、未见过的数据时能够可靠地运行,而不仅仅是在它训练过的示例上表现良好。几十年来,科学家们一直试图创建数学保证,以证明模型不会发生意外失败。然而,对于驱动现代人工智能的那些庞大且复杂的网络,这些保证往往是徒劳的。为如此大型的系统证明安全性所需的计算通常会导致过于宽泛且悲观的警告,其结果几乎毫无用处,本质上是在说错误率可能在零到百分之百之间波动。当用于训练系统的可用数据非常稀少时,这个问题变得更加困难,而在一些专业领域,收集数千个示例通常是不可能的。

一个研究小组发现了一种通过改变观察学习过程的方式来绕过这些限制的惊人方法。他们没有尝试去认证整个庞大的神经网络,而是将注意力集中在一种称为“模型合并”(model merging)的技术上,这种技术将几个预训练的专家模型组合成一个新的单一模型。通过将合并这些模型的过程视为一种具有极少可调节参数的学习方式,研究人员发现他们可以应用此前无法实现的严格安全性检查。他们的工作表明,即使在仅有一百个示例的情况下,也能够为庞大的人工智能系统提供有意义、非空的性能保证。这一发现表明,用于认证当今最强大的 AI 系统所需的工具其实早已近在咫前,只是等待着通过不同的理论视角被重新识别。

这一发现的核心在于重新构想我们在数据匮乏时如何训练和验证人工智能。传统上,为了证明一个模型有效,科学家会将有限的数据分为训练集和单独的验证集。但当你只有一百个示例时,将其平分为两半,会导致既无法训练出一个好的模型,也无法可靠地测试它。研究人员意识到,一种流行的模型合并方法提供了一个解决方案。在这种方法中,你不是从头开始训练一个巨大的网络,而是获取几个已经学习了不同技能的现有网络,并将它们融合在一起。这种融合由一小组数字(或称权重)控制,这些数字决定了每个原始网络对最终结果的贡献程度。由于这些融合权重的数量相对于原始网络中数十亿个参数来说微乎其微,因此学习过程变得简单得多。

研究人员表明,这种简单性正是认证的关键。他们应用了一个被称为 PAC-Bayes 的框架,这是一种用于计算模型在处理新数据时表现良好的概率的方法。通常,这种方法对于大型网络会失效,因为数学推导会变得过于松散而失去意义。然而,由于模型合并只调整极少数的权重,数学计算保持了紧凑性。该团队证明,现有的合并算法(其设计初衷仅仅是为了获得最佳的组合模型)在无需任何特殊修改的情况下,就已经提供了这些紧凑的安全性保证。在许多情况下,这些算法的标准运作方式足以证明所产生的模型不会发生灾难性的失败,即使在训练数据非常少的情况下也是如此。

为了使这些保证更加强大,该团队开发了一种微调学习过程的方法。他们修改了合并算法的目标,使其明确地去最小化“安全性边界”本身,而不是仅仅试图在训练数据上获得最低误差。这种调整使得他们能够将那些提供不了实际保障的“空”保证,转化为对模型失效频率的、具体的、有用的限制。他们在两种截然不同类型的人工智能上测试了这种方法:一种是能够识别图像的视觉系统,另一种是能够理解文本的大型语言模型。对于视觉系统,他们使用了一个拥有约八千八百万个参数的模型;对于语言模型,他们使用了一个拥有七十亿个参数的模型。在这两种情况下,他们都在每个任务上仅使用了一百个示例进行训练。

结果令人瞩目。对于视觉任务,研究人员能够证明合并后的模型将在一个特定的、狭窄的准确度范围内运行。对于规模更大、更复杂的语言模型,他们也取得了同样的结果。在许多情况下,基础语言模型在没有任何训练示例的情况下在处理新任务时表现不佳,但在经过合并并接受了一百个示例的训练后,该系统不仅提高了性能,还附带了一份证明其可靠性的数学证书。研究人员发现,对于所有数据集,测试误差都可以被保证在训练误差的 5% 以内。

这项工作挑战了长期以来的观点,即认证大型 AI 系统需要海量的数据。研究人员表明,通过专注于合并过程中实际发生变化的少量参数,系统的复杂性变得可以掌控。他们还探索了一种称为“数据依赖先验”(data-dependent priors)的技术,即利用一小部分训练数据来设定一个更好的起始点,从而进行安全性计算。这进一步收紧了保证,证明了该方法是稳健且具有适应性的。该研究并未声称解决了人工智能安全的所有问题,但它为在低数据量环境下(在数据昂贵或难以获取的现实应用场景中至关重要)认证系统提供了一条清晰的路径。

这一发现的影响超越了数字本身。它表明,验证现有 AI 系统的安全性可能比之前认为的要容易。如果用于组合模型的方法可以如此轻易地被认证,那么使用这些方法构建的系统就可以在更高的信心下被信任。研究人员强调,这种方法对图像识别和语言理解都有效,这表明该原理具有通用性,并不局限于特定类型的人工智能。通过证明对于拥有七十亿个参数的模型,仅凭一百个示例就能实现非空的、有意义的保证,该团队为确保人工智能能够安全部署在人类生活中最关键的领域开辟了新的途径。这项工作证明,有时解决复杂的理论问题的关键不在于建造一台更大的机器,而在于从不同的角度去审视现有的机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →