← 最新论文
🤖 machine learning

ZKBoost: Zero-Knowledge Verifiable Training for XGBoost

本文介绍了 ZKBoost,这是首个面向 XGBoost 的零知识训练证明协议,它使模型所有者能够在不泄露数据或参数的情况下,对已承诺数据集上的正确训练进行密码学验证,同时通过专用的定点数实现和基于 VOLE 的实例化克服了以往的安全漏洞并实现了高效性。

原作者: Nikolas Melissaris, Antigoni Polychroniadou, Akira Takahashi, Chenkai Weng, Jiayi Xu

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Nikolas Melissaris, Antigoni Polychroniadou, Akira Takahashi, Chenkai Weng, Jiayi Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你聘请了一位厨师,用你提供的特定食材,按照一份复杂且保密的食谱,为一次非常重要的宴会烹饪菜肴。你希望 100% 确定他们确实按照食谱步骤、使用你提供的特定食材进行了烹饪,但你面临两个大问题:

  1. 你无法看到厨房:厨师拒绝让你观看烹饪过程,因为食谱是他们的“商业秘密”(知识产权)。
  2. 你无法看到食材:厨师拒绝向你展示他们使用的具体批次蔬菜,因为该数据属于一家私人农场(隐私)。

通常,你只能信任这位厨师。但如果他们是个骗子呢?如果他们买了一份预制餐,贴上“新鲜烹制”的标签,然后端给你呢?

ZKBoost 是一种解决这一问题的新型数字工具。它允许厨师(模型所有者)向你(验证者)证明,他们完全按照规则、使用你提供的特定食材烹制了这顿饭,而无需向你展示食谱或食材

以下是论文如何解释这一“魔法”,将其分解为简单概念:

1. “黑盒”问题

在机器学习领域,XGBoost 就像一位超级明星厨师。它极其擅长基于数据表格预测事物(例如,判断信用卡交易是否欺诈,或患者是否患病)。

然而,当一家公司训练 XGBoost 模型时,他们会将数据和最终的“食谱”(模型)保密。如果客户想要验证模型未被伪造或未基于不良数据训练,他们通常无法做到。在不违反隐私法或泄露商业秘密的前提下,他们无法窥探内部。

2. “零知识”魔术

论文介绍了 ZKBoost,它使用一种称为**零知识证明(ZKP)**的密码学技术。

将零知识证明想象成一面魔镜

  • 厨师站在镜子前。
  • 镜子向客户展示一个发光的绿色对勾,显示:“是的,烹饪过程正确无误!”
  • 但镜子不会显示厨师的脸、食材或食谱。它只证明该动作是正确完成的。

3. 为什么以前这如此困难?

作者解释说,为 XGBoost 做到这一点,就像试图通过展示你铺设了每一块砖来证明你建造了一座房子,但你必须蒙着眼睛,并用一种无人理解的语言去做。

  • “眼罩”(盲划分):XGBoost 的工作原理是不断将数据分类到不同的桶中(就像按大小分拣苹果)。以“盲”密码学方式执行此操作极其缓慢且昂贵。
  • “秘密配方”(树分裂):模型基于隐藏的阈值做出决策。以前的尝试存在“泄漏”——它们意外地揭示了决策树的形状(拓扑结构),而这正是商业秘密。
  • “数学故障”(安全漏洞):一些旧方法允许不诚实的证明者通过引发“数学溢出”(就像计算器从 999 滚回到 000)来伪造正确结果,从而作弊。

4. ZKBoost 解决方案:两大技巧

论文提出了两项主要创新来解决这些问题:

技巧 A:“自底向上”检查(通用模板)

通常,要验证一棵树是否构建正确,你必须从头重新运行整个烹饪过程,这非常缓慢。

  • 旧方法:看着厨师自上而下、一步步地构建树。
  • ZKBoost 方法:作者创建了一种名为 CertXGB 的新方法。他们不是看着厨师构建树,而是查看完成的树自底向上(从下往上)工作。
    • 他们先检查叶子节点,然后是分支,最后是树干。
    • 这使得他们能够同时验证多棵树(并行处理),使证明速度比以前的方法快 3 到 6 倍
    • 关键在于,这种方法检查数学计算而不揭示哪些分支被剪除(修剪),从而保持树的形状保密。

技巧 B:“定点”切换(安全修复)

XGBoost 通常使用“浮点数”数学(如 3.14159...),这对密码学来说很麻烦,因为不同机器处理小数的方式不同。

  • 问题:如果数学不精确,证明就会失败。此外,浮点数数学庞大且难以证明。
  • 解决方案:作者将 XGBoost 转换为使用定点算术
    • 类比:他们不再用“杯子和分数”(浮点数)来测量食材,而是全部用“汤匙”(整数)来测量。
    • 他们证明,即使使用“汤匙”而不是“杯子”,最终菜肴的味道也与原始浮点版本完全相同(精度在 1% 以内)。
    • 这使得数学变得“易于证明”,能够防止溢出作弊,并且速度更快。

5. 结果:快速且安全

作者在真实世界的数据集(如信用卡欺诈和癌症检测)上测试了他们的系统。

  • 速度:他们的系统比最接近的竞争对手(Sparrow)快得多,尤其是在处理大量数据时。
  • 准确性:“汤匙”版本(定点)与“杯子”版本(浮点)一样准确。
  • 安全性:他们修复了允许作弊者在以前的系统中伪造结果的“数学溢出”漏洞。

总结

ZKBoost 是首个允许模型所有者说“我保证我使用我们的特定规则在你的私有数据上训练了这个 AI",并通过密码学收据证明其真实性的系统。它通过以下方式实现:

  1. 自底向上检查工作以节省时间。
  2. 切换到更简单的数学(整数)以确保安全性和速度。
  3. 完全隐藏食谱和食材,同时仍能证明烹饪是诚实的。

这意味着客户终于可以信任他们使用的 AI 模型是真实的,而无需迫使公司泄露其商业秘密或私人客户数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →