← 最新论文
🤖 AI

Reproducibility is the New Copyleft: Defining AGI-oriented Reproducible Builds

本文认为,由于无法审计和重构复杂的人工智能人工制品,传统的著佐权(copyleft)许可协议对于通用人工智能(AGI)是无效的,因此提出 AGI 的治理必须转向一种基于可重现构建和协议耦合的框架,以确保真正的透明度和用户自由。

原作者: Masayuki Hatta

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Masayuki Hatta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:为什么“开源”已经不够了

想象一下,你从一家面包店买了一个蛋糕。在软件的“旧时代”(即“第一次解放”),如果你想知道这个蛋糕是怎么做出来的,面包师在法律上有义务把食谱交给你。这就是著权保护(Copyleft)(例如 GPL 许可证)的承诺:“你可以拥有这个蛋糕,但如果你要出售它的副本,你也必须把食谱公开。”

这之所以奏效,是因为食谱(源代码)与蛋糕(最终程序)之间存在着明确的一对一联系。如果你遵循食谱,你就能做出完全相同的蛋糕。

AI 面临的问题:
今天的 AI 模型(以及未来的超智能 AGI)就像是由一台巨大的、隐形的机器烘焙出来的蛋糕。

  1. 食谱缺失: 即使面包师把代码给了你,这个“蛋糕”(AI)还依赖于特定的原料(训练数据)、烤箱的精确温度(硬件)、随机搅拌的顺序(随机种子)以及特定品牌的面粉(软件工具)。
  2. 结果不可预测: 如果你尝试用同样的食谱,但换了稍微不同的面粉或不同的烤箱,你会得到一个不同的蛋糕。你无法验证你买到的蛋糕是否真的由你得到的那个食谱制作而成。
  3. “魔改重写”: 一个聪明的 AI 助手可以观察一个“食谱”(GPL 代码),并瞬间将其改写成一个新的食谱,这个新食谱能实现完全相同的功能,却声称是“自由”的(如 MIT 许可证)。这就像一个伪造者可以完美地复制一幅画作,以至于原作者都无法证明它是抄袭。这破坏了过去保护开源软件的法律规则。

论文的解决方案:
作者增田真之(Masayuki Hatta)认为,我们不能仅仅依赖于分享“食谱”。相反,我们需要可复现构建(Reproducible Builds)

不要把它仅仅看作是分享食谱,而要把它看作是分享一段穿越时空的、完美的整个烘焙过程的录像

  • 目标: 如果你拥有完全相同的原料、完全相同的烤箱设置以及完全相同的搅拌视频,你必须能够烤出一个与面包店卖出的蛋糕**比特级一致(bit-for-bit identical)**的蛋糕。
  • 新规则: “开源 AI”不应仅仅意味着“我们向你展示代码”。它应该意味着“我们证明,如果你使用我们的代码和数据,你一定会得到与我们完全相同的结果”。

“可复现 AI”的 7 条规则(面向 AGI 的可复现构建)

论文提出了七项具体的具体要求来实现这一目标。以下是其简易说明:

  1. 列出每一种原料(完整输入枚举): 你不能只说“我们使用了互联网数据”。你必须列出确切的数据、确切的代码、使用的确切计算机芯片以及生成的确切随机数。不能有模糊的描述。
  2. 完美的烘焙过程(确定性训练流水线): 烘焙机器必须经过设置,使得如果你用同样的原料运行两次,每次都能生产出完全相同的蛋糕。不能出现“也许这次味道会有点不一样”。
  3. 锁住烤箱(可验证工具链): 你必须证明使用了哪种烤箱和工具。如果特定类型的计算机芯片会改变蛋糕的味道,你必须将食谱锁定到该特定芯片上,或者固定工具使其在任何芯片上表现一致。
  4. 第三方品鉴员(第三方证明): 大多数人负担不起自己去烤整个蛋糕。因此,我们需要独立的“品鉴员”(就像食品安全检查员一样),他们拿着食谱亲自烘焙,然后确认:“是的,这确实是完全相同的蛋糕。”
  5. 自我改进日志(自我改进轨迹记录): 未来的 AI 可能会为了变得更好而改写自己的食谱。如果它这样做,它必须保留一份永久的、不可更改的日记,记录它对自己进行的每一次改动。你需要看到蛋糕进化的历史。
  6. “自我检查”规则(递归可验证性): 这是最难的部分。如果 AI 改写了自己的食谱,那么新的食谱也必须能够产生一个可复现的蛋糕。验证过程的能力必须在 AI 改变自身的过程中得以延续。(论文承认这是一个我们尚未解决的巨大研究挑战)。
  7. 保持现实(可持续的经济模型): 我们现在不能要求每一个微小的 AI 应用都达到完美的复现性;这太贵了。我们应该从较小的、重要的系统开始,随着技术变得更便宜、更好,再逐渐加入这些规则。

“链接”问题:协议 vs 平台

论文还探讨了 AI 系统之间是如何交流的。

  • 旧方式(平台): 想象一个围墙花园,一家公司拥有花园、大门和路径。如果你想去拜访朋友,必须经过他们的门。这是许多当前 AI 工具的工作方式。
  • 新方式(协议): 想象一个公共道路系统(类似于互联网或电子邮件)。任何人都可以建造一辆车(AI 助手)或一个加油站(工具),并且它们都可以使用相同的交通规则进行交流。

作者认为,对于 AI 与工具交流的“道路”(协议),我们不应该使用版权法(Copyleft)。相反,我们需要协议治理(Protocol Governance)

  • 类比: 想象 电子邮件 (SMTP)。没有人拥有电子邮件协议。你可以使用 Gmail、Outlook 或私有服务器,它们都能协同工作。规则是中立的。
  • 警告: 如果一家公司(例如 Anthropic 通过其“模型上下文协议”即 MCP)控制了 AI 如何与工具对话的规则,他们就会成为“守门人”。我们需要确保这些规则是开放的标准,不被任何单一公司所有,从而让 AI 工具能够公平竞争。

结论

论文得出结论:如果 AI 工具本身是黑箱,那么“第二次解放”(即 AI 将赋予每个人编程能力的理念)就是一个陷阱。

  • 第一次解放: 给了我们代码(食谱)。
  • 第二次解放: 必须给我们可验证的过程(证明食谱确实能做出那个蛋糕的证据)。

如果我们没有可复现构建,我们就不是自由的;我们只是在盲目相信 AI 不会对我们撒谎。那不是自由,那是信仰。而对于未来的超智能 AI,我们需要的是事实,而不是信仰。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →