From Hugging Face to GitHub: Tracing License Drift in the Open-Source AI Ecosystem
本文介绍了对开源人工智能生态系统的首次大规模审计,揭示了 35.5% 的模型到应用的转换通过消除限制性条款导致了许可漂移,并引入了一种能够检测出 86.4% 此类冲突的规则引擎,以应对关键的治理挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,人工智能的世界就像一个繁忙且热闹的大厨房,厨师们正在烹饪着有史以来最聪明的食谱。在这个厨房里,“食材”是海量的数据(如照片或文本),“食谱”是基于这些数据训练出的计算机模型,而“成品菜肴”则是人们实际使用的应用程序和工具。但问题在于:每种食材和食谱都附带了一套特定的规则,就像一份秘密合同。有些规则说:“你可以随心所欲地烹饪!”(宽松型),而另一些则说:“如果你出售这道菜,你必须分享你的新食谱,”或者“你不能将其用于军事用途”(限制型)。
问题在于,在创造美妙新菜肴的过程中,许多厨师并没有阅读这些合同。他们可能会拿走一种超级严格的食材,忽略其规则,并将其盛入一道声称对所有人免费开放的菜肴中。这制造了一个法律雷区,原始创造者可能会被起诉,而吃这些食物的人也可能在不知情的情况下陷入麻烦。科学家们称之为“许可证漂移”(license drift),即规则随着食物从储藏室移动到餐盘的过程中被剥离了。一支研究团队决定调查这个厨房到底有多混乱。
研究人员詹姆斯·朱伊特(James Jewitt)及其来自女王大学(Queen's University)的团队,决定对这个 AI 厨房进行一次巨大的、端到端的审计。他们不仅查看了几个货架,还扫描了惊人的 364,917 个数据集(原始食材)、160 万个模型(食谱)以及 14 万个 GitHub 项目(最终菜肴)。他们想要观察随着食材从数据阶段移动到模型阶段,最后进入人们日常使用的应用程序阶段时,规则是否得到了遵守。
他们的发现有点像是发现大多数厨师都在无视食材上的“禁止销售”标志。他们的研究揭示了一种大规模的“许可证漂移”模式,即限制性规则被系统性地抹除。具体而言,他们发现,当一个模型转化为软件应用程序时,35.5% 的情况下,新应用会丢弃原始模型的限制性规则,并将其重新标记为“宽松型”(对所有人免费)。这就像是一位厨师拿取了一种仅限家庭烹饪使用的珍稀受保护香料,将其加入餐厅菜单,并声称整道菜可以由任何人免费复制。
最令人震惊的部分在于这种“漂移”发生在最后阶段。当带有特定“机器学习”许可证(通常包含关于如何使用它们的特殊规则)的模型转化为应用程序时,99.6% 的这些特殊规则消失了。只有 0.4% 的最终应用程序保留了原始限制。这似乎表明,开发者将这些复杂的、规则繁多的模型视为简单的、免费的软件库,完全忘记了那些细则。
然而,团队并不仅仅是指出混乱,他们还构建了一个工具来帮助清理它。他们创建了一个名为 LicenseRec 的原型引擎。把它想象成一个超级聪明的厨房检查员,它可以阅读所有那些令人困惑的合同,并立即告诉你一道菜是否合法。他们测试了这个工具,发现它可以解决软件应用中 86.4% 的许可证冲突。这表明,大多数法律麻烦并不是因为食材无法混合,而是因为人们选错了菜肴的标签。
但工具的能力也是有限的。研究人员发现,大约有 14.2% 的冲突是“无法解决的”。这些就像是试图将一种“无肉”食材与一个“必须使用肉类”的食谱进行混合;无论如何重新贴标签都无法解决问题。如果原始食材严格禁止商业用途,你就不能直接在最终菜肴上贴一个“商业免费”的标签。在这种情况下,唯一的解决方案是回到源头,选择另一种完全不同的食材。
简而言之,这项研究表明,虽然我们拥有修复 AI 世界中大多数偶然法律错误的工具,但我们无法修复那些从一开始就固化在食材中的错误。研究人员得出结论,虽然像 LicenseRec 这样的自动化工具是向前迈出的一大步,但开发者仍需成为细心的侦探,在开始烹饪前检查每种食材的规则。如果没有人类的这种勤勉,AI 厨房仍然是一个规则不断被遗忘的危险之地。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。