← 最新论文
🤖 AI

A Large-Scale Measurement of AI Bill of Materials Completeness in Hugging Face Models

本文通过对约 97,500 个 Hugging Face 模型进行实证评估,发现虽然所需的结构化字段完整存在,但关于模型卡片、许可、局限性和安全风险等关键 AI 特定文档仍存在显著的不完整性。

原作者: Md Erfan, Ahmed Ryan, Md Rayhanur Rahman

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Md Erfan, Ahmed Ryan, Md Rayhanur Rahman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你刚刚从一家热门餐车买了一个美味的预制三明治。它看起来很棒,但包装纸上却什么也没写。你完全不知道里面有什么配料,面包是在哪里烘焙的,馅料是谁做的,或者是否含有会导致你过敏的坚果。在人工智能的世界里,开发者经常做同样的事情:他们从庞大的在线库中抓取强大的预训练 AI 模型来构建自己的应用程序,却不知道其中的“配料”或“食谱”。这是有风险的,因为如果 AI 稍后犯了错误或表现异常,没有人知道原因。为了解决这个问题,科学家们正试图创造一种被称为“AI 物料清单”(AIBOM)的东西。你可以把 AIBOM 想象成一份数字营养标签或一份详细的收据,它会告诉你关于该 AI 模型的一切:它是用什么训练的,由谁制作,你需要遵守哪些规则(许可),以及它的弱点在哪里。现在的大问题是,如果我们自动生成这数百万个 AI 模型的这些“营养标签”,它们到底是在告诉我们真相,还是仅仅是些空洞的包装纸?

这篇论文通过调查托管在 Hugging Face(互联网上最大的 AI 模型交易市场)上的近 98,000 个 AI 模型的“营养标签”,对这个问题进行了深入探讨。研究人员使用了一种特殊的工具来自动扫描这些模型并生成它们的 AIBOM,然后检查了这些标签的完整性和实用性。他们发现,虽然这些标签在技术上是有效的——这意味着它们具有正确的结构和基本的 ID 标签——但在重要内容方面却出奇地空洞。这就像是一张收据,上面列出了价格和商店名称,但却把配料、过敏原警告和保质期完全留白了。

研究显示,生成的 AIBOM “完整度中等”,平均得分约为 100 分中的 54 分。好消息是,文档的基本骨架始终存在;该工具 100% 成功识别了模型的名称、版本和格式。然而,文档的“肉”却缺失了。诸如用于训练的具体数据集、安全警告、伦理限制和环境影响信息等关键细节在很大程度上是缺失的。例如,虽然研究人员发现约 39% 的模型列出了其训练数据集,但在生成的标签中,包含“伦理考量”或“预期用途”信息的比例竟然高达 0%。甚至对于模型实际功能的“有意义描述”在 99.8% 的案例中也是缺失的,通常被空白占位符所取代。

研究人员还发现,这些标签的质量很大程度上取决于原始模型的文档化程度。那些附带研究论文或有明确训练数据说明的模型,往往能获得更好的 AIBOM,拥有更多指向代码和安全检查的链接。但对于绝大多数模型,尤其是那些没有这些额外信号的模型,生成的标签依然很弱。这项研究表明,尽管我们拥有创建这些透明度文档的技术,但 AI 社区尚未提供足够的信息来填充它们。在模型创建者开始将文档视为产品必要组成部分(就像厨师在菜单上列出配料一样)之前,这些 AI “营养标签”将始终是不完整的,让开发者和用户对他们实际正在使用的东西感到茫然。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →