← 最新论文
🤖 AI

Closing the AI Trust Gap: The Case for Independent Certification for Trustworthy AI

本文认为,当前的“人工智能信任差距”源于无法对负责任的人工智能实践进行外部验证与奖励,而通过实施一种独立的、以结果为导向的认证体系,将重心从内部流程转向可验证的现实世界效益,可以弥合这一差距,从而实现市场差异化并为值得信赖的人工智能提供商业激励。

原作者: Trisevgeni Papakonstantinou, Cansu Canca, Farah Nanji, Waheedullah Pardess, Jen Weedon, Jasmijn Remmers, Eliza Krigman, Matthew Ball, Yalda Daryani, Kiran Iqbal, Francielle Vargas, María Llorente Sánc
发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Trisevgeni Papakonstantinou, Cansu Canca, Farah Nanji, Waheedullah Pardess, Jen Weedon, Jasmijn Remmers, Eliza Krigman, Matthew Ball, Yalda Daryani, Kiran Iqbal, Francielle Vargas, María Llorente Sánchez, Joe Humphreys, Fendi Tsim, Kelly Fitzpatrick, Jeff Dunn, Catherine Feldman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

无形的计分卡:为什么优秀的 AI 需要一枚勋章

想象一下,你正走进一个巨大的、充满未来感的市场,那里每个人都在卖机器人。有些机器人的设计包含了最顶尖的安全特性、最公平的规则和最严谨的工程技术;而另一些则是为了快速赶工,通过走捷径制造出来的,甚至可能隐藏着一些故障。问题在于,所有的店主都佩戴着同样闪亮的“我们负责任!”勋章。仅凭肉眼,你无法分辨其中的区别。这就是当今**人工智能(AI)**的世界。

在计算机科学领域,**“负责任的 AI”(Responsible AI)“可信赖的 AI”(Trustworthy AI)**之间存在着巨大的差异。可以将“负责任的 AI”想象成一位在厨房里完美遵循食谱的厨师:他们精准测量食材,洗净双手,并遵守每一项安全规则。这很棒,但这并不能保证做出的蛋糕一定美味,或者吃完后不会让你生病。“可信赖的 AI”则是最终的结果:那块既美味又安全、且能带给你快乐的蛋糕。目前,我们有很多遵循食谱的厨师,但我们还没有一种方法让顾客知道哪位厨师真的烤出了好蛋糕。我们需要一个系统,将“我们努力尝试了”转化为“我们确实交付了成果”。这正是来自世界各地大学和研究实验室的一群专家试图解决的难题。

巨大的 AI 信任鸿沟

由数字信任委员会(Digital Trust Council)发布的一篇新论文指出,我们正面临着巨大的“信任鸿沟”。尽管各家公司投入了数百万美元试图构建安全且公平的 AI,但市场却不知道该如何奖励它们。这就像一场比赛,每个人都跑了相同的距离,但终点线却是隐形的。

作者认为,目前的系统之所以失效,主要是因为三个被称为“结构性差距”的原因:

1. “柠檬”问题:你无法辨别优劣
想象你在买一辆二手车。如果卖家说“这辆车很安全”,但你完全没有办法检查刹车或引擎,你可能只会选择最便宜的那辆。在 AI 世界中,那些在安全团队和伦ks伦理委员会上投入巨资的公司,在客户眼中看起来与那些只说“相信我们”的公司并无二致。因为买家(如投资者或普通大众)无法分辨其中的区别,他们就不会为更安全的“汽车”支付溢价。这使得追求安全性变成了一个糟糕的商业决策。论文称之为“柠檬市场”,即优质产品会被挤出市场,因为没有人能证明自己是好的。

2. 测试的是引擎,而非驾驶体验
目前,当我们测试 AI 时,大多是在车库里测试其“引擎”。我们通过一系列计算机测试来看它是否能通过考试。但 AI 不仅仅是一个大脑;它是一个在现实世界中与真实人类互动的完整系统。论文指出,我们目前是在孤立地测试模型,就像检查汽车能否启动,却没看它在雨天的公路上行驶是否安全。一个机器人可能在实验室里表现完美,但在实际帮助医生或老师时却表现异常。我们需要测试整个“社会技术系统”——包括机器人、使用者以及它所处的环境——并且要进行长期的观察,而不仅仅是几分钟的实验室测试。

3. “不要做坏事”的陷阱
目前,整个系统都痴迷于确保 AI 不会做坏事。这就像一所学校,只有当你没被处分时,才会给你一颗小红星。但如果一个人从未被处分,却也从未帮助过任何人呢?论文指出,我们拥有衡量伤害的优秀工具(例如“这个 AI 是否说了难听的话?”),但几乎没有任何衡量益处的工具(例如“这个 AI 是否帮助学生学得更快了?”)。由于我们只衡量 AI 应该“避免”什么,公司一旦达到了“最低安全线”就会停止工作。他们没有动力去追求卓越,因为“不作恶”是唯一能获得奖励的标准。

缺失了什么?独立的勋章

该论文研究了其他行业是如何解决这些问题的。在医疗领域,医生不能只说“我认为这种药有效”,他们必须通过独立测试来证明,并且在人们服用药物后,必须严格报告副作用。在建筑施工领域,有绿色建筑标签(如 LEED),证明一栋建筑确实节能,而不仅仅是建筑师“声称”它节能。在网络安全领域,公司接受第三方审计,以证明他们能够保护你的数据安全。

作者认为,AI 也需要类似的东西:独立的、以结果为导向的认证。

这不仅仅是另一套让公司遵守的规则,它是一个将一切联系在一起的“连接层”。其运作方式如下:

  • 第三方核查: 由一个独立的团体(而非制造 AI 的公司)来验证结果。
  • 现实世界的证据: 他们不仅检查代码,还会检查 AI 在现实世界中随着时间的推移是否真的对人类有所帮助。
  • 清晰的信号: 最终结果是一个买家、投资者和监管机构都能理解的清晰勋章或标签。它会告诉你:“这个 AI 不仅是安全的,它还确实产生了积极的影响。”

为什么这在当下至关重要

论文指出,如果我们不尽快建立这样的系统,AI 可能会走上社交媒体的老路。社交媒体公司构建了具有成瘾性和危害性的平台,因为它们在追求“参与度”(你在应用上停留的时间)时,没有人去检查这是否对你的心理健康有益。等到政府介入干预时,破坏已经造成。

作者相信我们可以避免这种命运。我们不需要从零开始发明新技术;我们已经拥有了衡量安全性和公平性的工具。我们缺失的是将这些测量结果转化为市场可信信号的基础设施

他们提出了一个三层系统:

  1. 监管(Regulation) 设定法律底线(你必须做到的最低要求)。
  2. 标准(Standards) 将这些规则转化为技术步骤。
  3. 认证(Certification) 提供你确实做到了这些要求的独立证明。

论文总结道,这是一个关于时机的选择。我们可以等待 AI 造成重大问题后再去修补,也可以在技术仍在成长阶段时就建立起这个“信任勋章”系统。作者建议,通过让“可信赖性”变得可衡量、可比较且可获得奖励,我们可以将“负责任的 AI”从一项成本转变为一种竞争优势。这关乎从“我们承诺我们是好的”转向“这是我们做得好的证明”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →