Closing the AI Trust Gap: The Case for Independent Certification for Trustworthy AI
本文认为,当前的“人工智能信任差距”源于无法对负责任的人工智能实践进行外部验证与奖励,而通过实施一种独立的、以结果为导向的认证体系,将重心从内部流程转向可验证的现实世界效益,可以弥合这一差距,从而实现市场差异化并为值得信赖的人工智能提供商业激励。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
无形的计分卡:为什么优秀的 AI 需要一枚勋章
想象一下,你正走进一个巨大的、充满未来感的市场,那里每个人都在卖机器人。有些机器人的设计包含了最顶尖的安全特性、最公平的规则和最严谨的工程技术;而另一些则是为了快速赶工,通过走捷径制造出来的,甚至可能隐藏着一些故障。问题在于,所有的店主都佩戴着同样闪亮的“我们负责任!”勋章。仅凭肉眼,你无法分辨其中的区别。这就是当今**人工智能(AI)**的世界。
在计算机科学领域,**“负责任的 AI”(Responsible AI)与“可信赖的 AI”(Trustworthy AI)**之间存在着巨大的差异。可以将“负责任的 AI”想象成一位在厨房里完美遵循食谱的厨师:他们精准测量食材,洗净双手,并遵守每一项安全规则。这很棒,但这并不能保证做出的蛋糕一定美味,或者吃完后不会让你生病。“可信赖的 AI”则是最终的结果:那块既美味又安全、且能带给你快乐的蛋糕。目前,我们有很多遵循食谱的厨师,但我们还没有一种方法让顾客知道哪位厨师真的烤出了好蛋糕。我们需要一个系统,将“我们努力尝试了”转化为“我们确实交付了成果”。这正是来自世界各地大学和研究实验室的一群专家试图解决的难题。
巨大的 AI 信任鸿沟
由数字信任委员会(Digital Trust Council)发布的一篇新论文指出,我们正面临着巨大的“信任鸿沟”。尽管各家公司投入了数百万美元试图构建安全且公平的 AI,但市场却不知道该如何奖励它们。这就像一场比赛,每个人都跑了相同的距离,但终点线却是隐形的。
作者认为,目前的系统之所以失效,主要是因为三个被称为“结构性差距”的原因:
1. “柠檬”问题:你无法辨别优劣
想象你在买一辆二手车。如果卖家说“这辆车很安全”,但你完全没有办法检查刹车或引擎,你可能只会选择最便宜的那辆。在 AI 世界中,那些在安全团队和伦ks伦理委员会上投入巨资的公司,在客户眼中看起来与那些只说“相信我们”的公司并无二致。因为买家(如投资者或普通大众)无法分辨其中的区别,他们就不会为更安全的“汽车”支付溢价。这使得追求安全性变成了一个糟糕的商业决策。论文称之为“柠檬市场”,即优质产品会被挤出市场,因为没有人能证明自己是好的。
2. 测试的是引擎,而非驾驶体验
目前,当我们测试 AI 时,大多是在车库里测试其“引擎”。我们通过一系列计算机测试来看它是否能通过考试。但 AI 不仅仅是一个大脑;它是一个在现实世界中与真实人类互动的完整系统。论文指出,我们目前是在孤立地测试模型,就像检查汽车能否启动,却没看它在雨天的公路上行驶是否安全。一个机器人可能在实验室里表现完美,但在实际帮助医生或老师时却表现异常。我们需要测试整个“社会技术系统”——包括机器人、使用者以及它所处的环境——并且要进行长期的观察,而不仅仅是几分钟的实验室测试。
3. “不要做坏事”的陷阱
目前,整个系统都痴迷于确保 AI 不会做坏事。这就像一所学校,只有当你没被处分时,才会给你一颗小红星。但如果一个人从未被处分,却也从未帮助过任何人呢?论文指出,我们拥有衡量伤害的优秀工具(例如“这个 AI 是否说了难听的话?”),但几乎没有任何衡量益处的工具(例如“这个 AI 是否帮助学生学得更快了?”)。由于我们只衡量 AI 应该“避免”什么,公司一旦达到了“最低安全线”就会停止工作。他们没有动力去追求卓越,因为“不作恶”是唯一能获得奖励的标准。
缺失了什么?独立的勋章
该论文研究了其他行业是如何解决这些问题的。在医疗领域,医生不能只说“我认为这种药有效”,他们必须通过独立测试来证明,并且在人们服用药物后,必须严格报告副作用。在建筑施工领域,有绿色建筑标签(如 LEED),证明一栋建筑确实节能,而不仅仅是建筑师“声称”它节能。在网络安全领域,公司接受第三方审计,以证明他们能够保护你的数据安全。
作者认为,AI 也需要类似的东西:独立的、以结果为导向的认证。
这不仅仅是另一套让公司遵守的规则,它是一个将一切联系在一起的“连接层”。其运作方式如下:
- 第三方核查: 由一个独立的团体(而非制造 AI 的公司)来验证结果。
- 现实世界的证据: 他们不仅检查代码,还会检查 AI 在现实世界中随着时间的推移是否真的对人类有所帮助。
- 清晰的信号: 最终结果是一个买家、投资者和监管机构都能理解的清晰勋章或标签。它会告诉你:“这个 AI 不仅是安全的,它还确实产生了积极的影响。”
为什么这在当下至关重要
论文指出,如果我们不尽快建立这样的系统,AI 可能会走上社交媒体的老路。社交媒体公司构建了具有成瘾性和危害性的平台,因为它们在追求“参与度”(你在应用上停留的时间)时,没有人去检查这是否对你的心理健康有益。等到政府介入干预时,破坏已经造成。
作者相信我们可以避免这种命运。我们不需要从零开始发明新技术;我们已经拥有了衡量安全性和公平性的工具。我们缺失的是将这些测量结果转化为市场可信信号的基础设施。
他们提出了一个三层系统:
- 监管(Regulation) 设定法律底线(你必须做到的最低要求)。
- 标准(Standards) 将这些规则转化为技术步骤。
- 认证(Certification) 提供你确实做到了这些要求的独立证明。
论文总结道,这是一个关于时机的选择。我们可以等待 AI 造成重大问题后再去修补,也可以在技术仍在成长阶段时就建立起这个“信任勋章”系统。作者建议,通过让“可信赖性”变得可衡量、可比较且可获得奖励,我们可以将“负责任的 AI”从一项成本转变为一种竞争优势。这关乎从“我们承诺我们是好的”转向“这是我们做得好的证明”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。