← 最新论文
💻 computer science

"Abuse Risks are Often Inherent to Product Features": Exploring AI Vendors' Bug Bounty and Responsible Disclosure Policies

本文分析了 264 家 AI 厂商的漏洞披露政策,揭示了许多厂商缺乏明确的指南,或明确排除了诸如越狱和幻觉等关键的 AI 特定风险,同时识别出三种截然不同的厂商类型,并强调了当前行业实践与现实世界 AI 事件紧迫性之间存在的显著差距。

原作者: Yangheran Piao, Jingjie Li, Daniel W. Woods

发布于 2026-01-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Yangheran Piao, Jingjie Li, Daniel W. Woods

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下人工智能(AI)的世界就像一座繁忙、喧闹的大都市,每天都有公司在建造新的、神奇的工具。有些工具可以写故事,有些可以诊断疾病,还有些甚至可以驾驶汽车。但就像任何新技术一样,这些工具的根基也存在着裂缝——漏洞(vulnerabilities)

当一个普通的软件工具出现故障时,有一个成熟的修复系统:漏洞赏金计划(Bug Bounty Programs)。你可以把它们想象成“通缉令”。公司会悬赏(提供金钱奖励)给任何发现其墙壁上有洞并告知他们的人,而不是让小偷溜进去。

这篇论文是一份关于 AI 公司在为它们的新型神奇工具张贴这些“通缉令”方面做得如何的成绩单。来自爱丁堡大学的研究人员调查了 264 家不同的 AI 公司,以观察它们是否已经准备好处理这些新型的裂缝。

以下是研究结果,通过简单的形式进行了拆解:

1. “沉默的大多数”与“缺席者”

研究人员发现,36% 的 AI 公司完全没有“通缉令”

  • 类比: 想象你走进一家商店,想告诉老板:“嘿,你的前门没锁”,但老板既没有信箱,也没有电话号码,更没有写着“在此报告问题”的告示牌。你只能靠猜来告诉谁,或者更糟,他们可能会无视你。
  • 现实情况: 只有 18% 的这类公司明确表示:“我们接受关于 AI 特定问题的报告。”其余的公司要么只有不提及 AI 的通用规则,要么完全保持沉默。

2. 什么才算是一个“漏洞”?(范围)

论文发现,公司对于什么才算是一个值得付费的“漏洞”非常挑剔。它们划定了一道分界线:

  • “我们会付钱”清单(范围内):
    • 类比: 如果有人偷了你的钥匙、撬了你的锁或潜入了你的银行金库,那就是犯罪。
    • 现实情况: 公司很乐意为窃取数据入侵系统复制其秘密 AI 模型等行为付费。这些是发生在 AI 内部的传统安全犯罪。
  • “不是我们的问题”清单(范围外):
    • 类比: 如果你要求一个机器人写一首诗,而它不小心写了一些粗鲁的内容,或者它开始产生幻觉(胡编乱造),公司会说:“这只是机器人的思考方式,不是锁坏了。”
    • 现实情况: 公司经常拒绝关于越狱(Jailbreaking)(诱导 AI 违反其规则)、幻觉(Hallucinations)(AI 撒谎)或有害输出(Harmful Output)(AI 表现得刻薄或传播谎言)的报告。它们通常声称这些是产品的“固有特性”,而非漏洞。

3. 三种类型的 AI 公司

研究人员将 264 家公司分为三种不同的“性格”:

  • 🌟 积极的澄清者 (17%):
    • 他们是谁: 像 Google、Microsoft 和 Meta 这样的大型玩家。
    • 他们的做法: 他们有清晰的告示,上面写着:“这是我们愿意支付报酬的具体内容,这是我们不支付的内容,以及报酬金额是多少。”他们甚至有专门的指南,指导如何安全地测试他们的 AI。他们将 AI 漏洞视为一个严肃且独特的类别。
  • 🤐 沉默者 (44%):
    • 他们是谁: 主要是使用 AI 的应用程序(例如客户服务应用中的聊天机器人)。
    • 他们的做法: 他们有“通缉令”,但那是为传统软件编写的。它完全没提到 AI。如果你发现了一个 AI 漏洞,他们可能会修复它,但他们不会告诉你是否符合领取奖励的资格,也不会告诉你他们将如何评判。这就像走进一家店,经理在后屋,根本不出来和你交流。
  • 🚫 限制性者 (39%):
    • 他们是谁: 规模较小的供应商或那些单纯不想麻烦的人。
    • 他们的做法: 他们要么完全没有联系方式,要么明确表示:“我们不接受 AI 漏洞报告。”他们可能会说:“如果你试图破坏我们的 AI,我们不会付钱给你,我们甚至可能还会生气。”

4. “滞后”问题

论文发现行业反应中存在显著的时间延迟,或者说“滞后”。

  • 类比: 想象科学家们在实验室里发现了一种新型桥梁是不稳固的(学术研究)。接着,人们开始从桥上掉下来(现实世界的事故)。最后,过了好几年,桥梁公司才更新了安全手册,写道:“是的,这种桥是不稳固的,以下是报告方式”(厂商政策)。
  • 现实情况: 学术研究人员多年来一直在研究 AI 的弱点。现实世界中发生的 AI 事故也已经持续了很长时间。但 AI 公司直到现在(主要是在 2023 年和 2024 年)才开始更新其官方规则,以承认这些特定的问题。它们的反应比研究人员和事故发生的速度都要慢。

5. 巨大的脱节

公众的担忧与公司的关注点之间存在错位。

  • 公众的恐惧: 人们主要担心 AI 会变得刻薄、传播谎言(虚假信息)或存在偏见(歧视)。这些属于“内容安全”问题。
  • 公司的关注点: 公司主要担心“技术安全”问题,比如黑客窃取他们的代码或数据。
  • 结果: 如果你报告说一个 AI 正在传播仇恨言论,公司可能会说:“这不是安全漏洞,这是一个安全问题(Safety issue),我们不为此付费。”但如果你报告一名黑客偷走了 AI 的“大脑”,他们会付给你一大笔钱。

总结

论文得出结论,虽然 AI 行业正在飞速发展,但其“安全网”(漏洞赏金计划)仍处于编织阶段。许多公司甚至还没有开始编织,而那些已经开始编织的公司,大多只专注于捕捉小偷,而不是修复 AI 可能会变得粗鲁或错误的问题。研究人员建议,为了实现真正的 AI 安全,公司需要停止将这些“粗鲁 AI”的问题仅仅视为“特性”,而应将其视为需要报告并修复的“漏洞”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →