← 最新论文
🤖 machine learning

RiskNet: A large-scale dataset of AI risk incidents from news with alignment and multi-dimensional annotations

RiskNet 是一个源自新闻来源的大规模多语言人工智能风险事件数据集,它采用了一套用于识别、对齐和多维标注的结构化流水线,旨在支持人工智能安全、治理及风险分析领域的实证研究。

原作者: Leihan Zhang, Wecheng Ye, Xianlong Ma, Haochuan Liu, Yang Li, Qianyu Zhang, Jinliang Chen, Qiang Yan

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Leihan Zhang, Wecheng Ye, Xianlong Ma, Haochuan Liu, Yang Li, Qianyu Zhang, Jinliang Chen, Qiang Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

请将人工智能(AI)的世界想象成一座巨大且繁忙的城市。每天,都有新的 AI 工具被制造出来,并投入到医院、学校、银行和我们的手机中使用。但就像任何大城市一样,有时也会出问题。汽车会发生碰撞,电网会瘫痪,人们会受伤。在 AI 城市中,这些“事故”被称为 AI 风险事件——比如聊天机器人传播谎言、人脸识别系统误认身份,或者自动驾驶汽车犯下危险错误。

直到现在,试图研究这些事故就像是通过询问人们从窗户里看到了什么来绘制城市的交通拥堵地图一样。信息是零散的、混乱的,语言各异,而且往往只是传闻或观点,而非关于特定事故的具体事实。

“RiskNet” 正式登场。

把 RiskNet 想象成一个由北京邮电大学研究人员建造的巨型、高科技交通控制中心。它是一个庞大的数字图书馆,旨在捕捉、组织并理解新闻中报道的每一次 AI 事故。

以下是它的工作原理,分为简单的几个步骤:

1. 大过滤器(寻找事故)

研究人员从一座新闻大山开始——其中包含来自世界各地、多种不同语言的数亿篇文章。

  • 问题: 这些文章中的大部分只是人们在谈论 AI 风险(例如“AI 未来可能会很危险”),或者是关于通用技术的新闻。它们并不是关于已经发生的特定事故。
  • 解决方案: 他们使用了一个智能“筛子”(由 AI 本身驱动)来过滤噪音。它提出了两个问题:
    1. “这是关于 AI 的吗?”
    2. “这里是否真的发生了一起特定的事故?”
    • 类比: 想象一个夜店的保安。如果你只是在谈论音乐可能会有多酷,你进不去。但如果你有一张已经开始演出的特定演出的门票,你就能通过。RiskNet 过滤掉了这些“空谈”,只保留了“行动”。

2. 侦探工作(连接点滴)

一旦找到了关于真实事故的文章,他们面临着一个新的问题:一次事故往往对应着许多个故事。

  • 场景: 想象一个扫地机器人厨房着火了。一家中国的报纸报道了它;一个美国的博客写了它;一家法国的电视台也报道了它。它们都在讨论同一场火灾,但在看起来却是三个不同的故事。
  • 解决方案: RiskNet 扮演着超级侦探的角色。它阅读所有这些不同的报告,然后说:“等等,这三篇文章描述的是完全相同的事件!”随后,它将它们粘合在一起,形成一个单一的“事件簇”(Incident Cluster)。
  • 类比: 想象这就像一个拼图游戏。你拥有来自不同盒子的 50 个不同碎片,它们都展示了同一幅画的一部分。RiskNet 对它们进行分类,这样你就能看到事故的全貌,而不是仅仅看到一堆混乱的碎片。

3. 标签系统(整理档案)

现在他们已经有了一份干净的独特事故清单,他们需要对这些事故进行组织,以便研究人员能够发现规律。

  • 他们创建了一个带有特定标签的文件柜,为每起事故进行标注:
    • 谁受到了伤害?(受害者)
    • 出了什么问题?(原因)
    • 情况有多严重?(严重程度)
    • 发生在何处?(地点)
    • 涉及哪种 AI?(工具)
  • 类比: 这就像医院急诊室的登记日志。他们不仅仅是写“病人来了”,而是写下“病人:约翰·多伊;伤情:腿部骨折;原因:自行车事故;严重程度:中度”。这使得询问诸如“上个月发生了多少起自行车事故?”之类的问题变得非常容易。

他们发现了什么?

其成果便是 RiskNet,一个包含以下内容的数据库:

  • 扫描了数亿篇新闻文章。
  • 数十万份 AI 相关风险报告。
  • 超过 54,000 个独特的、经过验证的事故簇(即多个新闻故事被合并为一个事件)。

他们发现,大多数事故获得的关注度非常低(就像一次轻微的擦碰),但少数极其重大且著名的事故会引发数千篇新闻报道(就像一场大规模的城市停电)。数据还显示,“能力不足”(AI 仅仅是做得不够好)和“网络攻击”是最常见的两类问题。

为什么这很重要?

研究人员表示,这个数据集是未来的基石

  • 对于政策制定者: 它帮助他们看到真实的问题,而不仅仅是吓人的标题,从而制定更好的规则。
  • 对于科学家: 它提供了一种标准化的方式,来测试新的 AI 系统是否比旧的系统更安全。
  • 对于每个人: 它弥合了“高层原则”(如“AI 应该是安全的”)与“混乱现实”(即实际发生了什么)之间的鸿沟。

重要提示: 该论文强调,这是一个研究工具,而非法庭。它组织的是新闻所发生的事情。它并不证明法律上的罪责或在法庭上分配责任;它只是帮助我们理解 AI 风险的格局,以便我们能更好地研究它们。

简而言之,RiskNet 将混乱的新闻报道风暴转化为一张清晰、有序的地图,展示了 AI 在哪里跌跤,从而帮助我们弄清楚如何让它走得更稳。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →