← 最新论文
💻 computer science

A Subjective Logic-based method for runtime confidence updates in safety arguments

本文提出了一种基于主观逻辑的方法,通过持续评估安全绩效指标在运行时动态更新置信度,从而增强静态安全案例,其将安全相关的响应性置于精确贝叶斯推理之上。

原作者: Benjamin Herd, Jessica Kelly, Clarissa Heinemann, João-Vitor Zacchi

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Benjamin Herd, Jessica Kelly, Clarissa Heinemann, João-Vitor Zacchi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你已经为自动驾驶汽车的安全性构建了一个非常强大且合乎逻辑的论证。你检查了代码,测试了传感器,并撰写了一份报告,声称:“我们有 95% 的把握这辆车不会撞到施工锥桶。”这就是你的安全论证

问题在于,现实世界是混乱的。这辆车可能会遇到摆放位置奇怪的锥桶、光线不佳的情况,或是你原始测试中未包含的新型路标。你最初的报告就像昨天拍下的快照;它无法知晓此刻正在发生什么。

本文提出了一种方法,在汽车实际行驶过程中,使该安全论证保持“活跃”并实时更新。以下是他们如何通过简单的类比来实现这一点的:

1. “安全评分表”(SPIs)

作者建议不要等到事故发生(那为时已晚),而是使用安全绩效指标(SPIs)。你可以将其视为附加在你论证特定部分的安全评分表

  • 类比:想象你是一位老师,正在批改学生的论文。“设计时论证”是你根据草稿给出的初始分数。而"SPI"则是一个实时监视器,在学生撰写最终版本时对其进行观察。
  • 工作原理:如果学生开始犯某种特定类型的错误(例如忘记将"I"大写),监视器会立即发出警报。在汽车示例中,如果摄像头过于频繁地漏掉锥桶,SPI 就会发出警报。

2. “置信度计”(主观逻辑)

作者使用一种名为主观逻辑的数学工具来衡量置信度。他们不再仅仅说"95% 安全”,而是将置信度分解为三个类别:

  1. 信念:“我认为这是真的。”
  2. 不信:“我认为这是假的。”
  3. 不确定性:“我没有足够的信息来决定。”

类比:想象一个装满弹珠的罐子。

  • 蓝色弹珠代表信念(它是安全的)。
  • 红色弹珠代表不信(它是不安全的)。
  • 透明弹珠代表不确定性(我不确定)。
  • 一个“安全”的论证主要由蓝色弹珠组成,且透明弹珠非常少。

3. “双规则更新系统”

这是核心创新。作者制定了一条特殊规则,用于描述汽车行驶过程中置信度罐子如何变化。他们希望建立一个响应迅速(能快速对危险做出反应)的系统,而不仅仅是统计完美的系统。

他们同时使用两条规则:

  • 规则 A:缓慢积累器(无违规)

    • 发生情况:如果汽车行驶了一段时间且没有漏掉任何锥桶,SPI 监视器就会向罐子中添加几颗蓝色弹珠
    • 效果:你的置信度缓慢增长。透明弹珠(不确定性)会减少,因为你拥有了更多数据。这就像缓慢而稳定的滴水填满水桶。
  • 规则 B:即时惩罚(违规)

    • 发生情况:如果 SPI 监视器检测到违规(汽车漏掉了锥桶),它不仅仅是添加一颗红色弹珠。它会执行突然的、有针对性的交换
    • 效果:它会立即将蓝色弹珠(信念)转化为红色弹珠(不信)。这就像一个“安全警报”,一旦检测到问题,就会立即降低你的置信度。
    • 为何重要:作者表示:“我们不在乎这里的数学是否完美;我们在乎的是安全。”如果安全规则被打破,你需要迅速降低置信度,而不是等待缓慢的统计平均值来赶上。

4. 现实世界测试(施工区域)

为了证明这行之有效,作者在施工区域模拟了一辆自动驾驶汽车。

  • 设置:他们配备了一台旨在识别橙色交通锥桶的摄像头。
  • 测试:他们运行了一个模拟,其中汽车有时会漏掉锥桶(由于阴影或其他车辆遮挡视线)。
  • 结果
    • 当汽车平稳行驶时,“蓝色”置信度增长,“透明”不确定性缩小。
    • 一旦汽车漏掉一个锥桶,置信度急剧下降
    • 当汽车再次平稳行驶时,置信度缓慢回升,但它从未完全恢复到“完美”水平,因为系统记住了那次失误。

总结

本文提出了一种方法,将静态的安全报告转变为鲜活、动态的安全论证

  • 旧方法:“我们测试过这个,它是安全的。”(静态,不发生变化)。
  • 新方法:“我们测试过这个,它是安全的。而且,我们正在实时监控它。如果它表现良好,我们会变得更加自信。如果它哪怕只犯了一次错,我们会立即失去信心,并知道需要修复它。”

这使得工程师和监管机构能够基于实时表现(而不仅仅是过去的测试),确切地看到他们在任何给定时刻可以信任该系统多少。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →