← 最新论文
🤖 AI

Coverage-Driven Verification for Safety-by-Design in AI-Based Collision Avoidance Systems

本文提出了一种用于评估基于人工智能的航空安全系统中运行设计域(ODD)代表性的结构化工程流程,通过利用库尔贝克-莱布勒散度(Kullback-Leibler divergence)和克拉默-沃系数(Cramér's V)来定量评估数据覆盖度是否符合欧洲航空安全局(EASA)的安全标准,并已通过机载冲突避免模拟进行了验证。

原作者: Thomas Stefani, Johann Maximilian Christensen, Elena Hoemann, Frank Köster, Sven Hallerbach

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Thomas Stefani, Johann Maximilian Christensen, Elena Hoemann, Frank Köster, Sven Hallerbach

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在头顶的天空中,航空业的未来正由代码书写。随着人工智能承诺让飞机变得更加安全和高效,一个关键问题仍然存在:我们如何知道这些智能系统在遇到意外情况时会表现得正确?答案不仅在于测试软件,更在于理解该软件旨在导航的世界。每一个智能系统都在一组特定的条件内运行,即一个被称为“运行设计域”(operational design domain)的定义好的可能性空间。对于避撞系统而言,这个领域包括从飞机的速度到其与其他飞机之间的距离等所有要素。安全监管机构要求证明用于训练和测试这些系统的数据确实代表了真实世界。如果训练数据存在偏差或不完整,系统在遇到从未见过的场景时可能会失效。工程师面临的挑战是证明其数据覆盖了所有可能的场景范围,并且这些场景出现的频率符合现实——当处理数百万个数据点和复杂的高维空间时,这项任务变得异常困难。

德国航空航天中心的一组研究人员开发了一种新方法来解决这个问题,专门针对基于人工智能的避撞系统。他们专注于两个特定的系统:一个负责处理水平机动以避免碰撞,另一个负责管理垂直爬升和下降。这些系统依赖于神经网络,根据相对速度、距离以及距离最近接近点的时间等输入做出瞬时决策。研究人员提取了从以往实验中生成的数百万个模拟飞行场景,并提出了一个简单而深刻的问题:我们拥有的数据是否真的看起来像我们预期飞行的那个世界?他们不仅仅是在统计测试了多少种不同的情况,还在检查数据的统计形状是否符合预期的分布。在他们的模拟中,他们发现虽然有些数据集覆盖了所有可能的取值范围,但这些数值的分布方式往往是错误的。例如,在其中一个系统中,数据显示飞机几乎总是处于稳定的高度飞行,而安全模型假设的是更为多样化的爬升和下降行为。这种不匹配意味着系统是在一个扭曲的现实版本上进行测试,可能导致其在面对罕见但危险的事件时准备不足。

为了衡量这种不匹配,该团队评估了几种统计工具。他们首先尝试了一种被称为卡方检验(chi-squared test)的传统方法,该方法常用于比较数据集。然而,他们发现当面对现代模拟产生的大量数据时,这一工具会失效。由于该测试对样本量极其敏感,它会将微小的、无害的差异标记为重大错误,本质上是在数据实际上相当不错的情况下,却大声疾呼数据是错误的。这导致研究人员在这一特定应用中拒绝了传统的测试方法。相反,他们采用了两种更稳健的度量标准,这些标准可以处理大规模数据集而不被其庞大的体积所误导。这些度量标准就像一个天平,称量观测数据与预期目标分布之间的差异,以观察这种差距是显著的还是仅仅是微小的波动。通过使用这些工具,他们能够区分出哪些数据仅仅是不同,哪些数据是具有危险性的、不具代表性的。

他们的分析结果揭示了两种不同类型的覆盖范围之间的明确界限。第一种类型,他们称之为“完备性”(completeness),它仅仅询问是否至少触及了每一种可能的场景。另一种则是“代表性”(representativeness),它询问场景出现的比例是否正确。研究人员发现,一个数据集可以是完备的——即覆盖了运行空间的每一个角落——但仍可能因为数据聚集在错误的地方而无法通过代表性的测试。在涉及潜在碰撞时间的特定案例中,数据完美匹配了预期的均匀分布,获得了最高评分。而在涉及垂直速度的另一个案例中,数据高度集中在零附近,未能代表系统需要准备应对的极端爬升和下降行为。这种区别至关重要:如果数据不能反映现实世界中这些情况发生的频率,那么拥有每种可能情况的数据也是不够的。

论文得出结论,单一指标不足以保证安全性。相反,需要一个两步走的过程。首先,工程师必须确保数据填满了整个运行空间,检查是否存在任何空白。其次,他们必须验证数据的统计形状是否正确,使用新的度量标准来确认分布是否符合安全要求。这种方法提供了一种验证人工智能系统的结构化方式,超越了简单的测试,转向了更深层次的统计保障。通过将此方法应用于避撞模拟,研究人员证明了定量评估人工智能系统是否是在一个公平且准确的空中景象上进行训练是可能的。他们的工作为监管机构和工程师为人工智能系统的认证提供了一条路径,确保保护我们未来飞行的技术是建立在真正代表其飞行世界的现实数据基础之上的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →