← 最新论文
💻 computer science

UAV-Based Drifting Victim Detection in Flash Floods Using Region-Based Convolutional Neural Networks

本研究提出了一种基于无人机的深度学习系统,该系统利用经过微调的 Mask R-CNN 算法来检测山洪灾害中的漂流受害者,并利用 GPS 元数据估计其运动轨迹,实现了超过 90% 的检测置信度,以增强搜索与救援行动。

原作者: Prima Kristalina, Aries Pratiarso, A. Fauzi Makarim, Munawar Munawar

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Prima Kristalina, Aries Pratiarso, A. Fauzi Makarim, Munawar Munawar

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:基于区域卷积神经网络(R-CNN)的无人机监测闪洪漂流受害者研究

问题陈述
闪洪给搜救(SAR)行动带来了严峻挑战,因为其发生迅速、流速高,且地面团队在基础设施受损的情况下难以进入受灾区域。传统的地面调查通常过于缓慢或具有危险性,而卫星图像则受限于分辨率、重访周期和云层覆盖。尽管无人驾驶飞行器(UAV)提供了高分辨率、灵活的空中监测能力,但生成的视觉数据量巨大,使得人工检查在快速应急响应中变得不切实际。此外,在动态河流环境中检测漂流受害者非常复杂;目标往往体积较小、部分被遮挡,且在视觉上与漂浮碎片相似,这要求除了简单的矩形边界框之外,还需要更精确地描绘空间边界和形状。

研究方法
本研究提出了一种基于深度学习的系统,利用无人机获取的空中视频数据,使用 Mask R-CNN 算法来检测并分割漂流物体(潜在受害者)。该方法遵循一个四阶段流水线:

  1. 数据收集: 创建了一个定制化数据集,包含两个来源:

    • 原始数据: 使用 DJI Mavic Air 2S 无人机在印度尼西亚特洛科尔海洋旅游区(波隆河)不同高度拍摄的 26 个视频文件。这些视频被提取为 589 帧图像。
    • 次级数据: 来源于社交媒体的 463 张图像。
    • 总数据集被划分为训练集、验证集和测试集。对于原始数据集(589 张图像),用于训练的有 515 张,验证的有 48 张,测试的有 25 张。对于次级数据集(463 张图像),划分比例为训练 278 张、验证 93 张、测试 92 张。标注过程使用了“严重”、“中度”和“轻度”等标签来表示洪水状态。
  2. 数据处理: 原始图像经过了严格的预处理流程,包括:

    • 质量检查: 剔除损坏、低分辨率、重复或无关的图像。
    • 标注: 使用边界框对物体进行标记。
    • 调整尺寸: 将输入维度标准化(例如 224×224 或 256×256 像素)以适配 CNN。
    • 归一化: 使用 Min-Max 归一化将像素值从 0–255 缩放到 0–1 范围。
    • 数据增强: 通过水平翻转、旋转、缩放、裁剪以及对亮度、对比度、模糊度和高斯噪声的调整,增加数据集容量。
  3. 模型开发: 系统的核心是一个经过微调的 Mask R-CNN 模型。其架构包括:

    • 骨干网络(Backbone): 用于特征提取的 CNN。
    • 特征金字塔网络(FPN): 用于生成多尺度特征图(P1P1P6P6),能够检测不同尺度的物体。
    • 区域提议网络(RPN): 用于识别候选感兴趣区域(RoI)。
    • RoIAlign: 从提议区域中提取固定维度的特征表示。
    • 预测头(Prediction Head): 执行分类、边界框回归和像素级实例分割。
      本研究将标准 Mask R-CNN(在原始数据集上训练)与在定制化增强数据集上训练的微调版本进行了对比。
  4. 评估: 性能通过平均精度(AP)、平均召回率(AR)、检测置信度和推理时间进行评估。指标针对不同的交并比(IoU)阈值,分别对边界框检测和实例分割进行了评估。

主要贡献
本文概述了三项主要贡献:

  1. 定制化数据集: 开发了一个代表受洪水影响河流环境中漂流受害者状况的局部无人机图像数据集,解决了缺乏特定领域训练数据的问题。
  2. 微调检测框架: 针对空中洪水图像对 Mask R-CNN 模型进行了适配和微调。通过利用实例分割技术,该方法能提供像素级的目标轮廓,与仅依赖标准边界框的方法相比,提供了更优的空间信息。
  3. 快速视觉评估工具: 展示了该系统在地面通道受限的环境中,为提供受害者位置和移动方向的及时空间信息以支持搜救行动方面的潜力。

结果
实验结果表明,在定制化数据集上进行微调的 Mask R-CNN 模型显著优于传统模型:

  • 检测置信度: 微调模型的平均检测置信度超过 90%,而标准模型稳定在 85–89% 左右。
  • 平均精度 (AP):
    • 边界框: 在 IoU 0.5 时,AP 从 54.6%(标准型)提升至 94.94%(微调型)。
    • 分割: 在 IoU 0.5 时,AP 从 52.8%(标准型)提升至 96.94%(微调型)。
  • 平均召回率 (AR): 观察到召回率有显著提升,特别是对于 IoU 0.5 的分割任务,微调模型从 52.8% 上升至 92.9%。
  • 效率: 微调模型将每张图像的平均推理时间从 0.5 秒降低至 0.3 秒。
  • 整体指标: 研究报告检测准确率从 87% 提高到 92%,F1 分数为 0.88,平均精度均值 (mAP) 为 0.82。

意义与主张
作者声称,所提出的方法为估计动态河流环境中的漂流轨迹提供了可靠的物体检测和空间信息。通过利用实例分割,该系统能够比仅依赖边界框的方法更有效地区分受害者与视觉相似的碎片。研究将此技术定位为一种可行的快速空中侦察工具,能够在具有高水流速度和复杂地形的闪洪条件下,为应急响应中的决策提供支持。作者保持了审慎的范围界定,指出虽然系统有效,但在弱光场景和相机快速移动时仍存在检测误差,未来的工作应侧重于在多样化的真实世界搜救场景中验证性能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →