← 最新论文
💻 computer science

Using an On-Device VLM-Based Edge Computing System for Real-Time Disaster Detection

本研究表明,一种在树莓派 5 上利用视觉语言模型(Gemma3-4B)构建的设备端边缘计算系统,在实时灾害检测的准确率上超过了微调后的 CNN 基准模型 10% 以上,同时实现了自然语言响应生成,并提升了能源效率和网络独立性。

原作者: Brennan Park

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Brennan Park

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:基于端侧 VLM 的边缘计算用于实时灾害检测

问题陈述
传统的自然灾害检测系统依赖于用于图像分类的卷积神经网络(CNN)。虽然 CNN 非常有效,但通常需要针对特定数据集进行大量的微调才能实现高精度,并且缺乏生成自然语言响应或在检测后灵活与其它传感器集成的能力。相反,视觉语言模型(VLM)提供了多模态理解和自然语言生成能力,但人们通常认为其计算量过大,难以在资源受限的边缘设备上进行实时部署。本研究旨在解决一个验证问题:即在完全依靠资源受限的边缘硬件运行时,VLM 是否能够达到甚至超过 CNN 在灾害检测方面的推理性能,从而实现零样本(zero-shot)检测以及无需网络依赖的基于自然语言的下游任务。

研究方法
本研究采用端侧边缘计算环境进行,以确保实时适用性和能源效率。

  • 硬件: 所有推理实验均在树莓派 5(Raspive Pi 5)上执行,以模拟低成本、可扩展的边缘设备。
  • 数据集: 研究使用了 AIDER(用于应急响应应用的航空图像数据集),并筛选出四个灾害相关类别:火灾、洪水、建筑坍塌和交通事故。“正常情况”被排除在外。
  • 模型:
    • 基准(CNNs): 评估了三种架构:GoogLeNet (Inception v1)、ResNet-18 和 MobileNet V2。
    • 实验组(VLM): Gemma 3(4B 参数版本),这是一种能够处理文本和图像的多模态模型。
  • 实验设计:
    • 公平性控制: 为了与零样本 VLM 进行公平比较,CNN 首先使用未经 AIDER 数据集暴露的 ImageNet 预训练权重进行评估。
    • 微调对比: 随后在 AIDER 数据集上对 CNN 进行微调(每类 80 张图像用于训练,20 张用于验证),以建立性能上限基准。
    • 可复现性: 实验在五个不同的随机种子(42–46)下运行,以排除偶然性差异。
    • 指标: 使用准确率(Accuracy)和 F1 分数(F1 Score)衡量性能。

关键结果

  • ImageNet 预训练 CNNs: 在未经过微调的情况下,CNN 模型的表现较差,准确率在 0.20 到 0.35 之间,F1 分数在 0.10 到 0.30 之间。这表明,如果没有针对性的适配,标准的 ImageNet 权重不足以应对特定的灾害分类任务。
  • 微调后的 CNNs: 在 AIDER 数据集上进行微调后,CNN 的性能显著提升。ResNet-18 在所有 CNN 中表现最佳(准确率达到 0.8 以上的高位),其次是 MobileNet V2 和 GoogLeNet。所有微调后的模型都稳定在 0.85–0.90 的准确率范围内。
  • 零样本 VLM (Gemma 3): 在未针对 AIDER 数据集进行任何训练的零样本设置下,Gemma 3 模型在所有种子下的准确率和 F1 分数均稳定在 0.92 至 0.94 之间。
  • 对比性能: VLM 的表现比 ImageNet 预训练的 CNN 高出约 60 个百分点(0.92–0.94 对比 0.20–0.35)。至关重要的是,VLM 的零样本性能与微调后的 CNN 相当,在某些种子下甚至略优。VLM 展示了稳定的性能,不受数据划分的影响,这表明其在大规模预训练过程中学习到的灾害相关视觉模式具有强大的泛化能力。

意义与主张
本文主张,VLM 是实时灾害检测中一种可行且可能更优的替代方案,可用于边缘设备。其主要意义体现在三个方面:

  1. 性能可行性: 研究证明,一个 4B 参数的 VLM 可以在树莓派 5 上实现高精度的灾害检测,且无需针对特定数据集进行微调,这挑战了“VLM 过重或需要大量重训练才能处理边缘任务”的观点。
  2. 运行效率: 通过完全在设备端运行,该系统确保了在网络连接受限或完全没有网络的情况下的功能性,这是灾害响应中的关键因素。
  3. 功能扩展: 不同于仅输出类别标签的传统 CNN,基于 VLM 的系统支持自然语言响应生成。这使得它能够灵活地与其他传感器集成,并实现潜在的自动化、语言驱动的下游行动(例如,直接在边缘端进行基于语音或文本的报告)。

作者承认了局限性,特别是由于树莓派 5 的内存限制,无法测试更大的模型(如 DeepSeek、GPT),并指出性能差距可能会随数据构成不同而变化。然而,研究结论认为,对于部署时间及成本是关键因素的即时部署场景,VLM 相比传统的 CNN 流水线具有显著优势。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →