← 最新论文
🤖 machine learning

AVERY: Intent-Driven Adaptive VLM Split Computing via Embodied Self-Awareness for Efficient Disaster Response Systems

本文提出了 AVERY 框架,通过引入以操作员意图为核心的自适应分割计算机制,利用功能与深度相结合的双流架构及自感知控制器,在资源受限的灾难响应无人机上实现了高效、低能耗且具备实时可查询能力的视觉语言模型部署。

原作者: Rajat Bhattacharjya, Sing-Yao Wu, Hyunwoo Oh, Chaewon Nam, Suyeon Koo, Mohsen Imani, Elaheh Bozorgzadeh, Nikil Dutt

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Rajat Bhattacharjya, Sing-Yao Wu, Hyunwoo Oh, Chaewon Nam, Suyeon Koo, Mohsen Imani, Elaheh Bozorgzadeh, Nikil Dutt

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 AVERY 的智能系统,它的目标是让无人机(UAV)在灾难现场(如洪水、地震、火灾)变得更聪明、更省电,同时还能听懂人类的指令。

为了让你更容易理解,我们可以把这场“灾难救援”想象成在一个信号很差、电力有限的灾区,派出一位“空中侦察兵”去执行任务

1. 现在的困境:侦察兵太“笨”或太“累”

  • 传统的无人机(CNN 模型): 就像一位只会数数的侦察兵。他能看到“那里有水”、“那里有火”,但他听不懂人话。如果你问他:“帮我找一下那些半淹在水里但还能开车过去的车在哪里?”他只能给你一堆乱七八糟的标签,完全无法理解你的具体意图。
  • 现在的超级大脑(VLM 模型): 就像一位博学的教授,能听懂复杂的指令,能进行推理(比如“找被困在倒塌房屋附近的人”)。但是,这位教授太娇贵了
    • 太费电: 让他全程在无人机上工作,无人机电池几分钟就耗尽了。
    • 太费网: 如果让他把看到的所有高清画面都传回地面指挥中心处理,灾区那像“漏勺”一样的网络根本传不动,画面会卡死,指令会延迟。

核心问题: 我们既需要这位“教授”的智慧,又受限于无人机的“小电池”和灾区的“烂网络”。

2. AVERY 的解决方案:双轨制 + 智能管家

AVERY 提出了一种全新的“分头行动”策略,它不再把任务看作非黑即白(要么全在无人机做,要么全在云端做),而是引入了两个核心概念:“双流架构”“意图驱动”

概念一:双流架构(两条腿走路)

想象这位“教授”其实有两条腿,分别负责不同的任务:

  1. Context Stream(情境流)—— 像“瞭望塔”:

    • 特点: 速度快、分辨率低、非常省电。
    • 作用: 就像瞭望塔上的哨兵,快速扫视全场。如果你问:“这片区有危险吗?”或者“大概情况怎么样?”,哨兵能立刻给你一个粗略但及时的回答。
    • 比喻: 就像你开车时看后视镜,不需要看清车牌号,只需要知道“后面有车”就行。
  2. Insight Stream(洞察流)—— 像“法医/侦探”:

    • 特点: 速度慢、分辨率高、非常费电、需要大量数据。
    • 作用: 当你需要精确细节时,比如“把那个屋顶上被困的人圈出来”,侦探就会出动。他会仔细分析图像,画出精确的轮廓。
    • 比喻: 就像你需要看清车牌号或人脸细节时,必须把车停下来,拿出放大镜仔细查看。

概念二:意图驱动(听指挥,不瞎忙)

这是 AVERY 最聪明的地方。以前的系统不管你说什么,都按同一种方式处理。但 AVERY 有一个**“智能管家”( onboard controller),它会先听你的意图**:

  • 场景 A: 你问“这附近有没有火?”
    • 管家判断: 这是一个“粗略”问题。
    • 行动: 直接启动**“瞭望塔”(情境流)**。只传回简单的文字或低清图,瞬间完成,极省电。
  • 场景 B: 你问“把那个被困在屋顶的人圈出来,我要派救援队去。”
    • 管家判断: 这是一个“精确”问题,必须用**“侦探”(洞察流)**。
    • 行动: 启动高算力模式。但此时,管家会立刻检查网络状况:
      • 如果网络好,就传高清数据。
      • 如果网络变差了(比如暴雨导致信号变差),管家会自动压缩数据(就像把文件打包成 ZIP),或者只传最关键的部分,确保即使画质稍微下降,也能在几秒钟内把“救人”这个关键信息传回来,而不是让画面卡住不动。

3. 为什么这很厉害?(用比喻总结)

  • 以前的做法: 就像不管你是要问路还是要找失物,都强制派一辆重型卡车(全功能 VLM)去送。结果要么卡车太慢(延迟高),要么油耗太大(无人机没电),要么路太窄(网络堵塞)卡车进不去。
  • AVERY 的做法: 派了一个灵活的快递团队
    • 如果是问路,派一辆自行车(情境流),嗖的一下就到了,不费油。
    • 如果是送贵重物品(精细分析),派一辆小货车(洞察流)。如果路堵了,小货车会自动把货物压缩打包,或者换一条小路,确保货物(关键信息)能准时送到,而不是堵在路上。

4. 实验结果:真的管用吗?

研究人员在模拟的灾难环境中测试了 AVERY(使用 LISA-7B 模型):

  • 更准: 比传统的“只压缩图片传回云端”的方法,准确率提高了 11.2%
  • 更省: 比让无人机自己全算(全本地执行),能耗降低了 93.98%(这意味着无人机能多飞很久!)。
  • 更稳: 在网络忽好忽坏的情况下,AVERY 的准确率几乎和“完美网络下的最高精度”一样(只差了 0.75%),但传输速度却快得多。

总结

AVERY 就像是给灾难救援无人机装上了一个**“懂变通的超级大脑”。它不再死板地执行任务,而是根据“你想干什么”(意图)和“现在路况怎么样”**(网络/电量),灵活地在“快速粗略扫描”和“精细深度分析”之间切换,并自动调整传输策略。

这让无人机在信号差、电量少的灾区,也能像一位经验丰富的老侦察兵一样,既听得懂人话,又能在关键时刻把救命信息传回来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →