LiteVLA-H: Dual-Rate Vision-Language-Action Inference for Onboard Aerial Guidance and Semantic Perception
本文介绍了 LiteVLA-H,这是一个专为 NVIDIA Jetson AGX Orin 机载部署优化的紧凑型 2.56 亿参数视觉 - 语言 - 动作模型,它通过一种专门的知识保留微调策略,将快速反应引导(50.65 毫秒)与较慢的语义叙述解耦,从而实现低延迟的双速率推理。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一架无人机由一名飞行员驾驶。这名飞行员同时承担着两项截然不同的任务:
- 瞬间反应以避免撞向树木或建筑物(如同反射动作)。
- 思考并描述周围正在发生的情况,例如向地面人员报告:“我看到前方有一条红色跑道,左侧存在危险”(如同对话)。
长期以来,试图让无人机用单一的“大脑”(一个 AI 模型)同时完成这两项任务一直是个难题。AI 要么反应太慢导致撞机,要么过于简单而无法理解场景(让无人机对细节视而不见)。
本文介绍了LiteVLA-H,这是一个旨在通过充当双模式飞行员来解决该问题的新系统。
核心问题:“大脑”瓶颈
将 AI 模型想象成厨房里的厨师。
- 旧方法: 每当厨师接到订单,他们必须走到储藏室,找到食材,切好,然后才开始烹饪。如果你要求一份快餐(单个动作)或一顿盛宴(长篇描述),厨师都必须先进行同样的漫长“储藏室之旅”。这篇论文将这种“走向储藏室”的过程称为预填充(pre-fill)。它占据了大部分时间。
- 问题所在: 如果飞行员需要躲避树木时,厨师每次都试图准备一顿全席,飞行员就会因为厨师忙于切洋葱而撞机。
解决方案:“双速率”调度器
LiteVLA-H 改变了规则。它认识到,对于无人机而言,“走向储藏室”(预填充)是缓慢的部分,但一旦食材取出,烹饪单个鸡蛋(一个快速动作)几乎是瞬间完成的。
该系统使用一个调度器(交通管理员),将工作分为两条车道:
快车道(反应式引导):
- 作用: 当无人机看到障碍物时,它向 AI 请求一个快速的“向左转”或“向上飞”指令。
- 速度: 它每秒执行约20 次(每 50 毫秒一次)。
- 技巧: AI 仅生成一个微小的“动作令牌”(如“左”这样的单个词)。它不需要等待写出完整的句子。因为“走向储藏室”已经完成,所以这发生得极快。
慢车道(语义感知):
- 作用: 每隔几秒,AI 稍作停顿,生成完整的句子:“我正接近一条左侧有红灯的跑道。”
- 速度: 它每秒执行约6 次(每 150 毫秒一次)。
- 益处: 这为人类操作员或无人机的日志提供了丰富的世界描述,而不会拖慢快车道。
“厨房”类比的实际应用
想象无人机正飞越繁忙的城市。
- 快车道就像飞行员操纵杆上的手。如果一只鸟飞在前面,飞行员的手会瞬间移动。AI 只需说“向上!”,无人机随即做出反应。
- 慢车道就像飞行员与塔台的对话。“塔台,我看到一个施工区,我将绕行。”这需要几秒钟来说,但对于安全和态势感知至关重要。
LiteVLA-H 证明了两者兼得是可能的。它既不会迫使飞行员在躲避飞鸟时停止说话,也不会迫使飞行员在讲述故事时停止躲避。
他们如何训练 AI
为了确保 AI 不会因只学习躲避而变得“愚蠢”,研究人员使用了一种特殊的训练配方。
- 他们不仅向 AI 展示了无人机撞机和躲避的视频。
- 他们还展示了通用图片和描述(如一张配有“地毯上的猫”说明的猫的照片)以及空中描述(如“有雾的跑道”)。
- 他们将这些混合在一起,使 AI 能够同时学会成为一名优秀的飞行员和一名优秀的讲述者。这被称为“知识保留”,意味着它不会因为学会了飞行而忘记如何说话。
结果
该团队在无人机内置的小型计算机(NVIDIA Jetson AGX Orin)上对此进行了测试。
- 速度: “快车道”运行在19.74 Hz(每秒近 20 次)。这足以保持无人机的稳定和安全。
- 感知: “慢车道”运行在6.67 Hz,提供持续的描述流。
- 对比: 与其他先进的 AI 系统相比,LiteVLA-H 在提供“躲避”指令时快得多,因为它不再试图在需要瞬间决策的每次时刻都写出一篇完整的文章。
结论
该论文声称,对于无人机而言,首次反应的速度是最重要的。通过认识到“准备时间”(预填充)是最大的延迟,他们构建了一个将“反射”与“对话”分离的系统。这使得一个小型、紧凑的 AI 能够在安全驾驶无人机的同时,仍能向人类操作员描述世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。