✨ 要点🔬 技术摘要
在仓库的静谧嗡鸣声中,或是在家中杂乱的角落里,一种新型机器人正在学习倾听。多年来,科学家们一直试图教会机器理解人类语言并据此采取行动,这一领域被称为视觉-语言导航(vision-language navigation)。其理念非常简单:一个人说“去红色的椅子那里”,机器人便会弄清楚那把椅子在哪里,然后飞向或驶向那里。虽然这在受控的计算机模拟中表现良好,但要让它在一台真实的飞行机器人上实现则是另一回事。机器人必须观察世界、理解词汇、规划一条安全的飞行路径并控制其电机,同时还要携带自己的计算机和电池。如果机器人在理解词汇时出错,或者在计算转弯时失误,就可能发生坠毁。挑战在于构建一个既足够聪明以遵循指令,又足够安全以无需人类持续监督即可飞行的系统。
圣保罗大学的一组研究人员构建了一个名为“空中视觉-语言导航”(VLN on the Fly)的系统来解决这个问题。他们并没有尝试教一个单一的、庞大的计算机程序一次性完成所有工作,而是将这项任务分解为三个协同工作的清晰步骤,就像一场接力赛。首先,一个专门的语言模型通过查看摄像机画面和口头指令,寻找目标物体可能存在的概略区域。第二,一个规划系统获取该概略区域,并利用深度信息计算出一条平滑且安全的 3D 空中路径。第三,一个经过训练的控制策略接收该路径,并直接指挥无人机的电机进行跟随。这种分步处理的方法让研究人员能够检查过程中的每一个环节,确保如果某一步骤失败,系统能准确知道问题所在,并在发生碰撞前停止运行。
研究人员在配备了摄像机和紧凑型车载计算机的小型四旋翼无人机上测试了这个系统。他们在房间里放置了垃圾桶、椅子和灭火器等日常物品,并根据语音指令要求无人机飞向它们。在十五次独立的飞行测试中,无人机在十三次中成功到达了目标点。到达时,它与预定位置的平均距离小于六厘米。即使在无人机需要绕过障碍物的情况下,该系统也表现出色,成功规划了避开拥挤环境中碰撞的路径。整个过程都在无人机自身运行,仅使用了约 39% 的车载计算机算力,这为其他任务留下了充足的空间。
最重要的发现之一是该系统如何处理不确定性。语言模型并不试图精准定位物体的某个像素点(这容易出错),而是将摄像机视野划分为一个简单的网格,并选择物体可能存在的概略单元格。这种粗略的处理方式被证明更加可靠。当系统在充满障碍物的房间中进行测试时,它在大多数尝试中都成功避免了碰撞。在少数未能到达目标的案例中,通常是因为物体移出了摄像机的视野,或是深度传感器无法探测到足够远的距离,而不是因为无人机失去了控制。研究人员还发现,该系统可以区分不同的物体,即使在同一个房间内,当被要求找椅子时能正确识别出椅子,要求找垃圾桶时也能正确识别出垃圾桶。
该项目的成功凸显了自主机器人构建方式的一种转变。这项工作表明,与其依赖一个试图同时学习一切的单一且复杂的神经网络,不如将理解、规划和控制的任务分开,这样可以获得更安全、更可靠的结果。通过保持步骤的独立性,研究人员可以验证无人机不仅仅是在猜测,而是真正遵循着从口头指令到物理运动的逻辑路径。尽管该系统仍存在局限性,例如需要看到物体才能找到它,以及依赖深度传感器的量程,但它证明了飞行机器人很快就能被信任在复杂的室内空间中利用简单的自然语言进行导航,为检查、交付和搜救领域的未来应用打开了大门。
技术摘要:空中视觉-语言导航 (VLN on the Fly)
问题陈述 将视觉-语言导航(VLN)完全部署在无人机载端面临着显著挑战,这主要是由于计算资源有限以及单阶段系统中难以隔离错误。虽然端到端的视觉-语言-动作(VLA)模型直接将原始观测和指令映射为控制命令,但它们往往会牺牲模块化架构所固有的可观测性和安全性检查。在物理自主系统中,特别是对于无人机而言,实现指令的落地不仅需要语义理解,还需要根据飞行器动力学和安全约束进行验证。当这些阶段被融合进单个网络时,故障变得难以定位,且标准的安全机制(如碰撞检查、可行性测试和恢复行为)也难以强制执行。此外,将分层架构与飞行控制器集成到嵌入式硬件上的研究仍处于探索阶段。
方法论 作者提出了 VLлоN on the Fly ,这是一个机载的、解耦的导航栈,它将落地(grounding)、规划和控制保持为独立的、可检查的阶段。该系统完全在机器人端运行,无需离线计算或端到端训练。其架构由三个主要处理阶段组成,并由一个安全监督器进行协调:
基于 VLM 的目标落地:
系统采用量化视觉-语言模型(Qwen-3.5-2B, INT4)来处理第一视角 RGB 帧和自然语言指令。
该模型并非进行像素级落地,而是识别包含目标的 3 × 3 3 \times 3 3 × 3 图像网格中的九个粗略区域之一。
选定的网格单元通过其中心像素的中值深度值映射为 3D 目标。该点被反投影到相机坐标系中,并利用当前位姿转换到地图坐标系中。
为了确保安全,目标高度被限制在当前飞行高度附近的窄带内。
安全监督器:
一个有限状态机充当 VLM 与规划器之间的守门员。
它根据初始起飞位置定义的边界运行体积来验证候选目标。
为了防止不稳定的指令,监督器要求在置信度阈值之上,连续三次预测结果位于同一网格区域后,才会接受该目标。
它还根据基于机载占据地图的规划器可行性报告,来控制轨迹的执行。
3D 规划与低层控制:
EGO-Planner 生成平滑且动力学可行的 3D B 样条轨迹。它利用从深度数据构建的局部占据地图进行避障,而无需完整的欧几里得符号距离场(ESDF)。
RAPTOR 是一个预训练的强化学习策略,作为低层控制器。它将位置设定值和本体感受数据直接映射为电机指令,能够在无需重新训练的情况下实现不同四旋翼飞行器的零样本适配。这取代了传统的经人工调优的位置-姿态级联控制。
核心贡献
机载解耦架构: 一个完全机载的无人机 VLN 栈,结合了用于开放词汇落地的量化 VLM、用于 3D B 样条规划的 EGO-Planner 以及用于低层控制的预训练 RL 策略,且无需端到端训练或离线计算。
轻量化安全监督器: 一种利用有限状态机的机制,用于拒绝超出运行范围的目标,并根据规划器的可行性对轨迹执行进行门控,从而确保整个分层流水线的安全性。
实飞可行性评估: 在涉及三个不同参照物的开放词汇目标任务中,对完整的技术栈进行了全面的评估,证明了由于模块化设计,可以将故障归因于特定的阶段。
实验结果 系统在一个配备了 Intel RealSense D435i 相机和机载 Jetson Orin NX 的定制四旋翼无人机(MIRA)上进行了评估,在受控的室内空间内飞行。
成功率: 在针对三个参照物(垃圾桶、椅子、灭火器)的 15 次飞行中,该技术栈在 13 次尝试中到达目标(成功率 87%)。
精度: 平均目标误差为 5.72 厘米。垃圾桶任务实现了 100% 的成功率且目标误差为零。
性能: 量化后的 VLM 实现的中值推理时间为 0.7 9 秒,在维持 0.5 Hz 查询频率的同时,为规划器和策略留出了充足的计算资源。平均 GPU 利用率为 39.3%。
复杂环境: 在包含障碍物的 6 次额外试验中,系统在 3 次运行中成功追踪了无碰撞轨迹。在 2 次运行中,安全层因深度/边界违规正确阻止了执行。在 1 次运行中,飞行器避开了障碍物,但由于追踪偏差未能达到目标半径。
消融实验: 研究发现 3 × 3 3 \times 3 3 × 3 网格分辨率是最优选择,它提供了 100% 的有效目标率,且与更细的网格或单像素落地相比,具有显著降低的选择抖动。
意义与主张 论文声称,VLN on the Fly 证明了在保持模块化架构的安全性与可观测性的同时,在无人机上运行复杂的、开放词汇导航任务的可行性。通过将语义推理与度量规划及低层控制解耦,该系统允许在实际飞行期间检查中间状态(落地、目标投影、规划),这对于调试和安全保障至关重要。
作者谦虚地指出,目前的实现依赖于固定高度飞行和外部里程计(OptiTrack)进行定位。他们承认深度反投影受限于传感器量程和无效深度区域,且异步设计意味着落地误差会在下一次查询前持续存在。然而,这项工作为通过补充传感和在感知不确定性与轨迹生成之间建立更紧密的耦合来提高鲁棒性奠定了基础。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。